Skip to content
Bencher

TestsBenchmarks · Agentic

Terminal-Bench 2.0

Agentic tasks in a command-line environment (planning, iteration, tool use).

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 12 · 12 models tested

Top 12 · best setting per model · 12 models, 16 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Terminal-Bench 2.0 leaderboard
Thinking levelSetting
1GPT-5.5OpenAI82.7%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗Codex23 Apr 2026
2GPT-5.4OpenAI75.1%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
3Qwen3.7 PlusQwen (Alibaba)70.3%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Terminus 2 (Harbor)21 May 2026
4Qwen3.7 MaxQwen (Alibaba)69.7%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗Terminus 2 (Harbor)16 May 2026
5Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)68.5%HighThinking (High)Maker's own figureVendor-reportedGoogle ↗Terminus-219 Feb 2026
6DeepSeek V4 Pro (Preview, 0423)DeepSeek67.9%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
7Kimi K2.6Moonshot AI (Kimi)66.7%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Terminus 220 Apr 2026
8GLM-5.1Z.ai (Zhipu)63.5%DefaultthinkingMaker's own figureVendor-reportedZ.ai ↗Terminus 27 Apr 2026
9Qwen3.6 PlusQwen (Alibaba)61.6%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Terminus 2 (Harbor)2 Apr 2026
10Qwen3.6 27BQwen (Alibaba)59.3%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Terminus 2 (Harbor)22 Apr 2026
11MiniMax M2.7MiniMax57.0%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—18 Mar 2026
12DeepSeek V4 Flash (Preview, 0423)DeepSeek56.9%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026