Skip to content
Bencher

TestsBenchmarks · Agentic

Terminal-Bench 2.1

Share of 89 containerized command-line tasks an agent completes; a fixed revision of Terminal-Bench 2.0, now archived and near ceiling.

% solvedHigher is betterToo easy now: the top models all score near perfectSaturatedThe test's websiteOfficial page ↗

The best 15 · 68 models tested

Top 15 · best setting per model · 68 models, 120 results (97 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Terminal-Bench 2.1 leaderboard
Thinking levelSetting
1GPT-5.6 SolOpenAI91.9%DefaultGPT-5.6 Sol Ultra (4 parallel agents)Maker's own figureVendor-reportedOpenAI ↗Codex9 Jul 2026
2Claude Fable 5.1Anthropic91.4%MaxClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
3DeepSeek V4.1 FlashDeepSeek90.6%Maxreasoning_effort=100 (max)Maker's own figureVendor-reportedDeepSeek ↗DeepSeek Harness (Minimal)10 Sep 2026
4GPT-6 AstraOpenAI89.9%HighGPT-6 Astra (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
5Gemini 3.8 FlashGoogle (Gemini / DeepMind)89.4%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗Terminus 22 Sep 2026
6Claude Opus 5Anthropic89.1%MaxClaude Opus 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
7Qwen3.8 Max (0902)Qwen (Alibaba)88.8%DefaultQwen3.8 Max (0902)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
8Grok 4.6SpaceXAI (formerly xAI)88.4%HighGrok 4.6 (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
9GPT-5.6 TerraOpenAI88.0%MaxGPT-5.6 Terra (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
10Claude Opus 5.5Anthropic87.6%Higheffort=highIndependent testIndependentVals.ai ↗Terminus 227 Sep 2026
11Qwen3.8 Max (0803)Qwen (Alibaba)86.6%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
12Qwen3.8-Flash-NextQwen (Alibaba)86.1%DefaultQwen3.8-Flash-NextIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
13Gemini 3.7 FlashGoogle (Gemini / DeepMind)85.8%HighGemini 3.7 Flash (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
14Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)85.4%Extra highMuse Spark 1.3 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
15Kimi K3Moonshot AI (Kimi)85.0%MaxKimi K3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
16Claude Opus 4.8Anthropic84.6%MaxClaude Opus 4.8 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
17Claude Fable 5Anthropic84.6%MaxClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
18GLM-5.3-FlashZ.ai (Zhipu)84.3%DefaultGLM 5.3 FlashIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
19GPT-5.5OpenAI84.3%Extra highGPT-5.5 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
20GLM-5.3Z.ai (Zhipu)83.9%MaxGLM-5.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
21GPT-6 SolOpenAI83.2%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗Terminus 227 Sep 2026
22Claude Sonnet 5.5Anthropic83.2%Higheffort=highIndependent testIndependentVals.ai ↗Terminus 227 Sep 2026
23Claude Opus 4.7Anthropic83.1%MaxClaude Opus 4.7 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
24Qwen3.8 2.4T A95B (open weights)Qwen (Alibaba)82.0%DefaultQwen3.8 2.4T A95BIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
25Grok 4.5SpaceXAI (formerly xAI)81.6%HighGrok 4.5 (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
26GLM-5.2Z.ai (Zhipu)81.0%Defaultthinking (effort not stated)Maker's own figureVendor-reportedZ.ai ↗Terminus 216 Jun 2026
27GPT-5.6 LunaOpenAI80.9%MaxGPT-5.6 Luna (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
28Claude Sonnet 5Anthropic80.5%MaxClaude Sonnet 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
29Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)80.1%Extra highMuse Spark 1.2 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
30Qwen3.8 27BQwen (Alibaba)79.8%Extra highQwen3.8 27B (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
31DeepSeek V4 Pro (0813)DeepSeek78.7%MaxDeepSeek V4 Pro 0813 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
32DeepSeek V4 Flash (0731)DeepSeek78.7%MaxDeepSeek V4 Flash 0731 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
33GPT-5.4OpenAI78.3%Extra highGPT-5.4 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
34Gemini 3.6 FlashGoogle (Gemini / DeepMind)78.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗Terminus 221 Jul 2026
35Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)77.9%Extra highMuse Spark 1.1 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
36MiMo-V2.6-FlashXiaomi MiMo76.4%DefaultIndependent testIndependentVals.ai ↗Terminus 227 Sep 2026
37Gemini 3.5 FlashGoogle (Gemini / DeepMind)76.2%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗Terminus 219 May 2026
38Qwen3.7 MaxQwen (Alibaba)74.5%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
39DeepSeek V4 Flash Vision ExpDeepSeek74.2%MaxDeepSeek V4 Flash Vision (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
40Gemini 3 ProGoogle (Gemini / DeepMind)73.9%DefaultIndependent testIndependentSnorkel AI / Terminal-Bench ↗Terminus 21 Oct 2026
41Grok 4.7SpaceXAI (formerly xAI)73.4%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗Terminus 227 Sep 2026
42GPT-6 LunaOpenAI73.0%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗Terminus 227 Sep 2026
43DeepSeek V4 Pro (Preview, 0423)DeepSeek72.1%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
44Muse SparkMeta (Meta Superintelligence Labs, Muse)67.3%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
45Claude Sonnet 4.6Anthropic67.0%Highadaptive thinking, effort=highMaker's own figureVendor-reportedAnthropic ↗mini-SWE-agent (GKE)30 Jun 2026
46Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)65.8%DefaultIndependent testIndependentSnorkel AI / Terminal-Bench ↗Gemini CLI1 Oct 2026
47MiniMax M3MiniMax65.2%DefaultMiniMax-M3Independent testIndependentArtificial Analysis ↗—1 Oct 2026
48Hy3Tencent Hunyuan64.4%DefaultHy3Independent testIndependentArtificial Analysis ↗—1 Oct 2026
49Qwen3.7 PlusQwen (Alibaba)64.0%Defaultsetting not statedMaker's own figureVendor-reportedQwen (Alibaba) ↗Terminus 214 Aug 2026
50Qwen3.6 27BQwen (Alibaba)63.4%Defaultsetting not statedMaker's own figureVendor-reportedQwen (Alibaba) ↗Terminus 214 Aug 2026
51DeepSeek V4 Flash (Preview, 0423)DeepSeek61.8%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
52GLM-5.1Z.ai (Zhipu)58.7%DefaultIndependent testIndependentSnorkel AI / Terminal-Bench ↗Claude Code1 Oct 2026
53Gemini 3.5 Flash-LiteGoogle (Gemini / DeepMind)54.0%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗Terminus 221 Jul 2026
54Nemotron 3 UltraNVIDIA53.9%DefaultNemotron 3 Ultra 550B A55B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
55Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)51.7%HighMuse Glimmer (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
56MiniMax M2.7MiniMax51.1%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗Terminus 21 Jun 2026
57Mistral Medium 3.5Mistral AI50.6%DefaultMistral Medium 3.5Independent testIndependentArtificial Analysis ↗—1 Oct 2026
58Qwen3.6 35B A3BQwen (Alibaba)44.9%DefaultQwen3.6 35B A3B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
59Gemma 4 31B ITGoogle (Gemini / DeepMind)43.5%DefaultGemma 4 31B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
60Nemotron 3 Super 120B A12BNVIDIA38.6%DefaultNemotron 3 Super 120B A12B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
61Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)31.0%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗Terminus 221 Jul 2026
62gpt-oss-120bOpenAI26.2%Highgpt-oss-120b (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
63Nemotron 3.5 Lightning 30B-A3BNVIDIA24.3%DefaultNemotron 3.5 LightningIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
64Command A+Cohere22.9%DefaultCommand A+Independent testIndependentArtificial Analysis ↗—1 Oct 2026
65Mistral Small 4Mistral AI21.0%HighMistral Small 4 (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
66Granite 4.2 8BIBM Granite18.4%DefaultGranite 4.2 8BIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
67gpt-oss-20bOpenAI13.9%Highgpt-oss-20b (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
68Ministral 3 14BMistral AI9.7%DefaultMinistral 3 14BIndependent testIndependentArtificial Analysis ↗—1 Oct 2026