Skip to content
Bencher

TestsBenchmarks · Agentic

Terminal-Bench 4.0

Share of 66 hard, real terminal tasks (software, science, ML, ops, security, hardware) an agent completes end-to-end in a container.

% solvedHigher is betterCounts toward:Weights: Coding ×1The test's websiteOfficial page ↗

The best 15 · 41 models tested

Top 15 · best setting per model · 41 models, 99 results (93 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Terminal-Bench 4.0 leaderboard
Thinking levelSetting
1Claude Sonnet 5.5Anthropic66.2%MaxSonnet 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
2Claude Opus 5.5Anthropic63.1%MaxOpus 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
3GPT-6 AstraOpenAI59.6%Extra highGPT-6 Astra (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
4Claude Fable 5.1Anthropic57.9%MaxIndependent testIndependentTerminal-Bench ↗Claude Code1 Oct 2026
5Gemini 4 ArgonGoogle (Gemini / DeepMind)57.4%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗—30 Sep 2026
6GPT-6.1 SolOpenAI56.1%MaxGPT-6.1 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
7Claude Opus 5Anthropic54.5%MaxOpus 5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
8Claude Fable 5Anthropic44.5%MaxIndependent testIndependentTerminal-Bench ↗Claude Code1 Oct 2026
9GPT-6 SolOpenAI43.9%MaxGPT-6 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
10GLM-5.3Z.ai (Zhipu)41.9%MaxGLM-5.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
11GPT-5.6 SolOpenAI39.9%MaxGPT-5.6 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
12Qwen3.8 Max (0902)Qwen (Alibaba)38.9%DefaultQwen3.8 Max (0902)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
13Grok 4.7SpaceXAI (formerly xAI)37.6%Extra highIndependent testIndependentTerminal-Bench ↗Grok Build1 Oct 2026
14GPT-5.6 TerraOpenAI35.4%MaxGPT-5.6 Terra (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
15MiMo-V2.6-ProXiaomi MiMo34.8%DefaultMiMo-V2.6-ProIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
16Step 5 PreviewStepFun33.3%DefaultStep 5 PreviewIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
17Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)33.3%MaxMuse Spark 1.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
18GLM-5.3-FlashZ.ai (Zhipu)32.8%DefaultGLM 5.3 FlashIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
19DeepSeek V4.1 FlashDeepSeek26.8%MaxDeepSeek V4.1 Flash (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
20Qwen3.8-Flash-NextQwen (Alibaba)25.3%DefaultQwen3.8-Flash-NextIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
21Claude Opus 4.8Anthropic23.6%MaxIndependent testIndependentTerminal-Bench ↗Claude Code1 Oct 2026
22MiMo-V2.6-FlashXiaomi MiMo22.7%DefaultMiMo-V2.6-FlashIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
23Grok 4.6SpaceXAI (formerly xAI)21.2%HighGrok 4.6 (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
24Kimi K3Moonshot AI (Kimi)21.2%DefaultKimi K3Independent testIndependentArtificial Analysis ↗Kimi Code CLI1 Oct 2026
25Ember-1Fireworks AI19.7%DefaultIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
26Gemini 3.8 FlashGoogle (Gemini / DeepMind)19.7%MediumGemini 3.8 Flash (Medium)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
27DeepSeek V4 Flash (0731)DeepSeek18.7%Highreasoning_effort=highIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
28GPT-5.6 LunaOpenAI17.3%MaxIndependent testIndependentTerminal-Bench ↗Codex1 Oct 2026
29GPT-6 LunaOpenAI15.2%MaxGPT-6 Luna (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
30GPT-5.5OpenAI14.6%Extra highGPT-5.5 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
31DeepSeek V4 Pro (0813)DeepSeek14.1%MaxDeepSeek V4 Pro 0813 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
32Claude Sonnet 5Anthropic14.1%MaxClaude Sonnet 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
33Gemini 3.7 FlashGoogle (Gemini / DeepMind)13.6%HighGemini 3.7 Flash (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
34Grok 4.5SpaceXAI (formerly xAI)12.4%HighIndependent testIndependentTerminal-Bench ↗Grok Build1 Oct 2026
35DeepSeek V4 Flash Vision ExpDeepSeek12.1%MaxDeepSeek V4 Flash Vision (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
36Qwen3.8 2.4T A95B (open weights)Qwen (Alibaba)11.1%DefaultQwen3.8 2.4T A95BIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
37Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)7.1%Extra highMuse Spark 1.2 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
38Gemini 3.6 FlashGoogle (Gemini / DeepMind)7.1%HighGemini 3.6 Flash (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
39Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)6.1%Extra highMuse Spark 1.1 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
40Qwen3.8 27BQwen (Alibaba)5.6%Extra highQwen3.8 27B (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
41GLM-5.2Z.ai (Zhipu)1.0%MaxGLM-5.2 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026