Skip to content
Bencher

TestsBenchmarks · Coding

Artificial Analysis Coding Agent Index

Equal-weight composite of DeepSWE, Terminal-Bench 4.0 and SWE-Atlas-QnA, measured for model+agent pairs (Claude Code, Codex, etc.).

ScoreHigher is betterCounts toward:Weights: Coding ×1The test's websiteOfficial page ↗

The best 15 · 21 models tested

Top 15 · best setting per model · 21 models, 49 results (41 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Artificial Analysis Coding Agent Index leaderboard
Thinking levelSetting
1Claude Sonnet 5.5Anthropic68.4MaxSonnet 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
2Claude Opus 5Anthropic68.1Extra higheffort=xhighIndependent testIndependentOpenAI (competitor result in OpenAI launch post) ↗—3 Sep 2026
3Claude Fable 5Anthropic67.2Maxeffort=maxIndependent testIndependentOpenAI (competitor result in OpenAI launch post) ↗—3 Sep 2026
4Claude Opus 5.5Anthropic66MaxOpus 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
5GPT-6 AstraOpenAI65.5Highreasoning effort=highMaker's own figureVendor-reportedOpenAI ↗—3 Sep 2026
6GPT-5.6 SolOpenAI64.1Highreasoning effort=highMaker's own figureVendor-reportedOpenAI ↗—3 Sep 2026
7Gemini 4 ArgonGoogle (Gemini / DeepMind)63.8DefaultGemini 4 ArgonIndependent testIndependentArtificial Analysis ↗Antigravity CLI1 Oct 2026
8GPT-6.1 SolOpenAI62.9Extra highGPT-6.1 Sol (xhigh)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
9Claude Fable 5.1Anthropic62.2MaxFable 5.1 (max) (with fallback)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
10GPT-6 SolOpenAI56.7MaxGPT-6 Sol (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
11Grok 4.7SpaceXAI (formerly xAI)56.3Extra highGrok 4.7 (xhigh)Independent testIndependentArtificial Analysis ↗Grok Build1 Oct 2026
12Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)54.3MaxMuse Spark 1.3 (max)Independent testIndependentArtificial Analysis ↗Muse Code1 Oct 2026
13GLM-5.3Z.ai (Zhipu)53.6DefaultGLM-5.3Independent testIndependentArtificial Analysis ↗Opencode1 Oct 2026
14Kimi K3Moonshot AI (Kimi)51.9DefaultKimi K3Independent testIndependentArtificial Analysis ↗Kimi Code CLI1 Oct 2026
15Grok 4.6SpaceXAI (formerly xAI)47Extra highGrok 4.6 (xhigh)Independent testIndependentArtificial Analysis ↗Grok Build1 Oct 2026
16Qwen3.8 Max (0902)Qwen (Alibaba)43.3DefaultQwen3.8 MaxIndependent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
17GPT-5.6 LunaOpenAI43.2MaxGPT-5.6 Luna (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
18DeepSeek V4 Pro (0813)DeepSeek43.1MaxDeepSeek V4 Pro 0813 (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
19Gemini 3.8 FlashGoogle (Gemini / DeepMind)41.9HighGemini 3.8 Flash (high)Independent testIndependentArtificial Analysis ↗Antigravity SDK1 Oct 2026
20GPT-6 LunaOpenAI41.1MaxGPT-6 Luna (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
21DeepSeek V4 Flash (0731)DeepSeek38.7MaxDeepSeek V4 Flash 0731 (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026