Skip to content
Bencher

TestsBenchmarks · Coding

SWE Atlas - Codebase QnA

Rubric-graded accuracy answering deep technical questions about large real codebases using an agent harness.

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 15 · 40 models tested

Top 15 · best setting per model · 40 models, 54 results (51 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE Atlas - Codebase QnA leaderboard
Thinking levelSetting
1Claude Sonnet 5.5Anthropic66.9%MaxSonnet 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
2Claude Opus 5.5Anthropic66.4%MaxOpus 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
3Kimi K3Moonshot AI (Kimi)66.1%DefaultKimi K3Independent testIndependentArtificial Analysis ↗Kimi Code CLI1 Oct 2026
4Claude Fable 5.1Anthropic65.9%Extra highClaude Fable 5.1 XHigh + SWE-2 MediumIndependent testIndependentArtificial Analysis ↗Devin Fusion CLI1 Oct 2026
5Claude Opus 5Anthropic63.2%Extra highOpus 5 (Claude Code) xHighIndependent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
6Grok 4.7SpaceXAI (formerly xAI)62.9%Extra highGrok 4.7 (xhigh)Independent testIndependentArtificial Analysis ↗Grok Build1 Oct 2026
7Qwen3.8 Max (0902)Qwen (Alibaba)62.1%DefaultQwen3.8 MaxIndependent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
8GPT-6 AstraOpenAI61.8%MaxGPT-6 Astra (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
9DeepSeek V4 Pro (0813)DeepSeek61.8%MaxDeepSeek V4 Pro 0813 (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
10GPT-6.1 SolOpenAI61.0%Extra highGPT-6.1 Sol (xhigh)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
11Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)59.4%MaxMuse Spark 1.3 (max)Independent testIndependentArtificial Analysis ↗Muse Code1 Oct 2026
12GLM-5.3Z.ai (Zhipu)59.4%DefaultGLM-5.3Independent testIndependentArtificial Analysis ↗Opencode1 Oct 2026
13Grok 4.6SpaceXAI (formerly xAI)58.3%Extra highGrok 4.6 (xhigh)Independent testIndependentArtificial Analysis ↗Grok Build1 Oct 2026
14GPT-6 SolOpenAI57.5%MaxGPT-6 Sol (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
15Claude Opus 4.8Anthropic57.3%Extra highOpus 4.8 (Claude Code) xhighIndependent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
16Gemini 4 ArgonGoogle (Gemini / DeepMind)56.5%DefaultGemini 4 ArgonIndependent testIndependentArtificial Analysis ↗Antigravity CLI1 Oct 2026
17GPT-5.6 SolOpenAI54.0%MaxGPT-5.6 Sol (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
18DeepSeek V4 Flash (0731)DeepSeek51.3%MaxDeepSeek V4 Flash 0731 (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
19GPT-5.6 LunaOpenAI48.7%MaxGPT-5.6 Luna (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
20GLM-5.2Z.ai (Zhipu)48.1%DefaultGLM 5.2 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
21Gemini 3.8 FlashGoogle (Gemini / DeepMind)47.0%DefaultGemini 3.8 Flash (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
22Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)46.2%Extra highMaker's own figureVendor-reportedMeta ↗mini-swe-agent2 Sep 2026
23GPT-5.5OpenAI45.4%Extra highGPT 5.5 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
24GPT-6 LunaOpenAI44.4%MaxGPT-6 Luna (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
25Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)42.2%Extra highMuse Spark 1.1 (Mini-SWE-Agent) xHighIndependent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
26GPT-5.4OpenAI40.8%Extra highGPT 5.4 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
27Claude Opus 4.7Anthropic40.3%DefaultOpus 4.7 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
28Claude Fable 5Anthropic39.0%Extra highFable-5 (Claude Code) xHigh*Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
29MiniMax M3MiniMax37.9%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗mini-SWE-agent1 Jun 2026
30Claude Opus 4.6Anthropic33.3%DefaultOpus 4.6 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
31GPT-5.3-CodexOpenAI32.6%Extra highGPT 5.3 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
32Claude Sonnet 4.6Anthropic31.2%DefaultSonnet 4.6 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
33DeepSeek V4 Pro (Preview, 0423)DeepSeek27.1%DefaultDeepSeek V4 Pro (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
34Muse SparkMeta (Meta Superintelligence Labs, Muse)24.2%DefaultMuse SparkIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
35GLM 5Z.ai (Zhipu)20.5%DefaultGlm 5 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
36Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)13.5%DefaultGemini 3.1 Pro (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
37Kimi K2.5Moonshot AI (Kimi)13.1%DefaultKimi K2.5 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
38MiniMax M2.7MiniMax11.3%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗mini-SWE-agent1 Jun 2026
39MiniMax M2.5MiniMax10.3%DefaultMinimax M2.5 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
40Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)8.2%DefaultGemini 3 Flash (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026