Skip to content
Bencher

TestsBenchmarks · Coding

SWE Atlas - Test Writing

Quality of unit/integration tests an agent writes for real codebases, graded against rubrics and mutation checks.

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 15 · 23 models tested

Top 15 · best setting per model · 23 models, 23 results (22 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE Atlas - Test Writing leaderboard
Thinking levelSetting
1Claude Fable 5.1Anthropic67.0%Extra highFable-5.1 (Claude Code) xHigh*Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
2Claude Opus 5Anthropic62.2%Extra highOpus 5 (Claude Code) xHighIndependent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
3Claude Fable 5Anthropic55.6%Extra highFable-5 (Claude Code) xHigh*Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
4Gemini 3.8 FlashGoogle (Gemini / DeepMind)53.7%DefaultGemini 3.8 Flash (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
5GPT-6 AstraOpenAI50.7%Extra highGPT 6 Astra (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
6Claude Opus 4.8Anthropic49.6%Extra highOpus 4.8 (Claude Code) xhighIndependent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
7GPT-5.6 SolOpenAI45.9%Extra highGPT-5.6-Sol (Codex) xHigh*Independent testIndependentScale AI SEAL ↗Codex1 Oct 2026
8GPT-5.4OpenAI44.4%Extra highGPT-5.4 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
9GPT-5.5OpenAI42.6%Extra highGPT-5.5 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
10GLM-5.2Z.ai (Zhipu)41.5%DefaultGLM 5.2 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
11Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)41.5%Extra highMuse Spark 1.1 (Mini-SWE-Agent) xHighIndependent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
12GPT-5.3-CodexOpenAI39.0%Extra highGPT 5.3 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
13Claude Opus 4.7Anthropic38.5%DefaultOpus 4.7 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
14Claude Opus 4.6Anthropic36.7%DefaultOpus-4.6 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
15Claude Sonnet 4.6Anthropic31.8%DefaultSonnet-4.6 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
16Muse SparkMeta (Meta Superintelligence Labs, Muse)31.1%DefaultMuse SparkIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
17MiniMax M3MiniMax30.8%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗Claude Code1 Jun 2026
18Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)30.3%DefaultGemini-3-Flash (Mini-SWE)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
19Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)29.8%DefaultGemini-3.1-Pro (Mini-SWE)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
20GLM 5Z.ai (Zhipu)28.7%DefaultGlm-5 (Mini-SWE)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
21DeepSeek V4 Pro (Preview, 0423)DeepSeek27.1%DefaultDeepseek V4 Pro (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
22Kimi K2.5Moonshot AI (Kimi)25.8%DefaultKimi-K2.5 (Mini-SWE)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
23MiniMax M2.5MiniMax18.6%DefaultMinimax-M2.5 (Mini-SWE)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026