Skip to content
Bencher

TestsBenchmarks · Coding

DeepSWE

Pass@1 on 113 from-scratch, long-horizon engineering tasks across 91 repos and 5 languages, with hand-written behavioral verifiers.

% solvedHigher is betterCounts toward:Weights: Coding ×0.9The test's websiteOfficial page ↗

The best 15 · 45 models tested

Top 15 · best setting per model · 45 models, 101 results (64 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
DeepSWE leaderboard
Thinking levelSetting
1Gemini 4 ArgonGoogle (Gemini / DeepMind)78.8%DefaultGemini 4 ArgonIndependent testIndependentArtificial Analysis ↗Antigravity CLI1 Oct 2026
2DeepSeek V4.1 FlashDeepSeek74.2%Maxreasoning_effort=100 (max)Maker's own figureVendor-reportedDeepSeek ↗mini-SWE-agent10 Sep 2026
3GPT-6 AstraOpenAI74.1%Extra highgpt-6-astra_xhighIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
4Gemini 3.8 FlashGoogle (Gemini / DeepMind)73.8%Highgemini-3.8-flash_highIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
5Claude Opus 5Anthropic73.6%Maxclaude-opus-5_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
6GPT-6.1 SolOpenAI73.2%Extra highGPT-6.1 Sol (xhigh)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
7Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)73.2%Extra highMuse Spark 1.3 (xhigh)Independent testIndependentArtificial Analysis ↗Muse Code1 Oct 2026
8GPT-5.6 SolOpenAI72.7%Maxgpt-5.6-sol_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
9Grok 4.7SpaceXAI (formerly xAI)72.6%Extra highGrok 4.7 (xhigh)Independent testIndependentArtificial Analysis ↗Grok Build1 Oct 2026
10Claude Sonnet 5.5Anthropic72.0%MaxSonnet 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
11Claude Fable 5Anthropic69.9%Extra highclaude-fable-5_xhighIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
12GPT-5.6 TerraOpenAI69.6%Maxgpt-5.6-terra_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
13GPT-6 SolOpenAI69.0%MaxGPT-6 Sol (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
14GLM-5.3Z.ai (Zhipu)69.0%Maxglm-5.3_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
15Kimi K3Moonshot AI (Kimi)68.5%Maxkimi-k3_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
16Claude Opus 5.5Anthropic68.4%MaxOpus 5.5 (max)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
17Grok 4.6SpaceXAI (formerly xAI)67.5%Mediumgrok-4.6_mediumIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
18GPT-5.6 LunaOpenAI67.2%Maxgpt-5.6-luna_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
19GPT-5.5OpenAI67.0%Extra highgpt-5.5_xhighIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
20Gemini 3.7 FlashGoogle (Gemini / DeepMind)65.5%Mediumgemini-3.7-flash_mediumIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
21Claude Fable 5.1Anthropic64.3%MaxFable 5.1 (max) (with fallback)Independent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
22GPT-6 LunaOpenAI63.7%MaxGPT-6 Luna (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
23GLM-5.3-FlashZ.ai (Zhipu)63.4%Maxglm-5.3-flash_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
24DeepSeek V4 Flash Vision ExpDeepSeek59.3%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗DeepSeek Harness (minimal mode)21 Aug 2026
25Claude Opus 4.8Anthropic59.0%Maxclaude-opus-4-8_maxIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
26Qwen3.8 FlashQwen (Alibaba)58.7%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗mini-SWE-agent26 Aug 2026
27Qwen3.8 Max (0803)Qwen (Alibaba)57.5%Extra highqwen3.8-max_xhighIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
28DeepSeek V4 Pro (0813)DeepSeek57.2%MaxDeepSeek V4 Pro 0813 (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
29Qwen3.8 Max (0803)Qwen (Alibaba)56.6%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
30Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)54.9%Extra highmuse-spark-1.2_xhighIndependent testIndependentDeepSWE (Datacurve) via Epoch AI ↗mini-SWE-agent1 Oct 2026
31DeepSeek V4 Flash (0731)DeepSeek54.3%MaxDeepSeek V4 Flash 0731 (max)Independent testIndependentArtificial Analysis ↗Codex1 Oct 2026
32Grok 4.5SpaceXAI (formerly xAI)54.0%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
33Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)53.3%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
34Qwen3.8 Max (0902)Qwen (Alibaba)51.0%DefaultQwen3.8 MaxIndependent testIndependentArtificial Analysis ↗Claude Code1 Oct 2026
35Gemini 3.6 FlashGoogle (Gemini / DeepMind)48.6%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗mini-swe-agent13 Aug 2026
36GLM-5.2Z.ai (Zhipu)46.2%Defaultthinking (effort not stated)Maker's own figureVendor-reportedZ.ai ↗mini-swe-agent16 Jun 2026
37Qwen3.8 27BQwen (Alibaba)42.2%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code14 Aug 2026
38Gemini 3.5 FlashGoogle (Gemini / DeepMind)37.0%Mediummedium thinkingMaker's own figureVendor-reportedGoogle ↗mini-swe-agent21 Jul 2026
39Qwen3.7 MaxQwen (Alibaba)21.6%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code / mini-SWE-agent (best)3 Aug 2026
40Qwen3.7 PlusQwen (Alibaba)14.2%Defaultsetting not statedMaker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code14 Aug 2026
41Qwen3.6 27BQwen (Alibaba)13.3%Defaultsetting not statedMaker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code14 Aug 2026
42DeepSeek V4 Pro (Preview, 0423)DeepSeek12.8%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
43Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)12.0%Defaultthinking level not stated (API default high)Maker's own figureVendor-reportedGoogle ↗mini-swe-agent21 Jul 2026
44Muse SparkMeta (Meta Superintelligence Labs, Muse)10.0%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
45DeepSeek V4 Flash (Preview, 0423)DeepSeek7.3%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026