Skip to content
Bencher

TestsBenchmarks · Coding

SWE-Bench Pro (public, v1)

Share of 731 long-horizon, multi-file tasks from copyleft open-source repos an agent resolves without breaking existing tests.

% solvedHigher is betterCounts toward:Weights: Coding ×1The test's websiteOfficial page ↗

The best 15 · 45 models tested

Top 15 · best setting per model · 45 models, 51 results (12 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE-Bench Pro (public, v1) leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic89.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
2Claude Sonnet 5.5Anthropic81.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
3Claude Fable 5.1Anthropic81.2%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
4Claude Fable 5Anthropic80.0%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
5Claude Opus 5Anthropic79.2%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
6Claude Opus 4.8Anthropic69.2%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
7Qwen3.8 Max (0803)Qwen (Alibaba)67.7%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
8Grok 4.5SpaceXAI (formerly xAI)64.7%Defaulteffort not stated (API default high)Maker's own figureVendor-reportedSpaceXAI ↗—16 Jul 2026
9GPT-5.6 SolOpenAI64.6%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
10Claude Opus 4.7Anthropic64.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 May 2026
11GPT-5.6 TerraOpenAI63.4%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
12Claude Sonnet 5Anthropic63.2%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
13GPT-5.6 LunaOpenAI62.7%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
14Qwen3.8 FlashQwen (Alibaba)62.5%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code26 Aug 2026
15GLM-5.2Z.ai (Zhipu)62.1%Defaultthinking (effort not stated)Maker's own figureVendor-reportedZ.ai ↗OpenHands16 Jun 2026
16Qwen3.8 27BQwen (Alibaba)61.7%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code14 Aug 2026
17Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)61.5%DefaultMuse Spark 1.1*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
18Qwen3.7 MaxQwen (Alibaba)60.6%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)16 May 2026
19GPT-5.5OpenAI59.4%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
20GPT-5.4OpenAI59.1%Extra highgpt-5.4 (xHigh)*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
21MiniMax M3MiniMax59.0%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗Claude Code1 Jun 2026
22Gemini 3.6 FlashGoogle (Gemini / DeepMind)58.7%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗internal Antigravity harness21 Jul 2026
23Kimi K2.6Moonshot AI (Kimi)58.6%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗In-house SWE-agent-derived framework (bash/createfile/insert/view/strreplace/submit)20 Apr 2026
24GLM-5.1Z.ai (Zhipu)58.4%DefaultthinkingMaker's own figureVendor-reportedZ.ai ↗—7 Apr 2026
25Claude Sonnet 4.6Anthropic58.1%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—30 Jun 2026
26Qwen3.7 PlusQwen (Alibaba)57.6%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)21 May 2026
27Qwen3.6 PlusQwen (Alibaba)56.6%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)2 Apr 2026
28MiniMax M2.7MiniMax56.2%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—18 Mar 2026
29DeepSeek V4 Pro (Preview, 0423)DeepSeek55.4%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
30Gemini 3.5 FlashGoogle (Gemini / DeepMind)55.1%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗internal Antigravity harness19 May 2026
31Muse SparkMeta (Meta Superintelligence Labs, Muse)55.0%DefaultMuse Spark*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
32Gemini 3.5 Flash-LiteGoogle (Gemini / DeepMind)54.2%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗internal Antigravity harness21 Jul 2026
33Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)54.2%HighThinking (High)Maker's own figureVendor-reportedGoogle ↗—19 Feb 2026
34Qwen3.6 27BQwen (Alibaba)53.5%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)22 Apr 2026
35DeepSeek V4 Flash (Preview, 0423)DeepSeek52.6%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
36Claude Opus 4.6Anthropic51.9%Defaultclaude-opus-4-6 (thinking)*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
37Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)51.2%HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026
38Claude Opus 4.5Anthropic45.9%Defaultclaude-opus-4-5-20251101Independent testIndependentScale AI SEAL ↗—1 Oct 2026
39Gemini 3 ProGoogle (Gemini / DeepMind)43.3%Defaultgemini-3-pro-previewIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
40GPT-5.2-CodexOpenAI41.0%Defaultgpt-5.2-codexIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
41Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)38.3%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗internal Antigravity harness21 Jul 2026
42MiniMax M2.1MiniMax36.8%Defaultminimax-2.1Independent testIndependentScale AI SEAL ↗—1 Oct 2026
43Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)34.6%Defaultgemini-3-flashIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
44GPT-5.2OpenAI29.9%Defaultgpt-5.2Independent testIndependentScale AI SEAL ↗—1 Oct 2026
45gpt-oss-120bOpenAI16.2%Defaultgpt-oss-120bIndependent testIndependentScale AI SEAL ↗—1 Oct 2026