Skip to content
Bencher

TestsBenchmarks · Coding

SWE-bench Verified (bash-only, mini-SWE-agent)

SWE-bench Verified run by the SWE-bench team with the minimal bash-only mini-SWE-agent so models are compared on equal scaffolding.

% solvedHigher is betterToo easy now: the top models all score near perfectSaturatedThe test's websiteOfficial page ↗

The best 13 · 13 models tested

Top 13 · best setting per model · 13 models, 13 results (13 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE-bench Verified (bash-only, mini-SWE-agent) leaderboard
Thinking levelSetting
1Claude Opus 4.5Anthropic76.8%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
2Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)75.8%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
3MiniMax M2.5MiniMax75.8%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
4Claude Opus 4.6Anthropic75.6%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
5GLM 5Z.ai (Zhipu)72.8%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
6GPT-5.2OpenAI72.8%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
7GPT-5.2-CodexOpenAI72.8%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.019 Feb 2026
8Claude Sonnet 4.5Anthropic71.4%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
9Kimi K2.5Moonshot AI (Kimi)70.8%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
10DeepSeek V3.2DeepSeek70.0%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
11Gemini 3 ProGoogle (Gemini / DeepMind)69.6%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.026 Feb 2026
12Claude Haiku 4.5Anthropic66.6%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026
13GPT-5 MiniOpenAI56.2%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.017 Feb 2026