Skip to content
Bencher

TestsBenchmarks · Coding

SWE-bench Multilingual

Share of 300 real GitHub issues across 9 programming languages a model fixes (bash-only mini-SWE-agent runs).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 31 models tested

Top 15 · best setting per model · 31 models, 35 results (13 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE-bench Multilingual leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic93.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
2Claude Sonnet 5.5Anthropic90.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
3Claude Opus 5Anthropic89.5%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
4Claude Fable 5.1Anthropic89.1%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
5Claude Fable 5Anthropic86.6%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
6Claude Opus 4.8Anthropic84.4%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
7Qwen3.8 FlashQwen (Alibaba)81.0%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗mini-SWE-agent26 Aug 2026
8Claude Opus 4.7Anthropic80.5%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 May 2026
9Claude Sonnet 5Anthropic78.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
10Qwen3.7 MaxQwen (Alibaba)78.3%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)16 May 2026
11Kimi K2.6Moonshot AI (Kimi)76.7%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗In-house SWE-agent-derived framework (bash/createfile/insert/view/strreplace/submit)20 Apr 2026
12MiniMax M2.7MiniMax76.5%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—18 Mar 2026
13DeepSeek V4 Pro (Preview, 0423)DeepSeek76.2%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
14Qwen3.7 PlusQwen (Alibaba)75.8%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)21 May 2026
15Qwen3.6 PlusQwen (Alibaba)73.8%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)2 Apr 2026
16Qwen3.8 27BQwen (Alibaba)73.8%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗mini-SWE-agent26 Aug 2026
17DeepSeek V4 Flash (Preview, 0423)DeepSeek73.3%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
18Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)72.7%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
19Claude Opus 4.6Anthropic72.0%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
20Qwen3.6 27BQwen (Alibaba)71.3%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Internal scaffold (bash + file-edit)22 Apr 2026
21Claude Opus 4.5Anthropic70.7%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
22GLM 5Z.ai (Zhipu)69.7%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
23Gemini 3 ProGoogle (Gemini / DeepMind)68.7%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
24MiniMax M2.5MiniMax68.3%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a016 Feb 2026
25Kimi K2.5Moonshot AI (Kimi)67.3%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
26Claude Sonnet 4.5Anthropic67.0%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
27GPT-5.2OpenAI66.7%HighIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
28GPT-5.2-CodexOpenAI66.3%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.020 Feb 2026
29Claude Haiku 4.5Anthropic64.7%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
30DeepSeek V3.2DeepSeek59.0%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026
31GPT-5 MiniOpenAI39.7%DefaultIndependent testIndependentSWE-bench ↗mini-SWE-agent 2.0.0a013 Feb 2026