Skip to content
Bencher

TestsBenchmarks · Coding

SWE Atlas - Refactoring

Share of realistic large refactoring tasks an agent completes correctly in real repos.

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 15 · 17 models tested

Top 15 · best setting per model · 17 models, 17 results (17 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE Atlas - Refactoring leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI59.0%Extra highGPT 6 Astra (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
2Claude Fable 5.1Anthropic56.7%Extra highFable-5.1 (Claude Code) xHighIndependent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
3Claude Fable 5Anthropic54.8%Extra highFable-5 (Claude Code) xHighIndependent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
4Claude Opus 4.7Anthropic48.6%DefaultOpus-4.7 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
5Claude Opus 4.8Anthropic46.7%DefaultOpus 4.8 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
6GPT-5.5OpenAI44.8%Extra highGPT-5.5 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
7Gemini 3.8 FlashGoogle (Gemini / DeepMind)44.8%DefaultGemini 3.8 Flash (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
8GPT-5.4OpenAI44.3%Extra highGPT 5.4 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
9GLM-5.2Z.ai (Zhipu)42.4%DefaultGLM 5.2 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
10GPT-5.3-CodexOpenAI42.4%Extra highGPT 5.3 (Codex) xHighIndependent testIndependentScale AI SEAL ↗Codex1 Oct 2026
11Claude Opus 4.6Anthropic35.6%DefaultOpus-4.6 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
12Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)33.8%DefaultGemini-3.1-Pro (Gemini CLI)Independent testIndependentScale AI SEAL ↗Gemini CLI1 Oct 2026
13Claude Sonnet 4.6Anthropic32.2%DefaultSonnet-4.6 (Claude Code)Independent testIndependentScale AI SEAL ↗Claude Code1 Oct 2026
14GLM 5Z.ai (Zhipu)24.2%DefaultGlm-5 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
15Kimi K2.5Moonshot AI (Kimi)20.9%DefaultKimi-K2.5 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
16MiniMax M2.5MiniMax19.5%DefaultMinimax-M2.5 (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026
17Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)10.0%DefaultGemini-3-Flash (Mini-SWE-Agent)Independent testIndependentScale AI SEAL ↗mini-SWE-agent1 Oct 2026