Skip to content
Bencher

TestsBenchmarks · Coding

SWE-Bench Pro (private/commercial set)

Share of 276 tasks from private startup codebases an agent resolves; tests generalization to code models have never seen.

% solvedHigher is betterCounts toward:Weights: Coding ×0.9The test's websiteOfficial page ↗

The best 8 · 8 models tested

Top 8 · best setting per model · 8 models, 8 results (8 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE-Bench Pro (private/commercial set) leaderboard
Thinking levelSetting
1Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)51.5%DefaultMuse Spark 1.1*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
2Claude Opus 4.6Anthropic47.1%Defaultclaude-opus-4-6 (thinking)*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
3Muse SparkMeta (Meta Superintelligence Labs, Muse)44.7%DefaultMuse Spark*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
4GPT-5.4OpenAI43.4%Extra highgpt-5.4(xHigh)*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
5Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)32.2%Defaultgemini-3.1-pro (thinking)*Independent testIndependentScale AI SEAL ↗—1 Oct 2026
6GPT-5.2-CodexOpenAI27.7%DefaultGPT 5.2 CodexIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
7GPT-5.2OpenAI23.8%DefaultGPT 5.2Independent testIndependentScale AI SEAL ↗—1 Oct 2026
8Gemini 3 ProGoogle (Gemini / DeepMind)17.9%DefaultGemini 3 ProIndependent testIndependentScale AI SEAL ↗—1 Oct 2026