Skip to content
Bencher

TestsBenchmarks · Coding

ProgramBench (avg test pass rate)

Average share of hidden behavioral tests passed when re-implementing 200 programs from scratch; partial-credit view of ProgramBench.

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 15 · 20 models tested

Top 15 · best setting per model · 20 models, 25 results (25 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
ProgramBench (avg test pass rate) leaderboard
Thinking levelSetting
1Claude Opus 5Anthropic74.7%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
2Claude Opus 4.8Anthropic70.9%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
3Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)70.8%MaxIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
4GPT-5.6 SolOpenAI69.9%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
5GPT-5.5OpenAI69.5%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
6GLM-5.2Z.ai (Zhipu)64.6%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
7Gemini 3.7 FlashGoogle (Gemini / DeepMind)61.2%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
8Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)57.2%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
9Gemini 3.6 FlashGoogle (Gemini / DeepMind)55.7%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
10Claude Opus 4.7Anthropic55.1%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
11Gemini 3.5 FlashGoogle (Gemini / DeepMind)53.6%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
12Claude Opus 4.6Anthropic52.1%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
13Claude Sonnet 4.6Anthropic47.5%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
14Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)47.0%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
15GPT-5.4OpenAI37.7%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
16Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)36.4%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
17Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)31.8%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
18Claude Haiku 4.5Anthropic30.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
19GPT-5.4 MiniOpenAI16.4%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
20GPT-5 MiniOpenAI16.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026