Skip to content
Bencher

TestsBenchmarks · Coding

ProgramBench (fully resolved)

Share of 200 programs (from jq to SQLite/FFmpeg) an agent re-implements from only the binary and docs so that all hidden behavioral tests pass.

% solvedHigher is betterCounts toward:Weights: Coding ×0.5The test's websiteOfficial page ↗

The best 15 · 41 models tested

Top 15 · best setting per model · 41 models, 53 results (49 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
ProgramBench (fully resolved) leaderboard
Thinking levelSetting
1Claude Sonnet 5.5Anthropic79.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
2Kimi K3Moonshot AI (Kimi)77.8%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code16 Jul 2026
3Kimi K2.7 CodeMoonshot AI (Kimi)53.6%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026
4Kimi K2.6Moonshot AI (Kimi)48.3%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026
5Claude Opus 5.5Anthropic18.5%Maxeffort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
6Claude Fable 5.1Anthropic7.0%Maxeffort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
7GPT-6 AstraOpenAI5.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
8Claude Opus 5Anthropic4.5%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
9Gemini 4 ArgonGoogle (Gemini / DeepMind)2.5%Highreasoning_effort=highIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
10Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)2.5%MaxIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
11Claude Fable 5Anthropic2.0%Maxeffort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
12GPT-6 SolOpenAI2.0%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
13GPT-5.6 SolOpenAI1.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
14GLM-5.3Z.ai (Zhipu)1.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
15Claude Opus 4.8Anthropic1.0%Maxeffort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
16Gemini 3.8 FlashGoogle (Gemini / DeepMind)1.0%Highreasoning_effort=highIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
17GLM-5.2Z.ai (Zhipu)0.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
18Grok 4.7SpaceXAI (formerly xAI)0.5%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
19MiMo-V2.6-FlashXiaomi MiMo0.5%DefaultIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
20GPT-5.6 TerraOpenAI0.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
21MiMo-V2.6-ProXiaomi MiMo0.5%DefaultIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
22GPT-5.5OpenAI0.5%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
23GPT-6 LunaOpenAI0.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
24GPT-5.4OpenAI0.5%Highreasoning_effort=highIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
25Claude Sonnet 4.6Anthropic0.5%Maxeffort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
26Inkling SmallThinking Machines Lab0.5%Defaultreasoning_effort=0.99Independent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
27Gemini 3.6 FlashGoogle (Gemini / DeepMind)0.5%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
28Claude Sonnet 5Anthropic0.0%Maxeffort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
29Hy4 previewTencent Hunyuan0.0%DefaultIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
30DeepSeek V4 Pro (0813)DeepSeek0.0%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗mini-SWE-agent29 Sep 2026
31Gemini 3.7 FlashGoogle (Gemini / DeepMind)0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
32Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)0.0%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
33Claude Opus 4.7Anthropic0.0%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
34Gemini 3.5 FlashGoogle (Gemini / DeepMind)0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
35Claude Opus 4.6Anthropic0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
36Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)0.0%Extra highIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
37Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
38Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
39Claude Haiku 4.5Anthropic0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
40GPT-5.4 MiniOpenAI0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026
41GPT-5 MiniOpenAI0.0%DefaultIndependent testIndependentProgramBench ↗mini-SWE-agent28 Sep 2026