Skip to content
Bencher

TestsBenchmarks · Coding

GSO

Share of 102 software-optimization tasks where one attempt reaches at least 95% of the expert speedup while passing correctness tests.

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 11 · 11 models tested

Top 11 · best setting per model · 11 models, 13 results (13 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
GSO leaderboard
Thinking levelSetting
1Claude Fable 5.1Anthropic88.2%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands27 Sep 2026
2GPT-6 AstraOpenAI79.4%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands27 Sep 2026
3Claude Fable 5Anthropic78.4%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands27 Sep 2026
4GPT-5.6 SolOpenAI76.5%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands27 Sep 2026
5Claude Opus 4.8Anthropic47.1%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands12 Jul 2026
6Claude Opus 4.7Anthropic44.1%Highreasoning_effort=highIndependent testIndependentGSO ↗OpenHands27 Apr 2026
7Claude Opus 4.6Anthropic41.2%Highreasoning_effort=highIndependent testIndependentGSO ↗OpenHands27 Apr 2026
8GPT-5.5OpenAI40.2%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands27 Apr 2026
9Claude Sonnet 5Anthropic37.3%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands12 Jul 2026
10GPT-5.4OpenAI31.4%Extra highreasoning_effort=xhighIndependent testIndependentGSO ↗OpenHands10 Mar 2026
11Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)22.6%DefaultIndependent testIndependentGSO ↗OpenHands9 Mar 2026