Skip to content
Bencher

TestsBenchmarks · Coding

Vals SRE Bench

Share of contamination-free real-world binaries an agent can fully reverse-engineer.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 16 models tested

Top 15 · best setting per model · 16 models, 16 results (16 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Vals SRE Bench leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI56.9%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
2GPT-6.1 SolOpenAI50.8%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
3Gemini 4 ArgonGoogle (Gemini / DeepMind)44.3%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
4Claude Opus 5.5Anthropic33.6%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
5GPT-5.6 SolOpenAI30.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
6Claude Sonnet 5.5Anthropic30.1%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
7Claude Fable 5.1Anthropic22.9%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
8Claude Opus 5Anthropic12.2%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
9Gemini 3.7 FlashGoogle (Gemini / DeepMind)4.6%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
10MiMo-V2.6-FlashXiaomi MiMo4.2%DefaultIndependent testIndependentVals.ai ↗—29 Sep 2026
11GPT-5.5OpenAI3.8%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
12MiMo-V2.6-ProXiaomi MiMo3.0%DefaultIndependent testIndependentVals.ai ↗—29 Sep 2026
13Hy4 previewTencent Hunyuan2.3%DefaultIndependent testIndependentVals.ai ↗—29 Sep 2026
14DeepSeek V4.1 FlashDeepSeek0.8%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
15Grok 4.5SpaceXAI (formerly xAI)0.8%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
16GLM-5.2Z.ai (Zhipu)0.0%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026