Skip to content
Bencher

TestsBenchmarks · Coding

SWE-bench Pro (Anthropic internal subset)

Anthropic-internal 478-problem subset of SWE-bench Pro used for cost/effort studies; not comparable to the public leaderboard.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 3 · 3 models tested

Top 3 · best setting per model · 3 models, 6 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE-bench Pro (Anthropic internal subset) leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic95.3%Highadaptive thinking, effort=highMaker's own figureVendor-reportedAnthropic ↗—1 Oct 2026
2Claude Fable 5.1Anthropic92.3%Highadaptive thinking, effort=high (default)Maker's own figureVendor-reportedAnthropic ↗—1 Oct 2026
3Claude Sonnet 5Anthropic77.4%Highadaptive thinking, effort=high (default)Maker's own figureVendor-reportedAnthropic ↗—1 Oct 2026