Skip to content
Bencher

TestsBenchmarks · Agentic

Frontier-Bench v0.1

Agentic terminal-coding benchmark (74 tasks) run via Harbor or mini-SWE-agent; reported at Claude Opus 5 launch.

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 4 · 4 models tested

Top 4 · best setting per model · 4 models, 7 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Frontier-Bench v0.1 leaderboard
Thinking levelSetting
1Claude Opus 5Anthropic44.4%Extra highadaptive thinking, effort=xhighMaker's own figureVendor-reportedAnthropic ↗mini-SWE-agent (GKE)24 Jul 2026
2Claude Fable 5Anthropic33.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
3Claude Opus 4.8Anthropic21.1%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
4Claude Sonnet 5Anthropic17.0%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗mini-SWE-agent (GKE)24 Jul 2026