Skip to content
Bencher

TestsBenchmarks · Coding

FrontierCode v1.1 (Extended)

Extended task set of Cognition's FrontierCode with the same correctness + mergeability grading.

% solvedHigher is betterCounts toward:Weights: Coding ×0.7The test's websiteOfficial page ↗

The best 8 · 8 models tested

Top 8 · best setting per model · 8 models, 10 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
FrontierCode v1.1 (Extended) leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic65.3%Mediumadaptive thinking, effort=medium (best)Maker's own figureVendor-reportedAnthropic ↗Claude Code22 Sep 2026
2GPT-6 AstraOpenAI64.5%Defaultbest score across efforts (OpenAI table: "maximum at any effort")Maker's own figureVendor-reportedOpenAI ↗—3 Sep 2026
3Claude Sonnet 5.5Anthropic64.4%Extra highadaptive thinking, effort=xhighMaker's own figureVendor-reportedAnthropic ↗Claude Code28 Sep 2026
4Claude Opus 5Anthropic63.6%Mediumadaptive thinking, effort=medium (best)Maker's own figureVendor-reportedAnthropic ↗Claude Code24 Jul 2026
5Claude Fable 5.1Anthropic63.6%Mediumadaptive thinking, effort=medium (best)Maker's own figureVendor-reportedAnthropic ↗Claude Code1 Sep 2026
6Grok 4.6SpaceXAI (formerly xAI)61.3%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
7GPT-5.6 SolOpenAI60.6%Defaultbest score across efforts (OpenAI table: "maximum at any effort")Maker's own figureVendor-reportedOpenAI ↗—3 Sep 2026
8Grok 4.5SpaceXAI (formerly xAI)56.6%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026