Skip to content
Bencher

TestsBenchmarks · Coding

FrontierCode

Measures whether a maintainer would actually merge the agent PR: correctness, tests, scope and code-quality, graded by an ensemble.

% solvedHigher is betterCounts toward:Weights: Coding ×0.7The test's websiteOfficial page ↗

The best 15 · 25 models tested

Top 15 · best setting per model · 25 models, 71 results (27 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
FrontierCode leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic54.6%Mediumclaude-opus-5-5_mediumIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
2Claude Fable 5Anthropic53.5%Defaultclaude-fable-5_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
3Claude Opus 5Anthropic53.4%Maxclaude-opus-5_maxIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
4GPT-6 AstraOpenAI53.3%Maxgpt-6-astra_maxIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
5Claude Sonnet 5.5Anthropic52.1%Extra highclaude-sonnet-5-5_xhighIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
6Claude Fable 5.1Anthropic50.9%Mediumclaude-fable-5-1_mediumIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
7GPT-6.1 SolOpenAI50.2%Mediumgpt-6.1-sol_mediumIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
8SWE-2Cognition50.0%Maxswe-2_maxIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗devin1 Oct 2026
9GPT-6 SolOpenAI49.3%Maxgpt-6-sol_maxIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
10Grok 4.6SpaceXAI (formerly xAI)48.0%Defaultgrok-4.6_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗grok-build1 Oct 2026
11GPT-5.6 SolOpenAI47.5%Defaultgpt-5.6-sol_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
12Claude Opus 4.8Anthropic46.5%Defaultclaude-opus-4-8_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
13Kimi K3Moonshot AI (Kimi)44.2%Defaultkimi-k3_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗mini-SWE-agent1 Oct 2026
14Gemini 3.7 FlashGoogle (Gemini / DeepMind)43.6%Defaultgemini-3.7-flash_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗chisel1 Oct 2026
15GPT-5.5OpenAI43.0%Defaultgpt-5.5_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
16Claude Sonnet 5Anthropic42.7%Defaultclaude-sonnet-5_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
17GPT-6 LunaOpenAI42.4%Maxgpt-6-luna_maxIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
18Grok 4.5SpaceXAI (formerly xAI)42.4%Defaultgrok-4.5_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗grok-build1 Oct 2026
19GPT-5.6 TerraOpenAI41.3%Defaultgpt-5.6-terra_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
20Gemini 3.8 FlashGoogle (Gemini / DeepMind)41.2%Mediumgemini-3.8-flash_mediumIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗chisel1 Oct 2026
21GLM-5.3Z.ai (Zhipu)40.1%Maxglm-5.3_maxIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗chisel1 Oct 2026
22GPT-5.6 LunaOpenAI39.8%Defaultgpt-5.6-luna_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗codex1 Oct 2026
23Claude Opus 4.7Anthropic38.5%Defaultclaude-opus-4-7_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗Claude Code1 Oct 2026
24Gemini 3.6 FlashGoogle (Gemini / DeepMind)34.4%Defaultgemini-3.6-flash_unknownIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗chisel1 Oct 2026
25GLM-5.3-FlashZ.ai (Zhipu)31.8%Maxglm-5.3-flash_maxIndependent testIndependentFrontierCode (Cognition) via Epoch AI ↗chisel1 Oct 2026