TestsBenchmarks · Coding
FrontierCode
Measures whether a maintainer would actually merge the agent PR: correctness, tests, scope and code-quality, graded by an ensemble.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 | Anthropic | 54.6% | Mediumclaude-opus-5-5_medium | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 2 | Claude Fable 5 | Anthropic | 53.5% | Defaultclaude-fable-5_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 3 | Claude Opus 5 | Anthropic | 53.4% | Maxclaude-opus-5_max | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 4 | GPT-6 Astra | OpenAI | 53.3% | Maxgpt-6-astra_max | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 5 | Claude Sonnet 5.5 | Anthropic | 52.1% | Extra highclaude-sonnet-5-5_xhigh | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 6 | Claude Fable 5.1 | Anthropic | 50.9% | Mediumclaude-fable-5-1_medium | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 7 | GPT-6.1 Sol | OpenAI | 50.2% | Mediumgpt-6.1-sol_medium | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 8 | SWE-2 | Cognition | 50.0% | Maxswe-2_max | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | devin | 1 Oct 2026 |
| 9 | GPT-6 Sol | OpenAI | 49.3% | Maxgpt-6-sol_max | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 10 | Grok 4.6 | SpaceXAI (formerly xAI) | 48.0% | Defaultgrok-4.6_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | grok-build | 1 Oct 2026 |
| 11 | GPT-5.6 Sol | OpenAI | 47.5% | Defaultgpt-5.6-sol_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 12 | Claude Opus 4.8 | Anthropic | 46.5% | Defaultclaude-opus-4-8_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 13 | Kimi K3 | Moonshot AI (Kimi) | 44.2% | Defaultkimi-k3_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | mini-SWE-agent | 1 Oct 2026 |
| 14 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 43.6% | Defaultgemini-3.7-flash_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | chisel | 1 Oct 2026 |
| 15 | GPT-5.5 | OpenAI | 43.0% | Defaultgpt-5.5_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 16 | Claude Sonnet 5 | Anthropic | 42.7% | Defaultclaude-sonnet-5_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 17 | GPT-6 Luna | OpenAI | 42.4% | Maxgpt-6-luna_max | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 18 | Grok 4.5 | SpaceXAI (formerly xAI) | 42.4% | Defaultgrok-4.5_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | grok-build | 1 Oct 2026 |
| 19 | GPT-5.6 Terra | OpenAI | 41.3% | Defaultgpt-5.6-terra_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 20 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 41.2% | Mediumgemini-3.8-flash_medium | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | chisel | 1 Oct 2026 |
| 21 | GLM-5.3 | Z.ai (Zhipu) | 40.1% | Maxglm-5.3_max | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | chisel | 1 Oct 2026 |
| 22 | GPT-5.6 Luna | OpenAI | 39.8% | Defaultgpt-5.6-luna_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | codex | 1 Oct 2026 |
| 23 | Claude Opus 4.7 | Anthropic | 38.5% | Defaultclaude-opus-4-7_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | Claude Code | 1 Oct 2026 |
| 24 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 34.4% | Defaultgemini-3.6-flash_unknown | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | chisel | 1 Oct 2026 |
| 25 | GLM-5.3-Flash | Z.ai (Zhipu) | 31.8% | Maxglm-5.3-flash_max | Independent testIndependentFrontierCode (Cognition) via Epoch AI ↗ | chisel | 1 Oct 2026 |