TestsBenchmarks · Reasoning
ARC-AGI-2
Share of novel abstract grid puzzles solved on the semi-private set; now near ceiling for frontier models.
% solvedHigher is betterToo easy now: the top models all score near perfectSaturatedThe test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 95.0% | MaxGPT-6 Astra (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 2 | GPT-6.1 Sol | OpenAI | 94.2% | MaxGPT-6.1 Sol (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 3 | Claude Opus 5.5 | Anthropic | 93.3% | HighClaude Opus 5.5 (High) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 4 | GPT-5.6 Sol | OpenAI | 92.5% | MaxGPT-5.6 Sol (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 5 | Claude Opus 5 | Anthropic | 90.4% | MaxClaude Opus 5 (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 6 | Claude Fable 5.1 | Anthropic | 90.0% | MaxClaude Fable 5.1 (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 7 | GPT-6 Sol | OpenAI | 89.6% | MaxGPT-6 Sol (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 8 | Claude Fable 5 | Anthropic | 89.2% | MaxClaude Fable 5 (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 9 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 89.2% | HighGemini 3.8 Flash (High) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 10 | GPT-5.5 | OpenAI | 85.0% | Extra highGPT-5.5 (XHigh) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 11 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 84.6% | HighGemini 3.7 Flash (High) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 12 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 84.6% | MaxDeep Think | Maker's own figureVendor-reportedGoogle ↗ | — | 12 Feb 2026 |
| 13 | GPT-5.6 Terra | OpenAI | 83.9% | MaxGPT-5.6 Terra (Max) | Independent testIndependentARC Prize ↗ | — | 30 Sep 2026 |
| 14 | GPT-5.4 | OpenAI | 73.3% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 23 Apr 2026 |
| 15 | Claude Opus 4.8 | Anthropic | 72.1% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 24 Jul 2026 |
| 16 | Gemini 3.5 Flash | Google (Gemini / DeepMind) | 72.1% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |