Skip to content
Bencher

TestsBenchmarks · Reasoning

ARC-AGI-2

Share of novel abstract grid puzzles solved on the semi-private set; now near ceiling for frontier models.

% solvedHigher is betterToo easy now: the top models all score near perfectSaturatedThe test's websiteOfficial page ↗

The best 15 · 16 models tested

Top 15 · best setting per model · 16 models, 38 results (31 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
ARC-AGI-2 leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI95.0%MaxGPT-6 Astra (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
2GPT-6.1 SolOpenAI94.2%MaxGPT-6.1 Sol (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
3Claude Opus 5.5Anthropic93.3%HighClaude Opus 5.5 (High)Independent testIndependentARC Prize ↗—30 Sep 2026
4GPT-5.6 SolOpenAI92.5%MaxGPT-5.6 Sol (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
5Claude Opus 5Anthropic90.4%MaxClaude Opus 5 (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
6Claude Fable 5.1Anthropic90.0%MaxClaude Fable 5.1 (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
7GPT-6 SolOpenAI89.6%MaxGPT-6 Sol (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
8Claude Fable 5Anthropic89.2%MaxClaude Fable 5 (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
9Gemini 3.8 FlashGoogle (Gemini / DeepMind)89.2%HighGemini 3.8 Flash (High)Independent testIndependentARC Prize ↗—30 Sep 2026
10GPT-5.5OpenAI85.0%Extra highGPT-5.5 (XHigh)Independent testIndependentARC Prize ↗—30 Sep 2026
11Gemini 3.7 FlashGoogle (Gemini / DeepMind)84.6%HighGemini 3.7 Flash (High)Independent testIndependentARC Prize ↗—30 Sep 2026
12Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)84.6%MaxDeep ThinkMaker's own figureVendor-reportedGoogle ↗—12 Feb 2026
13GPT-5.6 TerraOpenAI83.9%MaxGPT-5.6 Terra (Max)Independent testIndependentARC Prize ↗—30 Sep 2026
14GPT-5.4OpenAI73.3%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
15Claude Opus 4.8Anthropic72.1%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
16Gemini 3.5 FlashGoogle (Gemini / DeepMind)72.1%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026