Skip to content
Bencher

TestsBenchmarks · Knowledge

GDPval-AA v2.1

GDPval-AA version 2.1 (Elo).

Elo ratingHigher is betterCounts toward:Weights: Writing & creativity ×0.5 · Research & analysis ×1The test's websiteOfficial page ↗

The best 15 · 27 models tested

Top 15 · best setting per model · 27 models, 50 results (39 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
GDPval-AA v2.1 leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic1846MaxClaude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
2Claude Sonnet 5.5Anthropic1844MaxClaude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
3Claude Fable 5.1Anthropic1735MaxClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
4Claude Opus 5Anthropic1708MaxClaude Opus 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
5Grok 4.7SpaceXAI (formerly xAI)1695Extra highGrok 4.7 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
6MiMo-V2.6-ProXiaomi MiMo1678DefaultMiMo-V2.6-ProIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
7Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)1672MaxMuse Spark 1.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
8Qwen3.8 Max (0902)Qwen (Alibaba)1663DefaultQwen3.8 Max (0902)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
9GLM-5.3Z.ai (Zhipu)1644MaxGLM-5.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
10GLM-5.3-FlashZ.ai (Zhipu)1641DefaultGLM 5.3 FlashIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
11Gemini 4 ArgonGoogle (Gemini / DeepMind)1611HighGemini 4 Argon (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
12DeepSeek V4.1 FlashDeepSeek1600MaxDeepSeek V4.1 Flash (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
13GPT-5.6 SolOpenAI1588Maxreasoning effort=maxIndependent testIndependentArtificial Analysis (via Anthropic launch post) ↗—22 Sep 2026
14GPT-6.1 SolOpenAI1575MaxGPT-6.1 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
15Step 5 PreviewStepFun1566DefaultStep 5 PreviewIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
16GPT-6 AstraOpenAI1542MaxGPT-6 Astra (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
17Kimi K3Moonshot AI (Kimi)1540MaxKimi K3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
18GPT-6 SolOpenAI1505MaxGPT-6 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
19Claude Sonnet 5Anthropic1449Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
20GPT-6 LunaOpenAI1438MaxGPT-6 Luna (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
21Gemini 3.8 FlashGoogle (Gemini / DeepMind)1412HighGemini 3.8 Flash (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
22Qwen3.8 27BQwen (Alibaba)1411Extra highQwen3.8 27B (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
23MiniMax M3MiniMax1246DefaultMiniMax-M3Independent testIndependentArtificial Analysis ↗—1 Oct 2026
24InklingThinking Machines Lab1064Extra highInkling (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
25Nemotron 3 UltraNVIDIA1000DefaultNemotron 3 Ultra 550B A55B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
26Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)774HighMuse Glimmer (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
27Mistral Medium 3.5Mistral AI747DefaultMistral Medium 3.5Independent testIndependentArtificial Analysis ↗—1 Oct 2026