Skip to content
Bencher

TestsBenchmarks · Knowledge

GDPval-AA v2

GDPval-AA version 2 (Elo; not comparable to v1 or v2.1).

Elo ratingHigher is betterThe test's websiteOfficial page ↗

The best 15 · 26 models tested

Top 15 · best setting per model · 26 models, 27 results (1 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
GDPval-AA v2 leaderboard
Thinking levelSetting
1Claude Fable 5.1Anthropic1853Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
2Claude Opus 5Anthropic1827Extra highadaptive thinking, effort=xhighMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
3GLM-5.3-FlashZ.ai (Zhipu)1773Maxreasoning_effort=max (default)Maker's own figureVendor-reportedZ.ai ↗—26 Aug 2026
4GLM-5.3Z.ai (Zhipu)1769Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
5Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)1754Maxmax reasoningMaker's own figureVendor-reportedMeta ↗AA Stirrup2 Sep 2026
6Grok 4.6SpaceXAI (formerly xAI)1753HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
7Claude Fable 5Anthropic1723Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
8GPT-5.6 SolOpenAI1711Defaultas listed by AnthropicIndependent testIndependentArtificial Analysis (via Anthropic launch post) ↗—1 Sep 2026
9Kimi K3Moonshot AI (Kimi)1686Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗—16 Jul 2026
10Claude Sonnet 5Anthropic1618Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—30 Jun 2026
11Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)1615Extra highMaker's own figureVendor-reportedMeta ↗AA Stirrup2 Sep 2026
12Claude Opus 4.8Anthropic1593Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
13GPT-5.6 TerraOpenAI1593DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
14GPT-5.6 LunaOpenAI1592DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
15Gemini 3.8 FlashGoogle (Gemini / DeepMind)1545Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026
16Grok 4.5SpaceXAI (formerly xAI)1526HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
17Gemini 3.7 FlashGoogle (Gemini / DeepMind)1525Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
18GLM-5.2Z.ai (Zhipu)1508Maxsetting not stated (GLM-5.3 blog comparison column)Maker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
19GPT-5.5OpenAI1494DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
20Gemini 3.6 FlashGoogle (Gemini / DeepMind)1421Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
21Claude Sonnet 4.6Anthropic1395Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—30 Jun 2026
22Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)1371Extra highMaker's own figureVendor-reportedMeta ↗AA Stirrup5 Aug 2026
23Gemini 3.5 FlashGoogle (Gemini / DeepMind)1349Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
24Gemini 3.5 Flash-LiteGoogle (Gemini / DeepMind)1140Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗—21 Jul 2026
25Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)965Defaultthinking level not stated (API default high)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
26Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)642Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗—21 Jul 2026