Skip to content
Bencher

TestsBenchmarks · Knowledge

GDPval-AA (v1)

Artificial Analysis agentic GDPval variant, Elo from blind pairwise comparisons.

Elo ratingHigher is betterThe test's websiteOfficial page ↗

The best 9 · 9 models tested

Top 9 · best setting per model · 9 models, 9 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
GDPval-AA (v1) leaderboard
Thinking levelSetting
1Claude Fable 5Anthropic1932Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—9 Jun 2026
2Claude Opus 4.8Anthropic1890Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—9 Jun 2026
3Claude Opus 4.7Anthropic1753Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 May 2026
4Gemini 3.5 FlashGoogle (Gemini / DeepMind)1656Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
5DeepSeek V4 Pro (Preview, 0423)DeepSeek1554MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
6MiniMax M2.7MiniMax1495Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—18 Mar 2026
7DeepSeek V4 Flash (Preview, 0423)DeepSeek1395MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
8Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)1317HighThinking (High)Maker's own figureVendor-reportedGoogle ↗—19 Feb 2026
9Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)953HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026