Skip to content
Bencher

TestsBenchmarks · Multimodal

GDP.pdf

Surge AI benchmark of professional questions about complex PDFs.

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗

The best 13 · 13 models tested

Top 13 · best setting per model · 13 models, 29 results (5 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
GDP.pdf leaderboard
Thinking levelSetting
1Gemini 3.8 FlashGoogle (Gemini / DeepMind)35.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026
2Gemini 3.7 FlashGoogle (Gemini / DeepMind)34.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
3GPT-6 AstraOpenAI32.2%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—29 Sep 2026
4GPT-6.1 SolOpenAI32.0%Highreasoning effort=highMaker's own figureVendor-reportedOpenAI ↗—29 Sep 2026
5GPT-5.6 SolOpenAI30.7%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
6Claude Fable 5Anthropic29.8%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—9 Jun 2026
7Claude Opus 5.5Anthropic28.8%Higheffort=highIndependent testIndependentOpenAI (competitor result in OpenAI launch post) ↗—29 Sep 2026
8GPT-6 SolOpenAI28.0%Highreasoning effort=highMaker's own figureVendor-reportedOpenAI ↗—29 Sep 2026
9GPT-5.5OpenAI26.0%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
10GPT-5.6 TerraOpenAI24.7%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
11GPT-5.6 LunaOpenAI22.7%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
12Claude Opus 4.8Anthropic22.5%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—9 Jun 2026
13Gemini 3.6 FlashGoogle (Gemini / DeepMind)22.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026