TestsBenchmarks · Multimodal
GDP.pdf
Surge AI benchmark of professional questions about complex PDFs.
% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 35.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Sep 2026 |
| 2 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 34.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 13 Aug 2026 |
| 3 | GPT-6 Astra | OpenAI | 32.2% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 29 Sep 2026 |
| 4 | GPT-6.1 Sol | OpenAI | 32.0% | Highreasoning effort=high | Maker's own figureVendor-reportedOpenAI ↗ | — | 29 Sep 2026 |
| 5 | GPT-5.6 Sol | OpenAI | 30.7% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 6 | Claude Fable 5 | Anthropic | 29.8% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 9 Jun 2026 |
| 7 | Claude Opus 5.5 | Anthropic | 28.8% | Higheffort=high | Independent testIndependentOpenAI (competitor result in OpenAI launch post) ↗ | — | 29 Sep 2026 |
| 8 | GPT-6 Sol | OpenAI | 28.0% | Highreasoning effort=high | Maker's own figureVendor-reportedOpenAI ↗ | — | 29 Sep 2026 |
| 9 | GPT-5.5 | OpenAI | 26.0% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 10 | GPT-5.6 Terra | OpenAI | 24.7% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 11 | GPT-5.6 Luna | OpenAI | 22.7% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 12 | Claude Opus 4.8 | Anthropic | 22.5% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 9 Jun 2026 |
| 13 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 22.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 13 Aug 2026 |