TestsBenchmarks · Agentic
BrowseComp
Hard-to-find web information retrieval by a browsing agent.
% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.6The test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 91.5% | Defaultbest score across efforts (OpenAI table: "maximum at any effort") | Maker's own figureVendor-reportedOpenAI ↗ | — | 3 Sep 2026 |
| 2 | Kimi K3 | Moonshot AI (Kimi) | 91.2% | Maxreasoning_effort=max | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 16 Jul 2026 |
| 3 | Claude Opus 5 | Anthropic | 90.8% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 24 Jul 2026 |
| 4 | GPT-5.6 Sol | OpenAI | 90.4% | Defaultbest score across efforts (OpenAI table: "maximum at any effort") | Maker's own figureVendor-reportedOpenAI ↗ | — | 3 Sep 2026 |
| 5 | GPT-5.5 Pro | OpenAI | 90.1% | Extra highGPT-5.5 Pro, reasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 23 Apr 2026 |
| 6 | GPT-5.6 Terra | OpenAI | 87.5% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 7 | Claude Fable 5 | Anthropic | 87.4% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 24 Jul 2026 |
| 8 | Claude Sonnet 5 | Anthropic | 86.6% | Maxadaptive thinking, effort=max, multi-agent | Maker's own figureVendor-reportedAnthropic ↗ | — | 30 Jun 2026 |
| 9 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 85.9% | HighThinking (High) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 Feb 2026 |
| 10 | GPT-5.5 | OpenAI | 84.4% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 11 | Claude Opus 4.8 | Anthropic | 84.3% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 24 Jul 2026 |
| 12 | MiniMax M3 | MiniMax | 83.5% | Defaultsetting not stated | Maker's own figureVendor-reportedMiniMax ↗ | WebExplorer-style agent | 1 Jun 2026 |
| 13 | DeepSeek V4 Pro (Preview, 0423) | DeepSeek | 83.4% | MaxThink Max | Maker's own figureVendor-reportedDeepSeek ↗ | — | 24 Apr 2026 |
| 14 | GPT-5.6 Luna | OpenAI | 83.3% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 15 | Kimi K2.6 | Moonshot AI (Kimi) | 83.2% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 20 Apr 2026 |
| 16 | GPT-5.4 | OpenAI | 82.7% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 23 Apr 2026 |
| 17 | Claude Opus 4.7 | Anthropic | 79.8% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 28 May 2026 |
| 18 | MiniMax M2.7 | MiniMax | 76.3% | Defaultsetting not stated | Maker's own figureVendor-reportedMiniMax ↗ | — | 1 Jun 2026 |
| 19 | DeepSeek V4 Flash (Preview, 0423) | DeepSeek | 73.2% | MaxThink Max | Maker's own figureVendor-reportedDeepSeek ↗ | — | 24 Apr 2026 |
| 20 | GLM-5.1 | Z.ai (Zhipu) | 68.0% | Defaultthinking | Maker's own figureVendor-reportedZ.ai ↗ | — | 7 Apr 2026 |
| 21 | Mistral Medium 3.5 | Mistral AI | 48.6% | Highmaximum reasoning settings (reasoning_effort=high) | Maker's own figureVendor-reportedMistral AI ↗ | — | 22 May 2026 |
| 22 | Mistral Small 4 | Mistral AI | 21.3% | Defaultreasoning setting not stated | Maker's own figureVendor-reportedMistral AI ↗ | — | 22 May 2026 |