TestsBenchmarks · Multimodal
MMMU-Pro (no tools)
Multimodal college-level reasoning.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.5 Flash | Google (Gemini / DeepMind) | 83.6% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |
| 2 | GPT-5.6 Sol | OpenAI | 83.0% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 3 | Qwen3.8 Max (0803) | Qwen (Alibaba) | 82.3% | Defaultthinking (default reasoning_effort=xhigh; eval setting not stated) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 3 Aug 2026 |
| 4 | Kimi K3 | Moonshot AI (Kimi) | 81.6% | Maxreasoning_effort=max | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 16 Jul 2026 |
| 5 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 81.5% | MaxDeep Think | Maker's own figureVendor-reportedGoogle ↗ | — | 12 Feb 2026 |
| 6 | GPT-5.5 | OpenAI | 81.2% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 7 | GPT-5.6 Terra | OpenAI | 80.7% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 8 | Kimi K2.6 | Moonshot AI (Kimi) | 79.4% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 20 Apr 2026 |
| 9 | Qwen3.7 Plus | Qwen (Alibaba) | 79.0% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 21 May 2026 |
| 10 | GPT-5.6 Luna | OpenAI | 78.4% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 11 | MiniMax M3 | MiniMax | 78.1% | Defaultsetting not stated | Maker's own figureVendor-reportedMiniMax ↗ | — | 1 Jun 2026 |
| 12 | Gemma 4 31B IT | Google (Gemini / DeepMind) | 76.9% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |
| 13 | Gemini 3.1 Flash-Lite | Google (Gemini / DeepMind) | 76.8% | High | Maker's own figureVendor-reportedGoogle ↗ | — | 3 Mar 2026 |
| 14 | Qwen3.6 27B | Qwen (Alibaba) | 75.8% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 22 Apr 2026 |
| 15 | Muse Glimmer 30B | Meta (Meta Superintelligence Labs, Muse) | 74.0% | HighHigh reasoning | Maker's own figureVendor-reportedMeta ↗ | — | 10 Aug 2026 |
| 16 | Gemma 4 26B A4B IT | Google (Gemini / DeepMind) | 73.8% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |
| 17 | Mistral Small 4 | Mistral AI | 60.0% | HighReasoning (reasoning_effort=high) | Maker's own figureVendor-reportedMistral AI ↗ | — | 16 Mar 2026 |