TestsBenchmarks · Knowledge
MMLU-Pro
Harder 10-option version of MMLU.
% solvedHigher is betterToo easy now: the top models all score near perfectSaturatedThe test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Qwen (Alibaba) | 89.6% | Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 16 May 2026 |
| 2 | Qwen3.7 Plus | Qwen (Alibaba) | 88.5% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 21 May 2026 |
| 3 | Qwen3.6 Plus | Qwen (Alibaba) | 88.5% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 2 Apr 2026 |
| 4 | DeepSeek V4 Pro (Preview, 0423) | DeepSeek | 87.5% | MaxThink Max | Maker's own figureVendor-reportedDeepSeek ↗ | — | 24 Apr 2026 |
| 5 | DeepSeek V4 Flash (Preview, 0423) | DeepSeek | 86.4% | HighThink High | Maker's own figureVendor-reportedDeepSeek ↗ | — | 24 Apr 2026 |
| 6 | Qwen3.6 27B | Qwen (Alibaba) | 86.2% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 22 Apr 2026 |
| 7 | Gemma 4 31B IT | Google (Gemini / DeepMind) | 85.2% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |
| 8 | Gemma 4 26B A4B IT | Google (Gemini / DeepMind) | 82.6% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |
| 9 | Mistral Small 4 | Mistral AI | 78.0% | HighReasoning (reasoning_effort=high) | Maker's own figureVendor-reportedMistral AI ↗ | — | 16 Mar 2026 |