Skip to content
Bencher

TestsBenchmarks · Knowledge

MMLU-Pro

Harder 10-option version of MMLU.

% solvedHigher is betterToo easy now: the top models all score near perfectSaturatedThe test's websiteOfficial page ↗

The best 9 · 9 models tested

Top 9 · best setting per model · 9 models, 14 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MMLU-Pro leaderboard
Thinking levelSetting
1Qwen3.7 MaxQwen (Alibaba)89.6%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗—16 May 2026
2Qwen3.7 PlusQwen (Alibaba)88.5%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
3Qwen3.6 PlusQwen (Alibaba)88.5%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026
4DeepSeek V4 Pro (Preview, 0423)DeepSeek87.5%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
5DeepSeek V4 Flash (Preview, 0423)DeepSeek86.4%HighThink HighMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
6Qwen3.6 27BQwen (Alibaba)86.2%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—22 Apr 2026
7Gemma 4 31B ITGoogle (Gemini / DeepMind)85.2%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026
8Gemma 4 26B A4B ITGoogle (Gemini / DeepMind)82.6%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026
9Mistral Small 4Mistral AI78.0%HighReasoning (reasoning_effort=high)Maker's own figureVendor-reportedMistral AI ↗—16 Mar 2026