Skip to content
Bencher

TestsBenchmarks · Knowledge

MMMLU

Multilingual MMLU.

% solvedHigher is betterToo easy now: the top models all score near perfectSaturatedThe test's websiteOfficial page ↗

The best 7 · 7 models tested

Top 7 · best setting per model · 7 models, 7 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MMMLU leaderboard
Thinking levelSetting
1Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)92.6%HighThinking (High)Maker's own figureVendor-reportedGoogle ↗—19 Feb 2026
2Qwen3.7 MaxQwen (Alibaba)90.3%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗—16 May 2026
3Qwen3.6 PlusQwen (Alibaba)89.5%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026
4Qwen3.7 PlusQwen (Alibaba)89.0%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
5Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)88.9%HighMaker's own figureVendor-reportedGoogle ↗—3 Mar 2026
6Gemma 4 31B ITGoogle (Gemini / DeepMind)88.4%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026
7Gemma 4 26B A4B ITGoogle (Gemini / DeepMind)86.3%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026