Skip to content
Bencher

TestsBenchmarks · Multimodal

MMMU-Pro (no tools)

Multimodal college-level reasoning.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 17 models tested

Top 15 · best setting per model · 17 models, 20 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MMMU-Pro (no tools) leaderboard
Thinking levelSetting
1Gemini 3.5 FlashGoogle (Gemini / DeepMind)83.6%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
2GPT-5.6 SolOpenAI83.0%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
3Qwen3.8 Max (0803)Qwen (Alibaba)82.3%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
4Kimi K3Moonshot AI (Kimi)81.6%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗—16 Jul 2026
5Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)81.5%MaxDeep ThinkMaker's own figureVendor-reportedGoogle ↗—12 Feb 2026
6GPT-5.5OpenAI81.2%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
7GPT-5.6 TerraOpenAI80.7%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
8Kimi K2.6Moonshot AI (Kimi)79.4%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗—20 Apr 2026
9Qwen3.7 PlusQwen (Alibaba)79.0%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
10GPT-5.6 LunaOpenAI78.4%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
11MiniMax M3MiniMax78.1%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—1 Jun 2026
12Gemma 4 31B ITGoogle (Gemini / DeepMind)76.9%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026
13Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)76.8%HighMaker's own figureVendor-reportedGoogle ↗—3 Mar 2026
14Qwen3.6 27BQwen (Alibaba)75.8%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—22 Apr 2026
15Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)74.0%HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026
16Gemma 4 26B A4B ITGoogle (Gemini / DeepMind)73.8%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026
17Mistral Small 4Mistral AI60.0%HighReasoning (reasoning_effort=high)Maker's own figureVendor-reportedMistral AI ↗—16 Mar 2026