Skip to content
Bencher

TestsBenchmarks · Math

IMO-AnswerBench

Olympiad-level math problems with short verifiable answers.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 9 · 9 models tested

Top 9 · best setting per model · 9 models, 13 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
IMO-AnswerBench leaderboard
Thinking levelSetting
1GLM-5.2Z.ai (Zhipu)91.0%Defaultthinking (effort not stated)Maker's own figureVendor-reportedZ.ai ↗—16 Jun 2026
2Qwen3.7 MaxQwen (Alibaba)90.0%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗—16 May 2026
3DeepSeek V4 Pro (Preview, 0423)DeepSeek89.8%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
4DeepSeek V4 Flash (Preview, 0423)DeepSeek88.4%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
5Qwen3.7 PlusQwen (Alibaba)86.0%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
6Kimi K2.6Moonshot AI (Kimi)86.0%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗—20 Apr 2026
7Qwen3.6 PlusQwen (Alibaba)83.8%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026
8GLM-5.1Z.ai (Zhipu)83.8%DefaultthinkingMaker's own figureVendor-reportedZ.ai ↗—7 Apr 2026
9Qwen3.6 27BQwen (Alibaba)80.8%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—22 Apr 2026