TestsBenchmarks · Math
IMO-AnswerBench
Olympiad-level math problems with short verifiable answers.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | GLM-5.2 | Z.ai (Zhipu) | 91.0% | Defaultthinking (effort not stated) | Maker's own figureVendor-reportedZ.ai ↗ | — | 16 Jun 2026 |
| 2 | Qwen3.7 Max | Qwen (Alibaba) | 90.0% | Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 16 May 2026 |
| 3 | DeepSeek V4 Pro (Preview, 0423) | DeepSeek | 89.8% | MaxThink Max | Maker's own figureVendor-reportedDeepSeek ↗ | — | 24 Apr 2026 |
| 4 | DeepSeek V4 Flash (Preview, 0423) | DeepSeek | 88.4% | MaxThink Max | Maker's own figureVendor-reportedDeepSeek ↗ | — | 24 Apr 2026 |
| 5 | Qwen3.7 Plus | Qwen (Alibaba) | 86.0% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 21 May 2026 |
| 6 | Kimi K2.6 | Moonshot AI (Kimi) | 86.0% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 20 Apr 2026 |
| 7 | Qwen3.6 Plus | Qwen (Alibaba) | 83.8% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 2 Apr 2026 |
| 8 | GLM-5.1 | Z.ai (Zhipu) | 83.8% | Defaultthinking | Maker's own figureVendor-reportedZ.ai ↗ | — | 7 Apr 2026 |
| 9 | Qwen3.6 27B | Qwen (Alibaba) | 80.8% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 22 Apr 2026 |