TestsBenchmarks · Agentic
PostTrainBench v1.1
ML engineering: post-train base models within a 10-hour single-H100 budget.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 4 Argon | Google (Gemini / DeepMind) | 45.3% | Maxhighest thinking settings | Maker's own figureVendor-reportedGoogle ↗ | OpenCode | 30 Sep 2026 |
| 2 | GLM-5.3 | Z.ai (Zhipu) | 39.8% | Maxreasoning_effort=max | Maker's own figureVendor-reportedZ.ai ↗ | Claude Code 2.1.207 | 14 Aug 2026 |
| 3 | MiniMax M3 | MiniMax | 37.1% | Defaultsetting not stated | Maker's own figureVendor-reportedMiniMax ↗ | Claude Code (Ralph-Loop, 12h) | 1 Jun 2026 |
| 4 | Kimi K3 | Moonshot AI (Kimi) | 36.6% | Maxreasoning_effort=max | Maker's own figureVendor-reportedMoonshot AI ↗ | Claude Code | 16 Jul 2026 |
| 5 | GLM-5.2 | Z.ai (Zhipu) | 34.3% | Maxmax effort | Maker's own figureVendor-reportedZ.ai ↗ | — | 16 Jun 2026 |