TestsBenchmarks · Agentic
APEX-Agents
Long-horizon professional tasks (Mercor).
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Grok 4.6 | SpaceXAI (formerly xAI) | 57.5% | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |
| 2 | Grok 4.5 | SpaceXAI (formerly xAI) | 47.1% | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |
| 3 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 33.5% | HighThinking (High) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 Feb 2026 |
| 4 | MiniMax M3 | MiniMax | 27.7% | Defaultsetting not stated | Maker's own figureVendor-reportedMiniMax ↗ | ReAct Toolbelt (archipelago) | 1 Jun 2026 |