TestsBenchmarks · Coding
APEX-SWE
Mercor's professional software-engineering task benchmark.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Grok 4.6 | SpaceXAI (formerly xAI) | 56.4% | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |
| 2 | Grok 4.5 | SpaceXAI (formerly xAI) | 53.6% | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |