Skip to content
Bencher

TestsBenchmarks · Coding

APEX-SWE

Mercor's professional software-engineering task benchmark.

% solvedHigher is betterCounts toward:Weights: Coding ×0.5The test's websiteOfficial page ↗

The best 2 · 2 models tested

Top 2 · best setting per model · 2 models, 2 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
APEX-SWE leaderboard
Thinking levelSetting
1Grok 4.6SpaceXAI (formerly xAI)56.4%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
2Grok 4.5SpaceXAI (formerly xAI)53.6%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026