Skip to content
Bencher

TestsBenchmarks · Agentic

APEX-Agents

Long-horizon professional tasks (Mercor).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 4 · 4 models tested

Top 4 · best setting per model · 4 models, 4 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
APEX-Agents leaderboard
Thinking levelSetting
1Grok 4.6SpaceXAI (formerly xAI)57.5%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
2Grok 4.5SpaceXAI (formerly xAI)47.1%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
3Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)33.5%HighThinking (High)Maker's own figureVendor-reportedGoogle ↗—19 Feb 2026
4MiniMax M3MiniMax27.7%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗ReAct Toolbelt (archipelago)1 Jun 2026