Skip to content
Bencher

TestsBenchmarks · Coding

SWE Marathon

Very long-horizon software engineering tasks (resolution rate, pass@1).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 4 · 4 models tested

Top 4 · best setting per model · 4 models, 4 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE Marathon leaderboard
Thinking levelSetting
1GLM-5.3Z.ai (Zhipu)42.5%Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗Claude Code 2.1.20714 Aug 2026
2Kimi K3Moonshot AI (Kimi)42.0%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗Claude Code16 Jul 2026
3Grok 4.5SpaceXAI (formerly xAI)29.0%Defaulteffort not stated (API default high)Maker's own figureVendor-reportedSpaceXAI ↗—16 Jul 2026
4GLM-5.2Z.ai (Zhipu)13.0%Maxmax effortMaker's own figureVendor-reportedZ.ai ↗—16 Jun 2026