Skip to content
Bencher

TestsBenchmarks · Coding

FrontierSWE

Mean@5 score on 34 very long (up to 20h) expert-level engineering and research-engineering tasks.

% solvedHigher is betterCounts toward:Weights: Coding ×0.8The test's websiteOfficial page ↗

The best 13 · 13 models tested

Top 13 · best setting per model · 13 models, 15 results (10 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
FrontierSWE leaderboard
Thinking levelSetting
1Kimi K3Moonshot AI (Kimi)81.2%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code16 Jul 2026
2GLM-5.3Z.ai (Zhipu)78.1%Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
3GLM-5.2Z.ai (Zhipu)74.4%Maxmax effortMaker's own figureVendor-reportedZ.ai ↗—16 Jun 2026
4Qwen3.8 Max (0803)Qwen (Alibaba)73.5%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
5GPT-6 AstraOpenAI65.5%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026
6Claude Opus 5.5Anthropic62.3%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026
7Gemini 4 ArgonGoogle (Gemini / DeepMind)55.0%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026
8Qwen3.7 MaxQwen (Alibaba)40.7%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
9Grok 4.7SpaceXAI (formerly xAI)29.5%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026
10Qwen3.8 Max (0902)Qwen (Alibaba)15.8%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026
11DeepSeek V4 Flash Vision ExpDeepSeek14.8%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026
12Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)12.0%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026
13InklingThinking Machines Lab4.1%DefaultIndependent testIndependentFrontierSWE ↗proximus1 Oct 2026