Skip to content
Bencher

TestsBenchmarks · Coding

DeepSWE 1.0

Earlier version of Datacurve's long-horizon software engineering benchmark.

% solvedHigher is betterCounts toward:Weights: Coding ×0.5The test's websiteOfficial page ↗

The best 1 · 1 models tested

Top 1 · best setting per model · 1 models, 1 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
DeepSWE 1.0 leaderboard
Thinking levelSetting
1Grok 4.5SpaceXAI (formerly xAI)62.0%Defaulteffort not stated (API default high)Maker's own figureVendor-reportedSpaceXAI ↗each provider's harness, run by Artificial Analysis16 Jul 2026