TestsBenchmarks · Coding
DeepSWE 1.0
Earlier version of Datacurve's long-horizon software engineering benchmark.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Grok 4.5 | SpaceXAI (formerly xAI) | 62.0% | Defaulteffort not stated (API default high) | Maker's own figureVendor-reportedSpaceXAI ↗ | each provider's harness, run by Artificial Analysis | 16 Jul 2026 |