TestsBenchmarks · Coding
QwenSWEBench (internal)
Qwen in-house software-engineering benchmark run in Claude Code (vendor-internal, not comparable across vendors).
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 Max (0803) | Qwen (Alibaba) | 80.7% | Defaultthinking (default reasoning_effort=xhigh; eval setting not stated) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | Claude Code | 3 Aug 2026 |
| 2 | Qwen3.8 27B | Qwen (Alibaba) | 79.0% | Defaultthinking (default reasoning_effort=xhigh; eval setting not stated) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | Claude Code | 14 Aug 2026 |