Skip to content
Bencher

TestsBenchmarks · Coding

QwenSWEBench (internal)

Qwen in-house software-engineering benchmark run in Claude Code (vendor-internal, not comparable across vendors).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 2 · 2 models tested

Top 2 · best setting per model · 2 models, 2 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
QwenSWEBench (internal) leaderboard
Thinking levelSetting
1Qwen3.8 Max (0803)Qwen (Alibaba)80.7%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
2Qwen3.8 27BQwen (Alibaba)79.0%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code14 Aug 2026