Skip to content
Bencher

Models · Qwen (Alibaba) · Out sinceReleased 16 May 2026

Qwen3.7 Max

Available on OpenRouterOn OpenRouterAvailable nowGenerally availableClosed (can't be downloaded)Proprietary

Qwen3.7 Max is made by Qwen (Alibaba). We don't have enough test results yet to rank it. It's mid-priced to use.

Previous-gen proprietary flagship; text-only. Thinking toggled via enable_thinking; preserve_thinking recommended for agentic tasks. Vendor recommends system prompt 'Reasoning effort is set to xhigh...' for reasoning scenarios.

Writing & creativity
—
Research & analysis
—
Coding
—
Price
Mid-priced$2.50 / $7.50
Price per 1M (blended)Blended / 1M
$3.75
MemoryContext
1M
Longest answerMax output
131K
Test resultsResults
33 (8 independent8 indep.)
Out sinceReleased
16 May 2026
Made byVendor
Qwen (Alibaba)
UnderstandsInputs
text

Scores are out of 100 for each area, compared with every model we track; “#” is its rank. Context is how much text it can read at once (1M is roughly 700,000 words). Blended price mixes the cost of what you send and what it writes back.

Using it through OpenRouter

On OpenRouter

OpenRouter is a service that gives access to many AI models in one place. This model is listed there as qwen/qwen3.7-max.

Route it as qwen/qwen3.7-max at $1.48 in / $4.42 out per 1M tokens, 1M context. Listed since 21 May 2026.

frequency_penaltyinclude_reasoninglogprobsmax_tokenspresence_penaltyreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

Every test result

Every result

All the numbers,with where they came from.

Every result we've found for this model, with who measured it and a link to where we read it.

All raw rows (vendor and independent kept separate), with setting label, source, date, harness and notes.

All results for this model
NotesNotes
Agents' Last Exam11.8%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗3 Aug 2026—Qwen3.7-Max column in the Qwen3.8-Max launch table
AutomationBench14.2%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗3 Aug 2026—Qwen3.7-Max column in the Qwen3.8-Max launch table
DeepSWE21.6%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗3 Aug 2026Claude Code / mini-SWE-agent (best)Qwen3.7-Max column in the Qwen3.8-Max launch table
FrontierSWE40.7%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗3 Aug 2026Claude CodeQwen3.7-Max column in the Qwen3.8-Max launch table
GPQA Diamond90.2%DefaultIndependent testIndependentVals.ai ↗1 Sep 2026—±1.497 stderr; $0.061/test
GPQA Diamond92.4%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
HMMT February 202697.1%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—HMMT 2026 Feb
Humanity's Last Exam41.4%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
Humanity's Last Exam (with tools)53.5%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
IMO-AnswerBench90.0%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
LiveCodeBench87.1%DefaultIndependent testIndependentVals.ai ↗1 Sep 2026—±0.974 stderr; $0.087/test
LiveCodeBench91.6%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
LLM Creative Story-Writing Benchmark (Lech Mazur)-2.6DefaultQwen 3.7 MaxIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗28 Sep 2026—rank 50/56; Thurstone comparison score (centered at 0); est. win chance 15%; 95% bootstrap -2.783 to -2.523
LMArena Text - Coding category1524Defaultqwen3.7-max-previewIndependent testIndependentLMArena ↗30 Sep 2026—text arena coding category, style control on; rank 25 (CI rank 5-77); 95% CI 1506-1542; 1167 votes
MathArena Apex44.5%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—Reported as 'Apex'
MCP Atlas76.4%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—Public set, gemini-2.5-pro judge
MCPMark60.8%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
MLS-Bench-Lite31.7%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗3 Aug 2026Claude CodeQwen3.7-Max column in the Qwen3.8-Max launch table
MMLU-Pro89.6%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
MMMLU90.3%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
NL2Repo-Bench47.2%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026Claude Code
SciCode53.5%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026—
SimpleBench70.4%DefaultQwen 3.7 MaxIndependent testIndependentSimpleBench ↗22 May 2026—AVG@5, temp 0.7; rank 17th; human baseline 83.7%; data https://simple-bench.com/static/js/leaderboard-data.js
SimpleQA Verified55.8%Defaultqwen3.7-maxIndependent testIndependentEpoch AI ↗27 Aug 2026—Epoch-run (no tools); ±1.57 stderr
SkillsBench59.2%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026OpenCode78 tasks, avg of 5 runs
SWE-bench Multilingual78.3%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026Internal scaffold (bash + file-edit)
SWE-Bench Pro (public, v1)60.6%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026Internal scaffold (bash + file-edit)Qwen-corrected ('refined') SWE-bench Pro
SWE-bench Verified77.3%Defaultqwen3.7-maxIndependent testIndependentEpoch AI ↗18 Jun 2026—Epoch-run SWE-bench Verified (Epoch scaffold); no runs after 2026-06; stderr 1.9pt; data https://epoch.ai/data/benchmark_data.zip (swe_bench_verified.csv)
SWE-bench Verified80.4%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026Internal scaffold (bash + file-edit)200K ctx
Terminal-Bench 2.069.7%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗16 May 2026Terminus 2 (Harbor)5h timeout, max_tokens=80K, 256K ctx, avg of 5 runs; model decides per turn whether to think
Terminal-Bench 2.174.5%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗3 Aug 2026Claude CodeQwen3.7-Max column in the Qwen3.8-Max launch table
Toolathlon-Verified49.7%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗3 Aug 2026—Qwen3.7-Max column in the Qwen3.8-Max launch table
Vals TaxEval v275.3%Defaultvals id alibaba/qwen3.7-maxIndependent testIndependentVals.ai ↗1 Sep 2026—vals id alibaba/qwen3.7-max; rank 19/145; ±0.839 stderr; $0.028122/test