TestsBenchmarks · Tool use
MCPMark
MCP tool-use tasks across Notion, GitHub, filesystem, Postgres and Playwright servers.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Qwen (Alibaba) | 60.8% | Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 16 May 2026 |
| 2 | Qwen3.7 Plus | Qwen (Alibaba) | 58.7% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 21 May 2026 |
| 3 | Kimi K2.6 | Moonshot AI (Kimi) | 55.9% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 20 Apr 2026 |
| 4 | Qwen3.6 Plus | Qwen (Alibaba) | 48.2% | Defaultthinking | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 2 Apr 2026 |