Skip to content
Bencher

TestsBenchmarks · Tool use

MCPMark

MCP tool-use tasks across Notion, GitHub, filesystem, Postgres and Playwright servers.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 4 · 4 models tested

Top 4 · best setting per model · 4 models, 4 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MCPMark leaderboard
Thinking levelSetting
1Qwen3.7 MaxQwen (Alibaba)60.8%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗—16 May 2026
2Qwen3.7 PlusQwen (Alibaba)58.7%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
3Kimi K2.6Moonshot AI (Kimi)55.9%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗—20 Apr 2026
4Qwen3.6 PlusQwen (Alibaba)48.2%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026