Skip to content
Bencher

TestsBenchmarks · Tool use

MCPMark Verified

Human-verified edition of MCPMark.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 3 · 3 models tested

Top 3 · best setting per model · 3 models, 3 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MCPMark Verified leaderboard
Thinking levelSetting
1Kimi K3Moonshot AI (Kimi)94.5%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗—16 Jul 2026
2Kimi K2.7 CodeMoonshot AI (Kimi)81.1%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026
3Kimi K2.6Moonshot AI (Kimi)72.8%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026