TestsBenchmarks · Tool use
MCPMark Verified
Human-verified edition of MCPMark.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI (Kimi) | 94.5% | Maxreasoning_effort=max | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 16 Jul 2026 |
| 2 | Kimi K2.7 Code | Moonshot AI (Kimi) | 81.1% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | Kimi Code CLI | 12 Jun 2026 |
| 3 | Kimi K2.6 | Moonshot AI (Kimi) | 72.8% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | Kimi Code CLI | 12 Jun 2026 |