TestsBenchmarks · Agentic
MLS-Bench-Lite
30-task subset of MLS-Bench: invent generalisable ML methods within 5 hours.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI (Kimi) | 48.3% | Maxreasoning_effort=max | Maker's own figureVendor-reportedMoonshot AI ↗ | Kimi Code | 16 Jul 2026 |
| 2 | Qwen3.8 Max (0803) | Qwen (Alibaba) | 41.0% | Defaultthinking (default reasoning_effort=xhigh; eval setting not stated) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | Claude Code | 3 Aug 2026 |
| 3 | Kimi K2.7 Code | Moonshot AI (Kimi) | 35.1% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | Kimi Code CLI | 12 Jun 2026 |
| 4 | Qwen3.7 Max | Qwen (Alibaba) | 31.7% | Defaultthinking (setting not stated) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | Claude Code | 3 Aug 2026 |
| 5 | Kimi K2.6 | Moonshot AI (Kimi) | 26.7% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | Kimi Code CLI | 12 Jun 2026 |