Skip to content
Bencher

TestsBenchmarks · Agentic

MLS-Bench-Lite

30-task subset of MLS-Bench: invent generalisable ML methods within 5 hours.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 5 · 5 models tested

Top 5 · best setting per model · 5 models, 5 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MLS-Bench-Lite leaderboard
Thinking levelSetting
1Kimi K3Moonshot AI (Kimi)48.3%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code16 Jul 2026
2Qwen3.8 Max (0803)Qwen (Alibaba)41.0%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
3Kimi K2.7 CodeMoonshot AI (Kimi)35.1%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026
4Qwen3.7 MaxQwen (Alibaba)31.7%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
5Kimi K2.6Moonshot AI (Kimi)26.7%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026