Skip to content
Bencher

TestsBenchmarks · Agentic

MLE-Bench (Partial 30)

Kaggle-style machine-learning engineering competitions; average position score.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 5 · 5 models tested

Top 5 · best setting per model · 5 models, 5 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MLE-Bench (Partial 30) leaderboard
Thinking levelSetting
1Gemini 3.6 FlashGoogle (Gemini / DeepMind)63.9%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗interactive Bash harness21 Jul 2026
2Gemini 3.5 FlashGoogle (Gemini / DeepMind)49.7%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
3Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)42.6%Defaultthinking level not stated (API default high)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
4Gemini 3.5 Flash-LiteGoogle (Gemini / DeepMind)39.2%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗interactive Bash harness21 Jul 2026
5Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)22.0%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗—21 Jul 2026