TestsBenchmarks · Agentic
MLE-Bench (Partial 30)
Kaggle-style machine-learning engineering competitions; average position score.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 63.9% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | interactive Bash harness | 21 Jul 2026 |
| 2 | Gemini 3.5 Flash | Google (Gemini / DeepMind) | 49.7% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 3 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 42.6% | Defaultthinking level not stated (API default high) | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 4 | Gemini 3.5 Flash-Lite | Google (Gemini / DeepMind) | 39.2% | Highhigh thinking | Maker's own figureVendor-reportedGoogle ↗ | interactive Bash harness | 21 Jul 2026 |
| 5 | Gemini 3.1 Flash-Lite | Google (Gemini / DeepMind) | 22.0% | Highhigh thinking | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |