TestsBenchmarks · Reasoning
LABBench2
Biology real-world research tasks, macro-average of 11 sub-tasks.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 4 Argon | Google (Gemini / DeepMind) | 88.8% | Maxhighest thinking settings | Maker's own figureVendor-reportedGoogle ↗ | — | 30 Sep 2026 |
| 2 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 86.2% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Sep 2026 |
| 3 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 82.1% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 13 Aug 2026 |
| 4 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 76.1% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 13 Aug 2026 |