Skip to content
Bencher

TestsBenchmarks · Reasoning

HLE-Verified

1,811-item verified/revised subset of Humanity's Last Exam.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 3 · 3 models tested

Top 3 · best setting per model · 3 models, 3 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
HLE-Verified leaderboard
Thinking levelSetting
1Gemini 3.8 FlashGoogle (Gemini / DeepMind)54.9%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026
2Gemini 3.7 FlashGoogle (Gemini / DeepMind)53.6%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
3Gemini 3.6 FlashGoogle (Gemini / DeepMind)51.2%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026