Skip to content
Bencher

TestsBenchmarks · Knowledge

HLE Diamond

Accuracy on a curated, harder and cleaner subset of Humanity's Last Exam.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 12 · 12 models tested

Top 12 · best setting per model · 12 models, 12 results (12 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
HLE Diamond leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI60.6%Defaultgpt-6-astraIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
2Claude Opus 5.5Anthropic55.0%Defaultclaude-opus-5-5Independent testIndependentScale AI SEAL ↗—1 Oct 2026
3Claude Fable 5.1Anthropic51.3%Defaultclaude-fable-5-1Independent testIndependentScale AI SEAL ↗—1 Oct 2026
4Claude Opus 5Anthropic38.6%Defaultclaude-opus-5Independent testIndependentScale AI SEAL ↗—1 Oct 2026
5Gemini 3.8 FlashGoogle (Gemini / DeepMind)34.3%Defaultgemini-3.8-flashIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
6GPT-6 SolOpenAI33.8%Defaultgpt-6-solIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
7GPT-5.6 SolOpenAI31.2%Defaultgpt-5.6-solIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
8Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)25.4%Defaultmuse-spark-1.3Independent testIndependentScale AI SEAL ↗—1 Oct 2026
9Grok 4.7SpaceXAI (formerly xAI)23.4%Defaultgrok-4.7Independent testIndependentScale AI SEAL ↗—1 Oct 2026
10Kimi K3Moonshot AI (Kimi)22.2%Defaultkimi-k3Independent testIndependentScale AI SEAL ↗—1 Oct 2026
11GLM-5.3Z.ai (Zhipu)16.4%Defaultglm-5.3Independent testIndependentScale AI SEAL ↗—1 Oct 2026
12DeepSeek V4 Pro (Preview, 0423)DeepSeek13.4%Defaultdeepseek-v4-proIndependent testIndependentScale AI SEAL ↗—1 Oct 2026