Skip to content
Bencher

TestsBenchmarks · Reasoning

Humanity's Last Exam (with tools)

HLE with search/code tools (vendors blocklist HLE-discussing sources).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 32 models tested

Top 15 · best setting per model · 32 models, 43 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Humanity's Last Exam (with tools) leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic67.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
2Claude Fable 5.1Anthropic65.1%Extra highadaptive thinking, effort=xhighMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
3Claude Sonnet 5.5Anthropic64.5%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
4DeepSeek V4.1 FlashDeepSeek63.9%Maxreasoning_effort=100 (max)Maker's own figureVendor-reportedDeepSeek ↗—10 Sep 2026
5Claude Fable 5Anthropic63.8%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
6Claude Opus 5Anthropic63.6%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
7GLM-5.3Z.ai (Zhipu)62.5%Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
8Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)62.1%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
9DeepSeek V4 Pro (0813)DeepSeek60.0%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
10Claude Opus 4.8Anthropic57.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
11GPT-6 AstraOpenAI57.2%Defaultbest score across efforts (OpenAI table: "maximum at any effort")Maker's own figureVendor-reportedOpenAI ↗—3 Sep 2026
12GPT-5.5 ProOpenAI57.2%Extra highGPT-5.5 Pro, reasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
13Qwen3.8 Max (0803)Qwen (Alibaba)56.2%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
14Kimi K3Moonshot AI (Kimi)56.0%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗—16 Jul 2026
15GLM-5.3-FlashZ.ai (Zhipu)55.3%Maxreasoning_effort=max (default)Maker's own figureVendor-reportedZ.ai ↗—26 Aug 2026
16Claude Sonnet 5Anthropic54.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
17Claude Opus 4.7Anthropic54.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 May 2026
18GLM-5.2Z.ai (Zhipu)54.7%Defaultthinking (effort not stated)Maker's own figureVendor-reportedZ.ai ↗—16 Jun 2026
19Kimi K2.6Moonshot AI (Kimi)54.0%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗—20 Apr 2026
20Qwen3.7 MaxQwen (Alibaba)53.5%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗—16 May 2026
21Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)53.4%MaxDeep ThinkMaker's own figureVendor-reportedGoogle ↗—12 Feb 2026
22GLM-5.1Z.ai (Zhipu)52.3%DefaultthinkingMaker's own figureVendor-reportedZ.ai ↗—7 Apr 2026
23GPT-5.5OpenAI52.2%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
24GPT-5.4OpenAI52.1%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
25DeepSeek V4 Flash (0731)DeepSeek51.5%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
26Qwen3.6 PlusQwen (Alibaba)50.6%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026
27Muse SparkMeta (Meta Superintelligence Labs, Muse)50.4%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
28DeepSeek V4 Pro (Preview, 0423)DeepSeek48.2%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
29Claude Sonnet 4.6Anthropic46.8%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—30 Jun 2026
30DeepSeek V4 Flash (Preview, 0423)DeepSeek45.1%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
31Gemma 4 31B ITGoogle (Gemini / DeepMind)26.5%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026
32Gemma 4 26B A4B ITGoogle (Gemini / DeepMind)17.2%DefaultThinkingMaker's own figureVendor-reportedGoogle ↗—2 Apr 2026