Skip to content
Bencher

TestsBenchmarks · Agentic

Agents' Last Exam

Long-horizon, economically valuable computer tasks spanning 55 sub-industries.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 26 models tested

Top 15 · best setting per model · 26 models, 53 results (7 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Agents' Last Exam leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI59.3%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
2GPT-6 SolOpenAI56.4%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
3Claude Opus 5Anthropic55.9%Higheffort=highIndependent testIndependentOpenAI (competitor result in OpenAI launch post) ↗—22 Sep 2026
4GPT-5.6 SolOpenAI53.6%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
5GPT-6 LunaOpenAI50.9%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
6GPT-5.6 TerraOpenAI50.4%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
7GPT-5.6 LunaOpenAI50.4%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
8Claude Fable 5Anthropic48.7%Extra higheffort=xhighIndependent testIndependentOpenAI (competitor result in OpenAI launch post) ↗—22 Sep 2026
9GPT-5.5OpenAI46.9%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
10Gemini 4 ArgonGoogle (Gemini / DeepMind)39.5%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗ALE-Claw30 Sep 2026
11DeepSeek V4.1 FlashDeepSeek31.8%Maxreasoning_effort=100 (max)Maker's own figureVendor-reportedDeepSeek ↗official scaffold10 Sep 2026
12GLM-5.3Z.ai (Zhipu)28.5%Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗Claude Code14 Aug 2026
13Kimi K3Moonshot AI (Kimi)28.3%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code16 Jul 2026
14DeepSeek V4 Flash Vision ExpDeepSeek27.3%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—21 Aug 2026
15Qwen3.8 Max (0803)Qwen (Alibaba)27.0%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
16Gemini 3.7 FlashGoogle (Gemini / DeepMind)26.3%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗ALE-Claw13 Aug 2026
17GLM-5.3-FlashZ.ai (Zhipu)26.3%Maxreasoning_effort=max (default)Maker's own figureVendor-reportedZ.ai ↗Claude Code26 Aug 2026
18DeepSeek V4 Pro (0813)DeepSeek25.7%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
19DeepSeek V4 Flash (0731)DeepSeek25.2%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—31 Jul 2026
20Qwen3.8 FlashQwen (Alibaba)24.3%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—26 Aug 2026
21Gemini 3.6 FlashGoogle (Gemini / DeepMind)24.2%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗ALE-Claw13 Aug 2026
22GLM-5.2Z.ai (Zhipu)23.8%Maxsetting not stated (GLM-5.3 blog comparison column)Maker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
23Qwen3.8 27BQwen (Alibaba)20.4%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—14 Aug 2026
24DeepSeek V4 Pro (Preview, 0423)DeepSeek16.5%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
25DeepSeek V4 Flash (Preview, 0423)DeepSeek15.8%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
26Qwen3.7 MaxQwen (Alibaba)11.8%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026