Skip to content
Bencher

TestsBenchmarks · Tool use

Toolathlon

Multi-app tool-use tasks; Pass@1.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 18 models tested

Top 15 · best setting per model · 18 models, 23 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Toolathlon leaderboard
Thinking levelSetting
1Claude Opus 5Anthropic80.6%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
2Claude Opus 4.8Anthropic79.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
3Claude Opus 5.5Anthropic77.8%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
4Claude Fable 5.1Anthropic77.8%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
5Claude Sonnet 5Anthropic74.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
6GPT-5.6 SolOpenAI58.0%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
7Gemini 3.5 FlashGoogle (Gemini / DeepMind)56.5%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
8GPT-5.5OpenAI55.6%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
9GPT-5.4OpenAI54.6%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
10GPT-5.6 LunaOpenAI53.4%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
11GPT-5.6 TerraOpenAI53.1%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
12DeepSeek V4 Pro (Preview, 0423)DeepSeek51.8%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
13Kimi K2.6Moonshot AI (Kimi)50.0%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗—20 Apr 2026
14GLM-5.2Z.ai (Zhipu)48.2%Defaultthinking (effort not stated)Maker's own figureVendor-reportedZ.ai ↗—16 Jun 2026
15DeepSeek V4 Flash (Preview, 0423)DeepSeek47.8%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
16MiniMax M2.7MiniMax46.3%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—18 Mar 2026
17GLM-5.1Z.ai (Zhipu)40.7%DefaultthinkingMaker's own figureVendor-reportedZ.ai ↗—7 Apr 2026
18Qwen3.6 PlusQwen (Alibaba)39.8%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026