Skip to content
Bencher

TestsBenchmarks · Tool use

Toolathlon-Verified

Verified subset of Toolathlon personal tool-use tasks.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 15 models tested

Top 15 · best setting per model · 15 models, 15 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Toolathlon-Verified leaderboard
Thinking levelSetting
1GLM-5.3-FlashZ.ai (Zhipu)78.4%Maxreasoning_effort=max (default)Maker's own figureVendor-reportedZ.ai ↗—26 Aug 2026
2Kimi K3Moonshot AI (Kimi)76.5%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗—16 Jul 2026
3DeepSeek V4 Flash Vision ExpDeepSeek75.9%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—21 Aug 2026
4Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)75.6%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
5DeepSeek V4 Pro (0813)DeepSeek74.1%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
6Qwen3.8 FlashQwen (Alibaba)73.5%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—26 Aug 2026
7GLM-5.3Z.ai (Zhipu)73.0%Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
8Qwen3.8 Max (0803)Qwen (Alibaba)72.5%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
9DeepSeek V4 Flash (0731)DeepSeek70.3%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—31 Jul 2026
10Qwen3.8 27BQwen (Alibaba)67.1%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—26 Aug 2026
11GLM-5.2Z.ai (Zhipu)59.9%Maxsetting not stated (GLM-5.3 blog comparison column)Maker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
12DeepSeek V4 Pro (Preview, 0423)DeepSeek55.9%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
13DeepSeek V4 Flash (Preview, 0423)DeepSeek49.7%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
14Qwen3.7 MaxQwen (Alibaba)49.7%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
15Muse SparkMeta (Meta Superintelligence Labs, Muse)49.4%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026