Skip to content
Bencher

TestsBenchmarks · Tool use

AutomationBench

Zapier's benchmark of end-to-end business workflows across many connected apps (47 tools).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 33 models tested

Top 15 · best setting per model · 33 models, 67 results (5 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
AutomationBench leaderboard
Thinking levelSetting
1DeepSeek V4.1 FlashDeepSeek54.8%Maxreasoning_effort=100 (max)Maker's own figureVendor-reportedDeepSeek ↗official scaffold10 Sep 2026
2Gemini 4 ArgonGoogle (Gemini / DeepMind)51.3%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗—30 Sep 2026
3Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)49.6%Maxmax reasoningMaker's own figureVendor-reportedMeta ↗—2 Sep 2026
4GLM-5.3-FlashZ.ai (Zhipu)48.8%Maxreasoning_effort=max (default)Maker's own figureVendor-reportedZ.ai ↗—26 Aug 2026
5GLM-5.3Z.ai (Zhipu)48.2%Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
6Claude Sonnet 5.5Anthropic44.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
7GPT-6 AstraOpenAI41.4%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—29 Sep 2026
8Claude Opus 5.5Anthropic40.0%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
9Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)38.2%Extra highMaker's own figureVendor-reportedMeta ↗—2 Sep 2026
10GPT-6.1 SolOpenAI36.1%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—29 Sep 2026
11GPT-6 SolOpenAI33.2%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—29 Sep 2026
12DeepSeek V4 Pro (0813)DeepSeek31.8%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
13Claude Fable 5.1Anthropic31.4%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
14Kimi K3Moonshot AI (Kimi)30.8%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗—16 Jul 2026
15Gemini 3.7 FlashGoogle (Gemini / DeepMind)30.4%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
16GPT-5.6 SolOpenAI28.8%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
17Qwen3.8 Max (0803)Qwen (Alibaba)27.3%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
18Claude Opus 5Anthropic26.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
19GLM-5.2Z.ai (Zhipu)26.2%Maxsetting not stated (GLM-5.3 blog comparison column)Maker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
20DeepSeek V4 Flash Vision ExpDeepSeek25.7%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—21 Aug 2026
21DeepSeek V4 Flash (0731)DeepSeek25.1%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗—31 Jul 2026
22GPT-6 LunaOpenAI20.7%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
23Claude Fable 5Anthropic17.1%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
24Claude Opus 4.8Anthropic17.0%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
25GPT-5.6 LunaOpenAI17.0%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗—22 Sep 2026
26Gemini 3.6 FlashGoogle (Gemini / DeepMind)17.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
27GPT-5.6 TerraOpenAI15.2%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
28Qwen3.7 MaxQwen (Alibaba)14.2%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
29GPT-5.5OpenAI12.9%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
30DeepSeek V4 Pro (Preview, 0423)DeepSeek12.8%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
31DeepSeek V4 Flash (Preview, 0423)DeepSeek10.8%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
32Claude Sonnet 5Anthropic10.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
33Claude Sonnet 4.6Anthropic5.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—30 Jun 2026