Skip to content
Bencher

TestsBenchmarks · Tool use

MCP Atlas

Share of realistic multi-step tasks solved by calling real MCP tool servers.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 36 models tested

Top 15 · best setting per model · 36 models, 43 results (25 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MCP Atlas leaderboard
Thinking levelSetting
1Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)90.3%Extra highMaker's own figureVendor-reportedMeta ↗—5 Aug 2026
2Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)88.1%DefaultMuse Spark 1.1Independent testIndependentScale AI SEAL ↗—1 Oct 2026
3Claude Fable 5.1Anthropic87.2%DefaultFable 5.1Independent testIndependentScale AI SEAL ↗—1 Oct 2026
4Claude Opus 5Anthropic85.8%Extra highclaude-opus-5 (xhigh)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
5Qwen3.8 2.4T A95B (open weights)Qwen (Alibaba)84.5%Extra highQwen3.8-2.4T-A95B (xHigh)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
6GLM-5.3Z.ai (Zhipu)84.2%DefaultGLM 5.3Independent testIndependentScale AI SEAL ↗—1 Oct 2026
7Gemini 3.5 FlashGoogle (Gemini / DeepMind)83.6%HighGemini 3.5 Flash (high)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
8Claude Fable 5Anthropic83.3%DefaultClaude Fable 5Independent testIndependentScale AI SEAL ↗—1 Oct 2026
9Kimi K3Moonshot AI (Kimi)82.3%Maxkimi-k3 (max)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
10Claude Opus 4.8Anthropic82.2%Maxclaude-opus-4-8 (max)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
11Muse SparkMeta (Meta Superintelligence Labs, Muse)82.2%DefaultMuse SparkIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
12GPT-5.6 SolOpenAI81.8%Defaultgpt-5.6 (sol)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
13Inkling SmallThinking Machines Lab79.2%DefaultInkling-smallIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
14Claude Opus 4.7Anthropic79.1%Maxclaude-opus-4-7 (max)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
15Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)78.2%Highgemini-3.1-pro-preview (high)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
16GLM-5.2Z.ai (Zhipu)77.8%Defaultglm-5p2Independent testIndependentScale AI SEAL ↗—1 Oct 2026
17Claude Opus 4.6Anthropic76.8%Maxclaude-opus-4-6 (max)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
18Qwen3.7 MaxQwen (Alibaba)76.4%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗—16 May 2026
19InklingThinking Machines Lab76.0%Extra highInkling (xHigh)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
20Kimi K2.7 CodeMoonshot AI (Kimi)76.0%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026
21GLM-5.1Z.ai (Zhipu)75.6%Defaultglm-5p1Independent testIndependentScale AI SEAL ↗—1 Oct 2026
22Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)75.5%HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026
23GPT-5.5OpenAI75.3%Extra highgpt-5.5 (xhigh)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
24DeepSeek V4 Pro (Preview, 0423)DeepSeek74.2%HighThink HighMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
25MiniMax M3MiniMax74.2%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—1 Jun 2026
26Qwen3.6 PlusQwen (Alibaba)74.1%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026
27Qwen3.7 PlusQwen (Alibaba)73.2%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
28GPT-5.4OpenAI70.6%Extra highgpt-5.4 (xhigh)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
29Gemini 3 ProGoogle (Gemini / DeepMind)70.3%Defaultgemini-3-pro-previewIndependent testIndependentScale AI SEAL ↗—1 Oct 2026
30Claude Opus 4.5Anthropic69.8%Highclaude-opus-4-5 (high)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
31Claude Sonnet 4.6Anthropic69.5%Defaultclaude-sonnet-4-6Independent testIndependentScale AI SEAL ↗—1 Oct 2026
32Kimi K2.6Moonshot AI (Kimi)69.4%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗Kimi Code CLI12 Jun 2026
33DeepSeek V4 Flash (Preview, 0423)DeepSeek69.0%MaxThink MaxMaker's own figureVendor-reportedDeepSeek ↗—24 Apr 2026
34GPT-5.2OpenAI67.6%Extra highgpt-5.2 (xhigh)Independent testIndependentScale AI SEAL ↗—1 Oct 2026
35Kimi K2.5Moonshot AI (Kimi)64.4%Defaultkimi-k2p5Independent testIndependentScale AI SEAL ↗—1 Oct 2026
36MiniMax M2.7MiniMax49.4%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—1 Jun 2026