Skip to content
Bencher

TestsBenchmarks · Agentic

SkillsBench

Agent task success with and without reusable skill files, averaged; measures how well agents use packaged skills.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 30 models tested

Top 15 · best setting per model · 30 models, 30 results (25 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SkillsBench leaderboard
Thinking levelSetting
1Qwen3.8 Max (0803)Qwen (Alibaba)70.2%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗OpenCode3 Aug 2026
2DeepSeek V4.1 FlashDeepSeek69.8%Highreasoning_effort=highIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
3Grok 4.5SpaceXAI (formerly xAI)66.0%Highreasoning_effort=highIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
4Gemini 3.7 FlashGoogle (Gemini / DeepMind)65.9%Highreasoning_effort=highIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
5GPT-5.5 CodexOpenAI62.5%DefaultIndependent testIndependentVals.ai ↗Codex27 Sep 2026
6GPT-5.5OpenAI62.2%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
7Claude Fable 5.1Anthropic61.5%Maxeffort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
8GPT-5.6 LunaOpenAI60.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
9Claude Opus 5Anthropic60.4%Maxeffort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
10Claude Opus 4.8Anthropic59.2%Maxeffort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
11Qwen3.7 MaxQwen (Alibaba)59.2%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗OpenCode16 May 2026
12Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)59.2%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
13GPT-5.6 TerraOpenAI58.9%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
14Gemini 3.8 FlashGoogle (Gemini / DeepMind)58.0%Highreasoning_effort=highIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
15Grok 4.6SpaceXAI (formerly xAI)55.8%Highreasoning_effort=highIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
16Qwen3.7 PlusQwen (Alibaba)54.3%DefaultIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
17GPT-5.6 SolOpenAI54.1%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
18DeepSeek V4 Pro (0813)DeepSeek53.8%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
19Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)53.0%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
20Gemini 3.5 FlashGoogle (Gemini / DeepMind)52.7%Highreasoning_effort=highIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
21GPT-5.4OpenAI51.7%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
22MiniMax M3MiniMax51.5%DefaultIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
23DeepSeek V4 Pro (Preview, 0423)DeepSeek51.3%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
24DeepSeek V4 Flash (0731)DeepSeek50.7%Highreasoning_effort=highIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
25Kimi K2.7 CodeMoonshot AI (Kimi)50.0%DefaultIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
26Claude Sonnet 4.6Anthropic49.0%Maxeffort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
27Qwen3.6 27BQwen (Alibaba)48.2%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗OpenCode22 Apr 2026
28GLM-5.3Z.ai (Zhipu)47.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗OpenHands27 Sep 2026
29Qwen3.6 PlusQwen (Alibaba)45.7%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗OpenCode2 Apr 2026
30Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)44.3%HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026