Skip to content
Bencher

TestsBenchmarks · Agentic

OSWorld-Verified

Computer-use tasks in real desktop environments (361 tasks).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 21 models tested

Top 15 · best setting per model · 21 models, 21 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
OSWorld-Verified leaderboard
Thinking levelSetting
1Qwen3.8 Max (0803)Qwen (Alibaba)86.1%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—3 Aug 2026
2Claude Fable 5Anthropic85.0%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—9 Jun 2026
3Kimi K3Moonshot AI (Kimi)84.8%Maxreasoning_effort=maxMaker's own figureVendor-reportedMoonshot AI ↗—16 Jul 2026
4Qwen3.8 27BQwen (Alibaba)84.3%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗—14 Aug 2026
5Claude Opus 4.8Anthropic83.4%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—9 Jun 2026
6Gemini 3.6 FlashGoogle (Gemini / DeepMind)83.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
7Claude Opus 4.7Anthropic82.8%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 May 2026
8Claude Sonnet 5Anthropic81.2%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—30 Jun 2026
9Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)80.8%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
10GPT-5.5OpenAI78.7%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
11Claude Sonnet 4.6Anthropic78.5%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—30 Jun 2026
12Gemini 3.5 FlashGoogle (Gemini / DeepMind)78.4%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
13Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)76.2%Defaultthinking level not stated (API default high)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
14MiniMax M3MiniMax75.2%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—1 Jun 2026
15GPT-5.4OpenAI75.0%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
16Gemini 3.5 Flash-LiteGoogle (Gemini / DeepMind)74.0%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗—21 Jul 2026
17Qwen3.7 PlusQwen (Alibaba)73.3%No reasoningenable_thinking=FalseMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
18Kimi K2.6Moonshot AI (Kimi)73.1%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗—20 Apr 2026
19Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)65.9%HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026
20Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)54.3%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗—21 Jul 2026
21Muse SparkMeta (Meta Superintelligence Labs, Muse)53.3%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026