Skip to content
Bencher

TestsBenchmarks · Agentic

OSWorld 2.0

Binary success rate of computer-use agents on long-horizon real desktop tasks.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 18 models tested

Top 15 · best setting per model · 18 models, 25 results (13 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
OSWorld 2.0 leaderboard
Thinking levelSetting
1Claude Fable 5.1Anthropic77.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
2Claude Fable 5Anthropic72.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
3Gemini 4 ArgonGoogle (Gemini / DeepMind)69.2%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗Gemini CUA harness (OSWorld 2.0 repo)30 Sep 2026
4Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)66.9%Maxmax reasoningMaker's own figureVendor-reportedMeta ↗—2 Sep 2026
5GPT-5.6 SolOpenAI62.6%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
6Gemini 3.8 FlashGoogle (Gemini / DeepMind)59.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗Gemini CUA harness, batch tool enabled2 Sep 2026
7Gemini 3.7 FlashGoogle (Gemini / DeepMind)50.6%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗Gemini CUA harness, batch tool enabled2 Sep 2026
8GPT-5.6 TerraOpenAI50.2%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
9Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)47.6%Extra highMaker's own figureVendor-reportedMeta ↗—2 Sep 2026
10GPT-5.5OpenAI47.5%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
11GPT-5.6 LunaOpenAI45.6%DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results)Maker's own figureVendor-reportedOpenAI ↗—9 Jul 2026
12Gemini 3.6 FlashGoogle (Gemini / DeepMind)33.8%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗Gemini CUA harness13 Aug 2026
13Claude Opus 5Anthropic31.4%Maxclaude-opus-5_maxIndependent testIndependentOSWorld 2.0 via Epoch AI ↗—1 Oct 2026
14Claude Opus 4.8Anthropic20.6%Maxclaude-opus-4-8_maxIndependent testIndependentOSWorld 2.0 via Epoch AI ↗—1 Oct 2026
15Claude Opus 4.7Anthropic18.2%Maxclaude-opus-4-7_maxIndependent testIndependentOSWorld 2.0 via Epoch AI ↗—1 Oct 2026
16Claude Sonnet 4.6Anthropic9.3%Mediumclaude-sonnet-4-6_mediumIndependent testIndependentOSWorld 2.0 via Epoch AI ↗—1 Oct 2026
17MiniMax M3MiniMax4.6%DefaultMiniMax-M3Independent testIndependentOSWorld 2.0 via Epoch AI ↗—1 Oct 2026
18Kimi K2.6Moonshot AI (Kimi)4.6%Defaultkimi-k2.6Independent testIndependentOSWorld 2.0 via Epoch AI ↗—1 Oct 2026