TestsBenchmarks · Agentic
OSWorld 2.0
Binary success rate of computer-use agents on long-horizon real desktop tasks.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 | Anthropic | 77.9% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 1 Sep 2026 |
| 2 | Claude Fable 5 | Anthropic | 72.9% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 1 Sep 2026 |
| 3 | Gemini 4 Argon | Google (Gemini / DeepMind) | 69.2% | Maxhighest thinking settings | Maker's own figureVendor-reportedGoogle ↗ | Gemini CUA harness (OSWorld 2.0 repo) | 30 Sep 2026 |
| 4 | Muse Spark 1.3 | Meta (Meta Superintelligence Labs, Muse) | 66.9% | Maxmax reasoning | Maker's own figureVendor-reportedMeta ↗ | — | 2 Sep 2026 |
| 5 | GPT-5.6 Sol | OpenAI | 62.6% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 6 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 59.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | Gemini CUA harness, batch tool enabled | 2 Sep 2026 |
| 7 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 50.6% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | Gemini CUA harness, batch tool enabled | 2 Sep 2026 |
| 8 | GPT-5.6 Terra | OpenAI | 50.2% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 9 | Muse Spark 1.2 | Meta (Meta Superintelligence Labs, Muse) | 47.6% | Extra high | Maker's own figureVendor-reportedMeta ↗ | — | 2 Sep 2026 |
| 10 | GPT-5.5 | OpenAI | 47.5% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 11 | GPT-5.6 Luna | OpenAI | 45.6% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results) | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 12 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 33.8% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | Gemini CUA harness | 13 Aug 2026 |
| 13 | Claude Opus 5 | Anthropic | 31.4% | Maxclaude-opus-5_max | Independent testIndependentOSWorld 2.0 via Epoch AI ↗ | — | 1 Oct 2026 |
| 14 | Claude Opus 4.8 | Anthropic | 20.6% | Maxclaude-opus-4-8_max | Independent testIndependentOSWorld 2.0 via Epoch AI ↗ | — | 1 Oct 2026 |
| 15 | Claude Opus 4.7 | Anthropic | 18.2% | Maxclaude-opus-4-7_max | Independent testIndependentOSWorld 2.0 via Epoch AI ↗ | — | 1 Oct 2026 |
| 16 | Claude Sonnet 4.6 | Anthropic | 9.3% | Mediumclaude-sonnet-4-6_medium | Independent testIndependentOSWorld 2.0 via Epoch AI ↗ | — | 1 Oct 2026 |
| 17 | MiniMax M3 | MiniMax | 4.6% | DefaultMiniMax-M3 | Independent testIndependentOSWorld 2.0 via Epoch AI ↗ | — | 1 Oct 2026 |
| 18 | Kimi K2.6 | Moonshot AI (Kimi) | 4.6% | Defaultkimi-k2.6 | Independent testIndependentOSWorld 2.0 via Epoch AI ↗ | — | 1 Oct 2026 |