TestsBenchmarks · Agentic
OSWorld-Verified
Computer-use tasks in real desktop environments (361 tasks).
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 Max (0803) | Qwen (Alibaba) | 86.1% | Defaultthinking (default reasoning_effort=xhigh; eval setting not stated) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 3 Aug 2026 |
| 2 | Claude Fable 5 | Anthropic | 85.0% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 9 Jun 2026 |
| 3 | Kimi K3 | Moonshot AI (Kimi) | 84.8% | Maxreasoning_effort=max | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 16 Jul 2026 |
| 4 | Qwen3.8 27B | Qwen (Alibaba) | 84.3% | Defaultthinking (default reasoning_effort=xhigh; eval setting not stated) | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 14 Aug 2026 |
| 5 | Claude Opus 4.8 | Anthropic | 83.4% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 9 Jun 2026 |
| 6 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 83.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 7 | Claude Opus 4.7 | Anthropic | 82.8% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 28 May 2026 |
| 8 | Claude Sonnet 5 | Anthropic | 81.2% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 30 Jun 2026 |
| 9 | Muse Spark 1.1 | Meta (Meta Superintelligence Labs, Muse) | 80.8% | Defaulteffort not stated | Maker's own figureVendor-reportedMeta ↗ | — | 9 Jul 2026 |
| 10 | GPT-5.5 | OpenAI | 78.7% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 23 Apr 2026 |
| 11 | Claude Sonnet 4.6 | Anthropic | 78.5% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 30 Jun 2026 |
| 12 | Gemini 3.5 Flash | Google (Gemini / DeepMind) | 78.4% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |
| 13 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 76.2% | Defaultthinking level not stated (API default high) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |
| 14 | MiniMax M3 | MiniMax | 75.2% | Defaultsetting not stated | Maker's own figureVendor-reportedMiniMax ↗ | — | 1 Jun 2026 |
| 15 | GPT-5.4 | OpenAI | 75.0% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 23 Apr 2026 |
| 16 | Gemini 3.5 Flash-Lite | Google (Gemini / DeepMind) | 74.0% | Highhigh thinking | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 17 | Qwen3.7 Plus | Qwen (Alibaba) | 73.3% | No reasoningenable_thinking=False | Maker's own figureVendor-reportedQwen (Alibaba) ↗ | — | 21 May 2026 |
| 18 | Kimi K2.6 | Moonshot AI (Kimi) | 73.1% | Defaultthinking | Maker's own figureVendor-reportedMoonshot AI ↗ | — | 20 Apr 2026 |
| 19 | Muse Glimmer 30B | Meta (Meta Superintelligence Labs, Muse) | 65.9% | HighHigh reasoning | Maker's own figureVendor-reportedMeta ↗ | — | 10 Aug 2026 |
| 20 | Gemini 3.1 Flash-Lite | Google (Gemini / DeepMind) | 54.3% | Highhigh thinking | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 21 | Muse Spark | Meta (Meta Superintelligence Labs, Muse) | 53.3% | Defaulteffort not stated | Maker's own figureVendor-reportedMeta ↗ | — | 9 Jul 2026 |