TestsBenchmarks · Multimodal
ScreenSpot-Pro
GUI grounding on high-resolution professional screenshots.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 92.7% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 3 Sep 2026 |
| 2 | Claude Opus 4.8 | Anthropic | 82.3% | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 28 May 2026 |
| 3 | GPT-5.6 Sol | OpenAI | 76.9% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 3 Sep 2026 |
| 4 | Muse Glimmer 30B | Meta (Meta Superintelligence Labs, Muse) | 75.4% | HighHigh reasoning | Maker's own figureVendor-reportedMeta ↗ | — | 10 Aug 2026 |