Skip to content
Bencher

TestsBenchmarks · Multimodal

ScreenSpot-Pro

GUI grounding on high-resolution professional screenshots.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 4 · 4 models tested

Top 4 · best setting per model · 4 models, 12 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
ScreenSpot-Pro leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI92.7%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—3 Sep 2026
2Claude Opus 4.8Anthropic82.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 May 2026
3GPT-5.6 SolOpenAI76.9%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—3 Sep 2026
4Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)75.4%HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026