Skip to content
Bencher

TestsBenchmarks · Coding

SWE-bench Multimodal

SWE-bench issues that include visual context such as screenshots and design mockups.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 8 · 8 models tested

Top 8 · best setting per model · 8 models, 8 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SWE-bench Multimodal leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic61.4%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
2Claude Opus 5Anthropic59.4%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
3Claude Fable 5.1Anthropic54.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
4Claude Sonnet 5.5Anthropic54.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
5Claude Fable 5Anthropic54.1%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
6Claude Opus 4.8Anthropic38.4%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
7Claude Opus 4.7Anthropic34.5%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 May 2026
8Claude Sonnet 5Anthropic28.1%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026