Skip to content
Bencher

TestsBenchmarks · Knowledge

OfficeQA Pro

Questions over office documents (Pro split).

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗

The best 4 · 4 models tested

Top 4 · best setting per model · 4 models, 4 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
OfficeQA Pro leaderboard
Thinking levelSetting
1Claude Fable 5.1Anthropic69.0%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
2Claude Opus 5.5Anthropic67.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
3Claude Opus 5Anthropic66.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
4GPT-5.5OpenAI54.1%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026