Skip to content
Bencher

TestsBenchmarks · Agentic

WANDR

Perplexity wide-search benchmark (500 tasks, structured fact collection with citations), soft F1.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 3 · 3 models tested

Top 3 · best setting per model · 3 models, 15 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
WANDR leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic72.3%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
2Claude Fable 5.1Anthropic68.7%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026
3Claude Opus 5Anthropic67.2%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—22 Sep 2026