Skip to content
Bencher

TestsBenchmarks · Knowledge

AA-Briefcase

Artificial Analysis long-horizon knowledge-work benchmark (multi-week projects), Elo; pre-v1.1.

Elo ratingHigher is betterThe test's websiteOfficial page ↗

The best 6 · 6 models tested

Top 6 · best setting per model · 6 models, 8 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
AA-Briefcase leaderboard
Thinking levelSetting
1Claude Opus 5Anthropic1720Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
2Claude Fable 5.1Anthropic1694Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—1 Sep 2026
3Grok 4.6SpaceXAI (formerly xAI)1577HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
4Claude Fable 5Anthropic1574Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
5Claude Opus 4.8Anthropic1346Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—24 Jul 2026
6Grok 4.5SpaceXAI (formerly xAI)1313HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026