TestsBenchmarks · Knowledge
AA-Briefcase
Artificial Analysis long-horizon knowledge-work benchmark (multi-week projects), Elo; pre-v1.1.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 1720 | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 24 Jul 2026 |
| 2 | Claude Fable 5.1 | Anthropic | 1694 | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 1 Sep 2026 |
| 3 | Grok 4.6 | SpaceXAI (formerly xAI) | 1577 | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |
| 4 | Claude Fable 5 | Anthropic | 1574 | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 24 Jul 2026 |
| 5 | Claude Opus 4.8 | Anthropic | 1346 | Maxadaptive thinking, effort=max | Maker's own figureVendor-reportedAnthropic ↗ | — | 24 Jul 2026 |
| 6 | Grok 4.5 | SpaceXAI (formerly xAI) | 1313 | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |