Skip to content
Bencher

TestsBenchmarks · Knowledge

AA-Briefcase v1.1

AA-Briefcase version 1.1 (Elo).

Elo ratingHigher is betterCounts toward:Weights: Research & analysis ×0.9The test's websiteOfficial page ↗

The best 15 · 27 models tested

Top 15 · best setting per model · 27 models, 44 results (33 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
AA-Briefcase v1.1 leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic1822MaxClaude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
2Claude Sonnet 5.5Anthropic1811MaxClaude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
3Claude Fable 5.1Anthropic1678MaxClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
4Claude Opus 5Anthropic1673MaxClaude Opus 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
5Grok 4.7SpaceXAI (formerly xAI)1657Extra highGrok 4.7 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
6Qwen3.8 Max (0902)Qwen (Alibaba)1624DefaultQwen3.8 Max (0902)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
7Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)1586MaxMuse Spark 1.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
8GPT-6 AstraOpenAI1569MaxGPT-6 Astra (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
9GPT-6.1 SolOpenAI1564MaxGPT-6.1 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
10Grok 4.6SpaceXAI (formerly xAI)1546HighMaker's own figureVendor-reportedSpaceXAI ↗—21 Sep 2026
11MiMo-V2.6-ProXiaomi MiMo1520DefaultMiMo-V2.6-ProIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
12GLM-5.3Z.ai (Zhipu)1511MaxGLM-5.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
13Kimi K3Moonshot AI (Kimi)1501MaxKimi K3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
14Gemini 4 ArgonGoogle (Gemini / DeepMind)1494HighGemini 4 Argon (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
15GPT-6 SolOpenAI1479MaxGPT-6 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
16GLM-5.3-FlashZ.ai (Zhipu)1452DefaultGLM 5.3 FlashIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
17Step 5 PreviewStepFun1432DefaultStep 5 PreviewIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
18DeepSeek V4.1 FlashDeepSeek1421MaxDeepSeek V4.1 Flash (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
19Qwen3.8 27BQwen (Alibaba)1401Extra highQwen3.8 27B (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
20Claude Sonnet 5Anthropic1359Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗—28 Sep 2026
21GPT-6 LunaOpenAI1336MaxGPT-6 Luna (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
22Gemini 3.8 FlashGoogle (Gemini / DeepMind)1202HighGemini 3.8 Flash (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
23MiniMax M3MiniMax1092DefaultMiniMax-M3Independent testIndependentArtificial Analysis ↗—1 Oct 2026
24Nemotron 3 UltraNVIDIA876DefaultNemotron 3 Ultra 550B A55B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
25InklingThinking Machines Lab834Extra highInkling (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
26Mistral Medium 3.5Mistral AI521DefaultMistral Medium 3.5Independent testIndependentArtificial Analysis ↗—1 Oct 2026
27Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)474HighMuse Glimmer (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026