Skip to content
Bencher

TestsBenchmarks · Agentic

Harvey LAB-AA

Harvey legal agent benchmark as run by Artificial Analysis (score).

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.6The test's websiteOfficial page ↗

The best 14 · 14 models tested

Top 14 · best setting per model · 14 models, 16 results (14 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Harvey LAB-AA leaderboard
Thinking levelSetting
1Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)95.5%Extra highMuse Spark 1.3 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
2Kimi K3Moonshot AI (Kimi)94.6%MaxKimi K3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
3Qwen3.8 Max (0902)Qwen (Alibaba)93.6%DefaultQwen3.8 Max (0902)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
4Claude Fable 5Anthropic93.6%MaxClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
5Claude Opus 5Anthropic93.5%MaxClaude Opus 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
6Step 5 PreviewStepFun93.4%DefaultStep 5 PreviewIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
7Claude Fable 5.1Anthropic93.3%Extra highClaude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
8Claude Sonnet 5.5Anthropic93.1%MaxClaude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
9Claude Opus 5.5Anthropic91.2%MaxClaude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
10Gemini 3.7 FlashGoogle (Gemini / DeepMind)90.7%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
11MiniMax M3MiniMax88.4%DefaultMiniMax-M3Independent testIndependentArtificial Analysis ↗—1 Oct 2026
12Gemini 3.6 FlashGoogle (Gemini / DeepMind)85.1%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
13Nemotron 3 UltraNVIDIA81.7%DefaultNemotron 3 Ultra 550B A55B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
14Mistral Medium 3.5Mistral AI69.1%DefaultMistral Medium 3.5Independent testIndependentArtificial Analysis ↗—1 Oct 2026