Skip to content
Bencher

TestsBenchmarks · Agentic

Harvey's Legal Agent Benchmark (Vals)

Complex legal research and drafting workflows; all-pass rate (Vals AI).

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗

The best 6 · 6 models tested

Top 6 · best setting per model · 6 models, 6 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Harvey's Legal Agent Benchmark (Vals) leaderboard
Thinking levelSetting
1Gemini 4 ArgonGoogle (Gemini / DeepMind)19.6%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗—30 Sep 2026
2Grok 4.7SpaceXAI (formerly xAI)19.6%Extra highMaker's own figureVendor-reportedSpaceXAI ↗—21 Sep 2026
3Grok 4.6SpaceXAI (formerly xAI)15.8%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
4Grok 4.5SpaceXAI (formerly xAI)12.9%HighMaker's own figureVendor-reportedSpaceXAI ↗—12 Aug 2026
5Gemini 3.8 FlashGoogle (Gemini / DeepMind)10.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026
6Gemini 3.7 FlashGoogle (Gemini / DeepMind)8.8%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026