TestsBenchmarks · Agentic
Harvey's Legal Agent Benchmark (Vals)
Complex legal research and drafting workflows; all-pass rate (Vals AI).
% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 4 Argon | Google (Gemini / DeepMind) | 19.6% | Maxhighest thinking settings | Maker's own figureVendor-reportedGoogle ↗ | — | 30 Sep 2026 |
| 2 | Grok 4.7 | SpaceXAI (formerly xAI) | 19.6% | Extra high | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 21 Sep 2026 |
| 3 | Grok 4.6 | SpaceXAI (formerly xAI) | 15.8% | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |
| 4 | Grok 4.5 | SpaceXAI (formerly xAI) | 12.9% | High | Maker's own figureVendor-reportedSpaceXAI ↗ | — | 12 Aug 2026 |
| 5 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 10.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Sep 2026 |
| 6 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 8.8% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Sep 2026 |