Skip to content
Bencher

TestsBenchmarks · Agentic

Vals Legal Research Bench

Agentic legal research tasks across US law areas, graded on correctness of the research answer.

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.8The test's websiteOfficial page ↗

The best 15 · 30 models tested

Top 15 · best setting per model · 30 models, 31 results (31 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Vals Legal Research Bench leaderboard
Thinking levelSetting
1Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)55.3%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
2Claude Opus 5Anthropic55.3%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
3Claude Fable 5.1Anthropic55.3%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
4Gemini 4 ArgonGoogle (Gemini / DeepMind)54.8%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
5Claude Opus 5.5Anthropic50.5%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
6Claude Fable 5Anthropic49.5%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
7GLM-5.3Z.ai (Zhipu)49.0%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
8Grok 4.6SpaceXAI (formerly xAI)48.1%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
9GPT-5.6 SolOpenAI48.1%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
10Claude Sonnet 5.5Anthropic48.1%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
11Qwen3.8 Max (0803)Qwen (Alibaba)47.6%Defaultvals id alibaba/qwen3.8-maxIndependent testIndependentVals.ai ↗—29 Sep 2026
12Grok 4.7SpaceXAI (formerly xAI)47.1%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
13MiMo-V2.6-ProXiaomi MiMo47.1%Defaultvals id xiaomi/mimo-v2.6-proIndependent testIndependentVals.ai ↗—29 Sep 2026
14GLM-5.3-FlashZ.ai (Zhipu)45.2%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
15Hy4 previewTencent Hunyuan45.2%Defaultvals id tencent/hy4-previewIndependent testIndependentVals.ai ↗—29 Sep 2026
16Ember-1Fireworks AI44.7%Defaultvals id fireworks/ember-1Independent testIndependentVals.ai ↗—29 Sep 2026
17Kimi K3Moonshot AI (Kimi)44.2%Defaultvals id kimi/kimi-k3Independent testIndependentVals.ai ↗—29 Sep 2026
18Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)43.8%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
19Claude Opus 4.8Anthropic43.8%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
20Claude Sonnet 5Anthropic41.8%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
21DeepSeek V4.1 FlashDeepSeek41.3%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
22DeepSeek V4 Pro (0813)DeepSeek40.9%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
23GPT-6 AstraOpenAI39.4%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
24Gemini 3.8 FlashGoogle (Gemini / DeepMind)38.9%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
25GPT-6.1 SolOpenAI38.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
26Qwen3.8 27BQwen (Alibaba)36.1%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
27DeepSeek V4 Flash (0731)DeepSeek30.3%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
28GPT-6 LunaOpenAI30.3%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
29GPT-6 SolOpenAI28.8%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
30DeepSeek V4 Pro (Preview, 0423)DeepSeek23.1%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026