Skip to content
Bencher

TestsBenchmarks · Knowledge

Vals Public Benefits Bench v1.1

Can a model correctly help people navigate public-benefit (US SNAP) rules and eligibility - policy-text application.

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.6The test's websiteOfficial page ↗

The best 15 · 24 models tested

Top 15 · best setting per model · 24 models, 24 results (24 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Vals Public Benefits Bench v1.1 leaderboard
Thinking levelSetting
1Claude Opus 5Anthropic76.9%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
2Claude Fable 5.1Anthropic74.9%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
3Claude Opus 5.5Anthropic70.6%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
4Claude Fable 5Anthropic70.4%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
5Gemini 4 ArgonGoogle (Gemini / DeepMind)69.8%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
6MiMo-V2.6-ProXiaomi MiMo68.9%Defaultvals id xiaomi/mimo-v2.6-proIndependent testIndependentVals.ai ↗—29 Sep 2026
7Hy4 previewTencent Hunyuan68.6%Defaultvals id tencent/hy4-previewIndependent testIndependentVals.ai ↗—29 Sep 2026
8GLM-5.3Z.ai (Zhipu)68.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
9Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)68.5%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
10Kimi K3Moonshot AI (Kimi)68.3%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
11Claude Opus 4.8Anthropic68.1%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
12MiMo-V2.6-FlashXiaomi MiMo67.6%Defaultvals id xiaomi/mimo-v2.6-flashIndependent testIndependentVals.ai ↗—29 Sep 2026
13Claude Sonnet 5.5Anthropic67.2%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
14Qwen3.8 Max (0803)Qwen (Alibaba)67.1%Defaultvals id alibaba/qwen3.8-maxIndependent testIndependentVals.ai ↗—29 Sep 2026
15Grok 4.6SpaceXAI (formerly xAI)66.8%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
16GPT-5.6 SolOpenAI66.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
17Claude Sonnet 5Anthropic66.0%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
18Grok 4.7SpaceXAI (formerly xAI)65.6%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
19Gemini 3.8 FlashGoogle (Gemini / DeepMind)65.3%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
20DeepSeek V4.1 FlashDeepSeek64.3%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
21DeepSeek V4 Pro (Preview, 0423)DeepSeek62.9%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
22GPT-6.1 SolOpenAI59.3%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
23GPT-6 LunaOpenAI57.6%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
24GPT-6 SolOpenAI56.6%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026