Skip to content
Bencher

TestsBenchmarks · Long context

Vals CorpFin v2

Private QA over long credit agreements (long-document financial analysis).

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.6The test's websiteOfficial page ↗

The best 15 · 22 models tested

Top 15 · best setting per model · 22 models, 22 results (22 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Vals CorpFin v2 leaderboard
Thinking levelSetting
1Claude Opus 5Anthropic73.2%Defaultvals id anthropic/claude-opus-5Independent testIndependentVals.ai ↗—12 Aug 2026
2Claude Fable 5Anthropic71.8%Maxeffort=maxIndependent testIndependentVals.ai ↗—12 Aug 2026
3Kimi K3Moonshot AI (Kimi)71.6%Defaultvals id kimi/kimi-k3Independent testIndependentVals.ai ↗—12 Aug 2026
4Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)71.3%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—12 Aug 2026
5Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)70.9%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—12 Aug 2026
6Inkling SmallThinking Machines Lab69.6%Defaultvals id thinkingmachines/inkling-small; reasoning_effort=0.99Independent testIndependentVals.ai ↗—12 Aug 2026
7InklingThinking Machines Lab68.6%Defaultvals id thinkingmachines/inkling; reasoning_effort=0.99Independent testIndependentVals.ai ↗—12 Aug 2026
8Grok 4.3SpaceXAI (formerly xAI)68.5%Defaultvals id grok/grok-4.3Independent testIndependentVals.ai ↗—12 Aug 2026
9GPT-5.5OpenAI68.4%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—12 Aug 2026
10Kimi K2.5Moonshot AI (Kimi)68.3%Defaultvals id kimi/kimi-k2.5-thinkingIndependent testIndependentVals.ai ↗—12 Aug 2026
11MiniMax M3MiniMax68.1%Defaultvals id minimax/MiniMax-M3Independent testIndependentVals.ai ↗—12 Aug 2026
12Grok 4.5SpaceXAI (formerly xAI)67.4%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—12 Aug 2026
13Claude Opus 4.6Anthropic67.0%Maxeffort=maxIndependent testIndependentVals.ai ↗—12 Aug 2026
14Claude Sonnet 5Anthropic67.0%Maxeffort=maxIndependent testIndependentVals.ai ↗—12 Aug 2026
15Kimi K2.6Moonshot AI (Kimi)66.7%Defaultvals id kimi/kimi-k2.6Independent testIndependentVals.ai ↗—12 Aug 2026
16Claude Opus 4.8Anthropic66.7%Maxeffort=maxIndependent testIndependentVals.ai ↗—12 Aug 2026
17Qwen3.6 Max PreviewQwen (Alibaba)66.5%Defaultvals id alibaba/qwen3.6-max-previewIndependent testIndependentVals.ai ↗—12 Aug 2026
18Gemini 3 Flash PreviewGoogle (Gemini / DeepMind)66.4%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—12 Aug 2026
19Qwen3.8 Max (0803)Qwen (Alibaba)65.9%Defaultvals id alibaba/qwen3.8-maxIndependent testIndependentVals.ai ↗—12 Aug 2026
20DeepSeek V4 Pro (0813)DeepSeek65.4%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—12 Aug 2026
21DeepSeek V4 Flash (0731)DeepSeek61.8%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—12 Aug 2026
22DeepSeek V4 Pro (Preview, 0423)DeepSeek61.4%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—12 Aug 2026