TestsBenchmarks · Long context
Vals CorpFin v2
Private QA over long credit agreements (long-document financial analysis).
% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.6The test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 73.2% | Defaultvals id anthropic/claude-opus-5 | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 2 | Claude Fable 5 | Anthropic | 71.8% | Maxeffort=max | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 3 | Kimi K3 | Moonshot AI (Kimi) | 71.6% | Defaultvals id kimi/kimi-k3 | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 4 | Muse Spark 1.1 | Meta (Meta Superintelligence Labs, Muse) | 71.3% | Extra highreasoning_effort=xhigh | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 5 | Muse Spark 1.2 | Meta (Meta Superintelligence Labs, Muse) | 70.9% | Extra highreasoning_effort=xhigh | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 6 | Inkling Small | Thinking Machines Lab | 69.6% | Defaultvals id thinkingmachines/inkling-small; reasoning_effort=0.99 | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 7 | Inkling | Thinking Machines Lab | 68.6% | Defaultvals id thinkingmachines/inkling; reasoning_effort=0.99 | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 8 | Grok 4.3 | SpaceXAI (formerly xAI) | 68.5% | Defaultvals id grok/grok-4.3 | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 9 | GPT-5.5 | OpenAI | 68.4% | Extra highreasoning_effort=xhigh | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 10 | Kimi K2.5 | Moonshot AI (Kimi) | 68.3% | Defaultvals id kimi/kimi-k2.5-thinking | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 11 | MiniMax M3 | MiniMax | 68.1% | Defaultvals id minimax/MiniMax-M3 | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 12 | Grok 4.5 | SpaceXAI (formerly xAI) | 67.4% | Highreasoning_effort=high | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 13 | Claude Opus 4.6 | Anthropic | 67.0% | Maxeffort=max | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 14 | Claude Sonnet 5 | Anthropic | 67.0% | Maxeffort=max | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 15 | Kimi K2.6 | Moonshot AI (Kimi) | 66.7% | Defaultvals id kimi/kimi-k2.6 | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 16 | Claude Opus 4.8 | Anthropic | 66.7% | Maxeffort=max | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 17 | Qwen3.6 Max Preview | Qwen (Alibaba) | 66.5% | Defaultvals id alibaba/qwen3.6-max-preview | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 18 | Gemini 3 Flash Preview | Google (Gemini / DeepMind) | 66.4% | Highreasoning_effort=high | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 19 | Qwen3.8 Max (0803) | Qwen (Alibaba) | 65.9% | Defaultvals id alibaba/qwen3.8-max | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 20 | DeepSeek V4 Pro (0813) | DeepSeek | 65.4% | Maxreasoning_effort=max | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 21 | DeepSeek V4 Flash (0731) | DeepSeek | 61.8% | Highreasoning_effort=high | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |
| 22 | DeepSeek V4 Pro (Preview, 0423) | DeepSeek | 61.4% | Maxreasoning_effort=max | Independent testIndependentVals.ai ↗ | — | 12 Aug 2026 |