TestsBenchmarks · Agentic
Vals Finance Agent v2
Multi-step financial analyst research tasks (Vals AI).
% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 4 Argon | Google (Gemini / DeepMind) | 65.4% | Maxhighest thinking settings | Maker's own figureVendor-reportedGoogle ↗ | — | 30 Sep 2026 |
| 2 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 61.4% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Sep 2026 |
| 3 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 59.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Sep 2026 |
| 4 | Gemini 3.5 Flash | Google (Gemini / DeepMind) | 57.9% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |
| 5 | Muse Spark 1.1 | Meta (Meta Superintelligence Labs, Muse) | 57.2% | Defaulteffort not stated | Maker's own figureVendor-reportedMeta ↗ | — | 9 Jul 2026 |
| 6 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 43.0% | Defaultthinking level not stated (API default high) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |