Skip to content
Bencher

TestsBenchmarks · Agentic

Vals Finance Agent v2

Multi-step financial analyst research tasks (Vals AI).

% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗

The best 6 · 6 models tested

Top 6 · best setting per model · 6 models, 6 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Vals Finance Agent v2 leaderboard
Thinking levelSetting
1Gemini 4 ArgonGoogle (Gemini / DeepMind)65.4%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗—30 Sep 2026
2Gemini 3.8 FlashGoogle (Gemini / DeepMind)61.4%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026
3Gemini 3.7 FlashGoogle (Gemini / DeepMind)59.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026
4Gemini 3.5 FlashGoogle (Gemini / DeepMind)57.9%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
5Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)57.2%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
6Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)43.0%Defaultthinking level not stated (API default high)Maker's own figureVendor-reportedGoogle ↗—19 May 2026