Skip to content
Bencher

TestsBenchmarks · Agentic

Vending-Bench 2

Money balance after an agent runs a simulated vending-machine business for a year; tests long-horizon coherence.

US dollarsHigher is betterThe test's websiteOfficial page ↗

The best 10 · 10 models tested

Top 10 · best setting per model · 10 models, 10 results (10 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Vending-Bench 2 leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI$15,515DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
2GPT-6 SolOpenAI$14,428DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
3Gemini 4 ArgonGoogle (Gemini / DeepMind)$13,718DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
4Claude Opus 5Anthropic$11,182DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
5Claude Opus 4.7Anthropic$10,937DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
6Grok 4.7SpaceXAI (formerly xAI)$10,537DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
7GPT-5.6 SolOpenAI$9,619DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
8Claude Opus 5.5Anthropic$9,235DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
9Grok 4.6SpaceXAI (formerly xAI)$9,047DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026
10GLM-5.2Z.ai (Zhipu)$8,314DefaultIndependent testIndependentAndon Labs ↗—1 Oct 2026