Skip to content
Bencher

TestsBenchmarks · Human preference

Arena Hard

LLM-judged hard chat prompts.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 1 · 1 models tested

Top 1 · best setting per model · 1 models, 2 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Arena Hard leaderboard
Thinking levelSetting
1Mistral Small 4Mistral AI58.3%HighReasoning (reasoning_effort=high)Maker's own figureVendor-reportedMistral AI ↗—16 Mar 2026