TestsBenchmarks · Human preference
Arena Hard
LLM-judged hard chat prompts.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Mistral Small 4 | Mistral AI | 58.3% | HighReasoning (reasoning_effort=high) | Maker's own figureVendor-reportedMistral AI ↗ | — | 16 Mar 2026 |