Skip to content
Bencher

TestsBenchmarks · Reasoning

SimpleBench

Accuracy on trick multiple-choice questions about everyday spatial, temporal and social reasoning where ordinary humans do well.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 30 models tested

Top 15 · best setting per model · 30 models, 30 results (30 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SimpleBench leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic88.4%DefaultClaude Opus 5.5Independent testIndependentSimpleBench ↗—24 Sep 2026
2Claude Fable 5.1Anthropic86.6%DefaultClaude Fable 5.1Independent testIndependentSimpleBench ↗—3 Sep 2026
3GPT-6 Astra ProOpenAI86.5%DefaultGPT-6 Astra ProIndependent testIndependentSimpleBench ↗—7 Sep 2026
4GPT-6 AstraOpenAI83.6%DefaultGPT-6 AstraIndependent testIndependentSimpleBench ↗—7 Sep 2026
5Gemini 3.8 FlashGoogle (Gemini / DeepMind)82.4%DefaultGemini 3.8 FlashIndependent testIndependentSimpleBench ↗—3 Sep 2026
6Claude Fable 5Anthropic81.9%DefaultClaude FableIndependent testIndependentSimpleBench ↗—10 Jun 2026
7Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)81.8%DefaultMuse Spark 1.3Independent testIndependentSimpleBench ↗—3 Sep 2026
8Claude Opus 5Anthropic80.6%DefaultClaude Opus 5Independent testIndependentSimpleBench ↗—24 Jul 2026
9Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)79.6%DefaultGemini 3.1 Pro PreviewIndependent testIndependentSimpleBench ↗—17 Feb 2026
10GPT-5.5 ProOpenAI76.9%DefaultGPT-5.5 ProIndependent testIndependentSimpleBench ↗—24 Apr 2026
11Gemini 3.5 FlashGoogle (Gemini / DeepMind)76.7%DefaultGemini 3.5 FlashIndependent testIndependentSimpleBench ↗—20 May 2026
12Grok 4.6SpaceXAI (formerly xAI)75.9%DefaultGrok 4.6Independent testIndependentSimpleBench ↗—13 Aug 2026
13Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)74.5%DefaultMuse Spark 1.2Independent testIndependentSimpleBench ↗—13 Aug 2026
14GPT-6 SolOpenAI73.1%DefaultGPT-6 SolIndependent testIndependentSimpleBench ↗—24 Sep 2026
15GPT-5.6 Sol ProOpenAI71.7%Extra highGPT-5.6 Sol Pro (xhigh)Independent testIndependentSimpleBench ↗—9 Jul 2026
16Qwen3.7 MaxQwen (Alibaba)70.4%DefaultQwen 3.7 MaxIndependent testIndependentSimpleBench ↗—22 May 2026
17Grok 4.5SpaceXAI (formerly xAI)70.0%DefaultGrok 4.5Independent testIndependentSimpleBench ↗—8 Jul 2026
18GPT-5.5OpenAI69.0%DefaultGPT-5.5Independent testIndependentSimpleBench ↗—24 Apr 2026
19Claude Opus 4.6Anthropic67.6%DefaultClaude Opus 4.6Independent testIndependentSimpleBench ↗—17 Feb 2026
20DeepSeek V4.1 FlashDeepSeek66.7%DefaultDeepSeek V4.1 FlashIndependent testIndependentSimpleBench ↗—12 Sep 2026
21GLM-5.3Z.ai (Zhipu)66.2%DefaultGLM 5.3Independent testIndependentSimpleBench ↗—19 Aug 2026
22Claude Opus 4.8Anthropic64.8%DefaultClaude Opus 4.8Independent testIndependentSimpleBench ↗—29 May 2026
23GPT-5.6 SolOpenAI64.8%Extra highGPT-5.6 Sol (xhigh)Independent testIndependentSimpleBench ↗—9 Jul 2026
24Qwen3.6 Max PreviewQwen (Alibaba)63.0%DefaultQwen 3.6 Max PreviewIndependent testIndependentSimpleBench ↗—20 May 2026
25Qwen3.8 2.4T A95B (open weights)Qwen (Alibaba)62.5%DefaultQwen 3.8 2.4T A95BIndependent testIndependentSimpleBench ↗—13 Aug 2026
26Claude Opus 4.7Anthropic61.7%DefaultClaude Opus 4.7Independent testIndependentSimpleBench ↗—22 Apr 2026
27DeepSeek V4 Flash (Preview, 0423)DeepSeek61.1%DefaultDeepSeek V4 FlashIndependent testIndependentSimpleBench ↗—3 Aug 2026
28Kimi K3Moonshot AI (Kimi)60.7%MaxKimi K3 (max)Independent testIndependentSimpleBench ↗—17 Jul 2026
29Claude Sonnet 5Anthropic60.6%DefaultClaude Sonnet 5Independent testIndependentSimpleBench ↗—9 Jul 2026
30Qwen3.8 27BQwen (Alibaba)60.2%DefaultQwen 3.8 27BIndependent testIndependentSimpleBench ↗—20 Aug 2026