Skip to content
Bencher

TestsBenchmarks · writing

EQ-Bench Creative Writing v3 (Elo)

LLM-judged (Claude Sonnet 4.6) pairwise Elo on 32 creative-writing prompts x3 with anti-slop/length controls.

Elo ratingHigher is betterCounts toward:Weights: Writing & creativity ×0.7The test's websiteOfficial page ↗

The best 15 · 31 models tested

Top 15 · best setting per model · 31 models, 31 results (31 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
EQ-Bench Creative Writing v3 (Elo) leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI2173Default*gpt-6-astraIndependent testIndependentEQ-Bench ↗—1 Oct 2026
2Claude Fable 5.1Anthropic2162Default*claude-fable-5-1Independent testIndependentEQ-Bench ↗—1 Oct 2026
3Claude Opus 5Anthropic2133Defaultclaude-opus-5Independent testIndependentEQ-Bench ↗—1 Oct 2026
4GPT-6 SolOpenAI2125Default*gpt-6-solIndependent testIndependentEQ-Bench ↗—1 Oct 2026
5Kimi K3Moonshot AI (Kimi)2082Defaultkimi-k3Independent testIndependentEQ-Bench ↗—1 Oct 2026
6GLM-5.3Z.ai (Zhipu)2075DefaultGLM-5.3Independent testIndependentEQ-Bench ↗—1 Oct 2026
7Claude Opus 5.5Anthropic2050Default*claude-opus-5-5Independent testIndependentEQ-Bench ↗—1 Oct 2026
8Grok 4.7SpaceXAI (formerly xAI)2007Default*grok-4.7Independent testIndependentEQ-Bench ↗—1 Oct 2026
9GPT-5.6 SolOpenAI1972Defaultgpt-5.6-solIndependent testIndependentEQ-Bench ↗—1 Oct 2026
10Claude Fable 5Anthropic1943Defaultclaude-fable-5Independent testIndependentEQ-Bench ↗—1 Oct 2026
11Aion 3.5AionLabs1929Default*aion-3.5Independent testIndependentEQ-Bench ↗—1 Oct 2026
12Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)1927Defaultmuse-spark-1.1Independent testIndependentEQ-Bench ↗—1 Oct 2026
13Claude Opus 4.7Anthropic1914Defaultclaude-opus-4-7Independent testIndependentEQ-Bench ↗—1 Oct 2026
14Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)1906Default*muse-spark-1.3Independent testIndependentEQ-Bench ↗—1 Oct 2026
15GPT-5.6 TerraOpenAI1855Defaultgpt-5.6-terraIndependent testIndependentEQ-Bench ↗—1 Oct 2026
16GPT-5.5OpenAI1844Defaultgpt-5.5Independent testIndependentEQ-Bench ↗—1 Oct 2026
17Qwen3.8 2.4T A95B (open weights)Qwen (Alibaba)1843DefaultQwen/Qwen3.8-2.4T-A95BIndependent testIndependentEQ-Bench ↗—1 Oct 2026
18Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)1840Defaultmuse-spark-1.2Independent testIndependentEQ-Bench ↗—1 Oct 2026
19Claude Opus 4.8Anthropic1840Defaultclaude-opus-4-8Independent testIndependentEQ-Bench ↗—1 Oct 2026
20GPT-5.4OpenAI1840Defaultgpt-5.4Independent testIndependentEQ-Bench ↗—1 Oct 2026
21GPT-5.6 LunaOpenAI1829Defaultgpt-5.6-lunaIndependent testIndependentEQ-Bench ↗—1 Oct 2026
22Claude Sonnet 4.6Anthropic1810Defaultclaude-sonnet-4-6Independent testIndependentEQ-Bench ↗—1 Oct 2026
23Claude Opus 4.6Anthropic1809Defaultclaude-opus-4-6Independent testIndependentEQ-Bench ↗—1 Oct 2026
24Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)1798Defaultmeta-models/Muse-Glimmer-30BIndependent testIndependentEQ-Bench ↗—1 Oct 2026
25Claude Sonnet 5Anthropic1794Defaultclaude-sonnet-5Independent testIndependentEQ-Bench ↗—1 Oct 2026
26GLM-5.2Z.ai (Zhipu)1757Defaultzai-org/GLM-5.2Independent testIndependentEQ-Bench ↗—1 Oct 2026
27Gemini 3.8 FlashGoogle (Gemini / DeepMind)1748Default*gemini-3.8-flashIndependent testIndependentEQ-Bench ↗—1 Oct 2026
28Kimi K2.6Moonshot AI (Kimi)1725Defaultmoonshotai/Kimi-K2.6Independent testIndependentEQ-Bench ↗—1 Oct 2026
29Gemini 3.7 FlashGoogle (Gemini / DeepMind)1723Defaultgemini-3.7-flashIndependent testIndependentEQ-Bench ↗—1 Oct 2026
30Nemotron 3 UltraNVIDIA1692Defaultnvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4Independent testIndependentEQ-Bench ↗—1 Oct 2026
31Qwen3.8 27BQwen (Alibaba)1671DefaultQwen/Qwen3.8-27BIndependent testIndependentEQ-Bench ↗—1 Oct 2026