Skip to content
Bencher

TestsBenchmarks · writing

LLM Creative Story-Writing Benchmark (Lech Mazur)

Short stories to constrained briefs, compared pairwise by a panel of LLM evaluators; Thurstone comparison score centered at 0.

ScoreHigher is betterCounts toward:Weights: Writing & creativity ×0.7The test's websiteOfficial page ↗

The best 15 · 44 models tested

Top 15 · best setting per model · 44 models, 48 results (48 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
LLM Creative Story-Writing Benchmark (Lech Mazur) leaderboard
Thinking levelSetting
1Claude Fable 5.1Anthropic3.8HighClaude Fable 5.1 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
2Claude Opus 5Anthropic3.8Extra highClaude Opus 5 (xhigh)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
3Claude Opus 5.5Anthropic3.8HighClaude Opus 5.5 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
4GPT-6 AstraOpenAI3.5HighGPT-6 Astra (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
5GLM-5.3Z.ai (Zhipu)3MaxGLM-5.3 (max)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
6Claude Fable 5Anthropic2.9HighClaude Fable 5 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
7GPT-5.6 SolOpenAI2.5Extra highGPT-5.6 Sol (xhigh)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
8Kimi K3Moonshot AI (Kimi)2.5DefaultKimi K3Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
9GPT-5.5OpenAI2.5Extra highGPT-5.5 (xhigh)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
10GPT-5.4OpenAI2MediumGPT-5.4 (medium)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
11Claude Opus 4.7Anthropic1.8HighClaude Opus 4.7 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
12Claude Sonnet 4.6Anthropic1.7DefaultClaude Sonnet 4.6 Thinking 16KIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
13MiMo-V2.6-ProXiaomi MiMo1.6DefaultXiaomi MiMo V2.6 Pro (thinking)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
14Claude Opus 4.6Anthropic1.1DefaultClaude Opus 4.6 Thinking 16KIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
15Claude Opus 4.8Anthropic0.8Extra highClaude Opus 4.8 (xhigh)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
16Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)0.8HighMuse Spark 1.1 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
17Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)0.6HighMuse Spark 1.3 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
18DeepSeek V4 Pro (0813)DeepSeek0.5HighDeepSeek V4 Pro (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
19GLM-5.2Z.ai (Zhipu)0.5MaxGLM-5.2 (max)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
20Grok 4.7SpaceXAI (formerly xAI)0.4HighGrok 4.7 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
21Gemini 3.8 FlashGoogle (Gemini / DeepMind)0.2HighGemini 3.8 Flash (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
22Qwen3.8 Max (0803)Qwen (Alibaba)0.2DefaultQwen 3.8 MaxIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
23Kimi K2.6Moonshot AI (Kimi)0.1DefaultKimi K2.6Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
24Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)-0HighMuse Spark 1.2 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
25MiniMax M3MiniMax-0.1DefaultMiniMax-M3Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
26DeepSeek V4.1 FlashDeepSeek-0.5HighDeepSeek V4.1 Flash (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
27DeepSeek V4 Pro (Preview, 0423)DeepSeek-0.5DefaultDeepSeek V4 Pro PreviewIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
28Qwen3.8 27BQwen (Alibaba)-0.6DefaultQwen3.8-27BIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
29MiMo-V2.5-ProXiaomi MiMo-0.7DefaultXiaomi MiMo V2.5 ProIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
30Gemini 3.7 FlashGoogle (Gemini / DeepMind)-0.7HighGemini 3.7 Flash (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
31Qwen3.6 Max PreviewQwen (Alibaba)-0.9DefaultQwen 3.6 Max PreviewIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
32GLM-5.1Z.ai (Zhipu)-1DefaultGLM-5.1Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
33Kimi K2.5Moonshot AI (Kimi)-1.1DefaultKimi K2.5 ThinkingIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
34Gemma 4 31B ITGoogle (Gemini / DeepMind)-1.9DefaultGemma 4 31B ReasoningIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
35Gemini 3.5 FlashGoogle (Gemini / DeepMind)-2DefaultGemini 3.5 FlashIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
36Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)-2.2DefaultGemini 3.1 Pro PreviewIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
37Qwen3.6 PlusQwen (Alibaba)-2.3DefaultQwen 3.6 PlusIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
38Mistral Medium 3.5Mistral AI-2.5DefaultMistral Medium 3.5Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
39Qwen3.7 MaxQwen (Alibaba)-2.6DefaultQwen 3.7 MaxIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
40Grok 4.6SpaceXAI (formerly xAI)-2.8HighGrok 4.6 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
41gpt-oss-120bOpenAI-3.1DefaultGPT-OSS-120BIndependent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
42MiniMax M2.7MiniMax-3.8DefaultMiniMax-M2.7Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
43Grok 4.3SpaceXAI (formerly xAI)-4.2DefaultGrok 4.3Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026
44Grok 4.5SpaceXAI (formerly xAI)-5.1HighGrok 4.5 (high)Independent testIndependentLech Mazur (LLM Creative Story-Writing Benchmark) ↗—28 Sep 2026