Skip to content
Bencher

TestsBenchmarks · Coding

NL2Repo-Bench

Generate an entire working repository from a natural-language specification, scored by the repo's test suite.

% solvedHigher is betterCounts toward:Weights: Coding ×0.5The test's websiteOfficial page ↗

The best 15 · 19 models tested

Top 15 · best setting per model · 19 models, 19 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
NL2Repo-Bench leaderboard
Thinking levelSetting
1DeepSeek V4.1 FlashDeepSeek64.0%Maxreasoning_effort=100 (max)Maker's own figureVendor-reportedDeepSeek ↗DeepSeek Harness (Minimal)10 Sep 2026
2DeepSeek V4 Pro (0813)DeepSeek61.5%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗DeepSeek Harness (minimal mode)13 Aug 2026
3GLM-5.3Z.ai (Zhipu)58.0%Maxreasoning_effort=maxMaker's own figureVendor-reportedZ.ai ↗—14 Aug 2026
4DeepSeek V4 Flash Vision ExpDeepSeek57.7%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗DeepSeek Harness (minimal mode)21 Aug 2026
5GLM-5.3-FlashZ.ai (Zhipu)56.3%Maxreasoning_effort=max (default)Maker's own figureVendor-reportedZ.ai ↗—26 Aug 2026
6Qwen3.8 Max (0803)Qwen (Alibaba)55.9%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code3 Aug 2026
7DeepSeek V4 Flash (0731)DeepSeek54.2%Maxreasoning_effort=maxMaker's own figureVendor-reportedDeepSeek ↗DeepSeek Harness (minimal mode)31 Jul 2026
8GLM-5.2Z.ai (Zhipu)48.9%Defaultthinking (effort not stated)Maker's own figureVendor-reportedZ.ai ↗—16 Jun 2026
9Qwen3.8 FlashQwen (Alibaba)48.1%Defaultthinking (setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code26 Aug 2026
10Qwen3.7 MaxQwen (Alibaba)47.2%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code16 May 2026
11GLM-5.1Z.ai (Zhipu)42.7%DefaultthinkingMaker's own figureVendor-reportedZ.ai ↗—7 Apr 2026
12Qwen3.8 27BQwen (Alibaba)42.3%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code14 Aug 2026
13MiniMax M3MiniMax42.1%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗Claude Code1 Jun 2026
14Qwen3.7 PlusQwen (Alibaba)41.1%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
15MiniMax M2.7MiniMax39.8%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—18 Mar 2026
16DeepSeek V4 Flash (Preview, 0423)DeepSeek39.4%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
17DeepSeek V4 Pro (Preview, 0423)DeepSeek38.5%Defaultsetting not stated for preview columnsMaker's own figureVendor-reportedDeepSeek ↗—13 Aug 2026
18Qwen3.6 PlusQwen (Alibaba)37.9%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code2 Apr 2026
19Qwen3.6 27BQwen (Alibaba)36.2%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗Claude Code22 Apr 2026