Skip to content
Bencher

TestsBenchmarks · Agentic

PaperBench

Reproduce ML research papers end to end, graded with expert rubrics.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 2 · 2 models tested

Top 2 · best setting per model · 2 models, 2 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
PaperBench leaderboard
Thinking levelSetting
1Qwen3.8 Max (0803)Qwen (Alibaba)93.0%Defaultthinking (default reasoning_effort=xhigh; eval setting not stated)Maker's own figureVendor-reportedQwen (Alibaba) ↗BasicAgent (Code-Dev)3 Aug 2026
2MiniMax M3MiniMax52.6%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗Claude Code (Ralph-Loop, 12h)1 Jun 2026