Skip to content
Bencher

TestsBenchmarks · Coding

Expert-SWE (OpenAI internal)

OpenAI internal long-horizon coding eval with ~20h median human completion time.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 2 · 2 models tested

Top 2 · best setting per model · 2 models, 2 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Expert-SWE (OpenAI internal) leaderboard
Thinking levelSetting
1GPT-5.5OpenAI73.1%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026
2GPT-5.4OpenAI68.5%Extra highreasoning effort=xhighMaker's own figureVendor-reportedOpenAI ↗—23 Apr 2026