Skip to content
Bencher

TestsBenchmarks · Agentic

Terminal-Bench-Science 0.1

70 scientific research workflows (data analysis, simulation, theorem proving) solved by an agent CLI and graded by hidden tests.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 10 · 10 models tested

Top 10 · best setting per model · 10 models, 30 results (1 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Terminal-Bench-Science 0.1 leaderboard
Thinking levelSetting
1GPT-6 AstraOpenAI68.1%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗Codex29 Sep 2026
2Claude Opus 5.5Anthropic63.3%Maxeffort=maxIndependent testIndependentOpenAI (competitor result in OpenAI launch post) ↗—29 Sep 2026
3Claude Sonnet 5.5Anthropic59.9%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗Claude Code (--bare)28 Sep 2026
4Gemini 4 ArgonGoogle (Gemini / DeepMind)57.6%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗—30 Sep 2026
5GPT-6.1 SolOpenAI57.0%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗Codex29 Sep 2026
6Claude Fable 5.1Anthropic52.6%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗Claude Code (--bare)1 Sep 2026
7Claude Opus 5Anthropic29.0%Maxadaptive thinking, effort=maxMaker's own figureVendor-reportedAnthropic ↗Claude Code (--bare)22 Sep 2026
8GPT-6 SolOpenAI27.6%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗Codex29 Sep 2026
9Claude Fable 5Anthropic25.0%Highadaptive thinking, effort=highMaker's own figureVendor-reportedAnthropic ↗Claude Code (--bare)1 Sep 2026
10GPT-5.6 SolOpenAI22.4%Maxreasoning effort=maxMaker's own figureVendor-reportedOpenAI ↗Codex3 Sep 2026