Skip to content
Bencher

TestsBenchmarks · Coding

SciCode

Share of scientific-computing coding subproblems solved correctly (as run by Artificial Analysis).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 15 · 59 models tested

Top 15 · best setting per model · 59 models, 107 results (103 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
SciCode leaderboard
Thinking levelSetting
1Claude Opus 5.5Anthropic66.9%MaxClaude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
2Claude Fable 5.1Anthropic63.1%MaxClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
3Gemini 4 ArgonGoogle (Gemini / DeepMind)61.8%HighGemini 4 Argon (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
4Claude Sonnet 5.5Anthropic61.0%MaxClaude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
5Claude Fable 5Anthropic61.0%MaxClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
6MiMo-V2.6-ProXiaomi MiMo60.9%DefaultMiMo-V2.6-ProIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
7Gemini 3.7 FlashGoogle (Gemini / DeepMind)59.8%MediumGemini 3.7 Flash (Medium)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
8Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)59.7%Extra highMuse Spark 1.3 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
9Kimi K3Moonshot AI (Kimi)59.5%MaxKimi K3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
10GLM-5.3Z.ai (Zhipu)59.0%MaxGLM-5.3 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
11Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)59.0%HighThinking (High)Maker's own figureVendor-reportedGoogle ↗—19 Feb 2026
12Step 5 PreviewStepFun58.9%DefaultStep 5 PreviewIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
13Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)58.8%Extra highMuse Spark 1.1 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
14Grok 4.7SpaceXAI (formerly xAI)57.8%HighGrok 4.7 (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
15GPT-5.6 SolOpenAI57.8%HighGPT-5.6 Sol (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
16GPT-6 SolOpenAI57.6%MaxGPT-6 Sol (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
17Muse Spark 1.2Meta (Meta Superintelligence Labs, Muse)57.4%Extra highMuse Spark 1.2 (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
18Gemini 3.8 FlashGoogle (Gemini / DeepMind)56.6%HighGemini 3.8 Flash (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
19GPT-6 AstraOpenAI56.5%MaxGPT-6 Astra (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
20Grok 4.6SpaceXAI (formerly xAI)56.5%HighGrok 4.6 (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
21Claude Opus 5Anthropic56.4%MaxClaude Opus 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
22GPT-5.5OpenAI56.1%HighGPT-5.5 (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
23GPT-6.1 SolOpenAI55.8%HighGPT-6.1 Sol (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
24Grok 4.5SpaceXAI (formerly xAI)55.0%HighGrok 4.5 (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
25GPT-5.6 TerraOpenAI55.0%MaxGPT-5.6 Terra (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
26GPT-6 LunaOpenAI54.6%MaxGPT-6 Luna (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
27Claude Opus 4.8Anthropic54.4%MaxClaude Opus 4.8 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
28Claude Sonnet 5Anthropic54.3%MaxClaude Sonnet 5 (Adaptive Reasoning, Max Effort)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
29Qwen3.8 2.4T A95B (open weights)Qwen (Alibaba)54.1%DefaultQwen3.8 2.4T A95BIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
30GPT-5.6 LunaOpenAI53.6%MaxGPT-5.6 Luna (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
31Qwen3.7 MaxQwen (Alibaba)53.5%Defaultthinking (vendor recommends 'Reasoning effort is set to xhigh' system prompt for reasoning tasks)Maker's own figureVendor-reportedQwen (Alibaba) ↗—16 May 2026
32Gemini 3.6 FlashGoogle (Gemini / DeepMind)53.4%HighGemini 3.6 Flash (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
33Kimi K2.6Moonshot AI (Kimi)52.2%DefaultthinkingMaker's own figureVendor-reportedMoonshot AI ↗—20 Apr 2026
34Qwen3.8 Max (0902)Qwen (Alibaba)52.1%DefaultQwen3.8 Max (0902)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
35DeepSeek V4.1 FlashDeepSeek51.9%MaxDeepSeek V4.1 Flash (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
36GLM-5.3-FlashZ.ai (Zhipu)51.6%DefaultGLM 5.3 FlashIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
37MiMo-V2.6-FlashXiaomi MiMo51.3%DefaultMiMo-V2.6-FlashIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
38Qwen3.7 PlusQwen (Alibaba)51.3%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—21 May 2026
39GLM-5.2Z.ai (Zhipu)51.2%MaxGLM-5.2 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
40DeepSeek V4 Pro (0813)DeepSeek51.0%MaxDeepSeek V4 Pro 0813 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
41Qwen3.8-Flash-NextQwen (Alibaba)50.6%DefaultQwen3.8-Flash-NextIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
42DeepSeek V4 Flash (0731)DeepSeek50.3%MaxDeepSeek V4 Flash 0731 (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
43DeepSeek V4 Flash Vision ExpDeepSeek49.7%MaxDeepSeek V4 Flash Vision (Max)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
44Hy3Tencent Hunyuan48.6%DefaultHy3Independent testIndependentArtificial Analysis ↗—1 Oct 2026
45MiniMax M3MiniMax47.1%DefaultMiniMax-M3Independent testIndependentArtificial Analysis ↗—1 Oct 2026
46Qwen3.8 27BQwen (Alibaba)46.6%Extra highQwen3.8 27B (Xhigh)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
47Gemma 4 31B ITGoogle (Gemini / DeepMind)45.5%DefaultGemma 4 31B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
48Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)44.9%HighMuse Glimmer (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
49Nemotron 3 UltraNVIDIA40.3%DefaultNemotron 3 Ultra 550B A55B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
50Mistral Medium 3.5Mistral AI40.2%DefaultMistral Medium 3.5Independent testIndependentArtificial Analysis ↗—1 Oct 2026
51gpt-oss-20bOpenAI38.9%Highgpt-oss-20b (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
52Mistral Small 4Mistral AI38.8%HighMistral Small 4 (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
53Command A+Cohere38.5%DefaultCommand A+Independent testIndependentArtificial Analysis ↗—1 Oct 2026
54Qwen3.6 35B A3BQwen (Alibaba)36.6%DefaultQwen3.6 35B A3B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
55Nemotron 3 Super 120B A12BNVIDIA36.2%DefaultNemotron 3 Super 120B A12B (Reasoning)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
56gpt-oss-120bOpenAI34.0%Highgpt-oss-120b (High)Independent testIndependentArtificial Analysis ↗—1 Oct 2026
57Nemotron 3.5 Lightning 30B-A3BNVIDIA32.1%DefaultNemotron 3.5 LightningIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
58Granite 4.2 8BIBM Granite31.5%DefaultGranite 4.2 8BIndependent testIndependentArtificial Analysis ↗—1 Oct 2026
59Ministral 3 14BMistral AI23.8%DefaultMinistral 3 14BIndependent testIndependentArtificial Analysis ↗—1 Oct 2026