Skip to content
Bencher

TestsBenchmarks · Coding

Vals Code Migration

How well an agent re-implements real programs in another language (CLI tools, COBOL to Java) with tests and code-quality checks.

% solvedHigher is betterCounts toward:Weights: Coding ×0.6The test's websiteOfficial page ↗

The best 15 · 25 models tested

Top 15 · best setting per model · 25 models, 25 results (25 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Vals Code Migration leaderboard
Thinking levelSetting
1Claude Sonnet 5.5Anthropic69.8%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
2Gemini 4 ArgonGoogle (Gemini / DeepMind)68.2%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
3GPT-6 AstraOpenAI67.7%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
4Claude Opus 5.5Anthropic66.7%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
5GPT-6.1 SolOpenAI65.1%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
6Claude Opus 5Anthropic57.5%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
7GPT-6 SolOpenAI57.2%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
8Claude Fable 5Anthropic55.1%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
9Claude Fable 5.1Anthropic54.6%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
10GPT-5.6 SolOpenAI52.9%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
11GPT-5.6 TerraOpenAI47.8%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
12Hy4 previewTencent Hunyuan47.4%DefaultIndependent testIndependentVals.ai ↗—29 Sep 2026
13Muse Spark 1.3Meta (Meta Superintelligence Labs, Muse)47.4%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
14Claude Opus 4.8Anthropic47.3%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
15DeepSeek V4.1 FlashDeepSeek45.6%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
16GPT-5.5OpenAI45.2%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
17Grok 4.7SpaceXAI (formerly xAI)44.8%Extra highreasoning_effort=xhighIndependent testIndependentVals.ai ↗—29 Sep 2026
18Grok 4.6SpaceXAI (formerly xAI)44.6%Highreasoning_effort=highIndependent testIndependentVals.ai ↗—29 Sep 2026
19GPT-5.6 LunaOpenAI44.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
20Claude Sonnet 5Anthropic44.4%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
21GLM-5.3Z.ai (Zhipu)44.2%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
22Claude Opus 4.7Anthropic43.9%Maxeffort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
23MiMo-V2.6-ProXiaomi MiMo43.0%DefaultIndependent testIndependentVals.ai ↗—29 Sep 2026
24GPT-6 LunaOpenAI42.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026
25DeepSeek V4 Pro (0813)DeepSeek41.5%Maxreasoning_effort=maxIndependent testIndependentVals.ai ↗—29 Sep 2026