Skip to content
Bencher

TestsBenchmarks · Long context

MRCR v2 (8-needle, 1M pointwise)

MRCR v2 8-needle at 1M tokens.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 5 · 5 models tested

Top 5 · best setting per model · 5 models, 5 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
MRCR v2 (8-needle, 1M pointwise) leaderboard
Thinking levelSetting
1Gemini 3.6 FlashGoogle (Gemini / DeepMind)54.0%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
2Gemini 3.5 FlashGoogle (Gemini / DeepMind)26.6%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
3Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)26.3%HighThinking (High)Maker's own figureVendor-reportedGoogle ↗—19 Feb 2026
4Gemini 3.5 Flash-LiteGoogle (Gemini / DeepMind)21.3%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗—21 Jul 2026
5Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)12.3%HighMaker's own figureVendor-reportedGoogle ↗—3 Mar 2026