TestsBenchmarks · Long context
OpenAI MRCR v2 (8-needle)
Multi-round coreference over long context; context range in settingLabel.
% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.5The test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 100.0% | Defaultbest score across efforts (OpenAI table: "maximum at any effort"); 8-needle 256K-512K | Maker's own figureVendor-reportedOpenAI ↗ | — | 3 Sep 2026 |
| 2 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 97.0% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 13 Aug 2026 |
| 3 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 91.8% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 4 | GPT-5.6 Sol | OpenAI | 91.5% | Defaultbest score across efforts (OpenAI table: "maximum at any effort"); 8-needle 256K-512K | Maker's own figureVendor-reportedOpenAI ↗ | — | 3 Sep 2026 |
| 5 | GPT-5.6 Terra | OpenAI | 89.6% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results); 8-needle 256K-512K | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 6 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 84.9% | HighThinking (High) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 Feb 2026 |
| 7 | GPT-5.5 | OpenAI | 81.5% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results); 8-needle 256K-512K | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |
| 8 | Gemini 3.5 Flash | Google (Gemini / DeepMind) | 77.3% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |
| 9 | Gemini 3.5 Flash-Lite | Google (Gemini / DeepMind) | 72.2% | Highhigh thinking | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 10 | Gemma 4 31B IT | Google (Gemini / DeepMind) | 66.4% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |
| 11 | Gemini 3.1 Flash-Lite | Google (Gemini / DeepMind) | 60.1% | High | Maker's own figureVendor-reportedGoogle ↗ | — | 3 Mar 2026 |
| 12 | Gemma 4 26B A4B IT | Google (Gemini / DeepMind) | 44.1% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |
| 13 | GPT-5.6 Luna | OpenAI | 41.3% | DefaultGPT-5.6 launch table (effort not stated; text cites max for headline results); 8-needle 256K-512K | Maker's own figureVendor-reportedOpenAI ↗ | — | 9 Jul 2026 |