TestsBenchmarks · Reasoning
BIG-Bench Extra Hard
Harder successor to BIG-Bench Hard reasoning tasks.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemma 4 31B IT | Google (Gemini / DeepMind) | 74.4% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |
| 2 | Gemma 4 26B A4B IT | Google (Gemini / DeepMind) | 64.8% | DefaultThinking | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Apr 2026 |