TestsBenchmarks · Multimodal
CharXiv Reasoning (no tools)
Information synthesis from complex scientific charts.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Muse Spark | Meta (Meta Superintelligence Labs, Muse) | 88.9% | Defaulteffort not stated | Maker's own figureVendor-reportedMeta ↗ | — | 9 Jul 2026 |
| 2 | Muse Spark 1.1 | Meta (Meta Superintelligence Labs, Muse) | 88.4% | Defaulteffort not stated | Maker's own figureVendor-reportedMeta ↗ | — | 9 Jul 2026 |
| 3 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 86.2% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 2 Sep 2026 |
| 4 | Gemini 3.6 Flash | Google (Gemini / DeepMind) | 85.2% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 5 | Gemini 3.7 Flash | Google (Gemini / DeepMind) | 84.5% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 13 Aug 2026 |
| 6 | Gemini 3.5 Flash | Google (Gemini / DeepMind) | 84.2% | Defaultdefault settings (API default thinking_level=medium) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |
| 7 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 83.3% | Defaultthinking level not stated (API default high) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 May 2026 |
| 8 | Muse Glimmer 30B | Meta (Meta Superintelligence Labs, Muse) | 78.8% | HighHigh reasoning | Maker's own figureVendor-reportedMeta ↗ | — | 10 Aug 2026 |
| 9 | Gemini 3.5 Flash-Lite | Google (Gemini / DeepMind) | 74.5% | Highhigh thinking | Maker's own figureVendor-reportedGoogle ↗ | — | 21 Jul 2026 |
| 10 | Gemini 3.1 Flash-Lite | Google (Gemini / DeepMind) | 73.2% | High | Maker's own figureVendor-reportedGoogle ↗ | — | 3 Mar 2026 |