Skip to content
Bencher

TestsBenchmarks · Multimodal

CharXiv Reasoning (no tools)

Information synthesis from complex scientific charts.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 10 · 10 models tested

Top 10 · best setting per model · 10 models, 10 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
CharXiv Reasoning (no tools) leaderboard
Thinking levelSetting
1Muse SparkMeta (Meta Superintelligence Labs, Muse)88.9%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
2Muse Spark 1.1Meta (Meta Superintelligence Labs, Muse)88.4%Defaulteffort not statedMaker's own figureVendor-reportedMeta ↗—9 Jul 2026
3Gemini 3.8 FlashGoogle (Gemini / DeepMind)86.2%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—2 Sep 2026
4Gemini 3.6 FlashGoogle (Gemini / DeepMind)85.2%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—21 Jul 2026
5Gemini 3.7 FlashGoogle (Gemini / DeepMind)84.5%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—13 Aug 2026
6Gemini 3.5 FlashGoogle (Gemini / DeepMind)84.2%Defaultdefault settings (API default thinking_level=medium)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
7Gemini 3.1 Pro (Preview)Google (Gemini / DeepMind)83.3%Defaultthinking level not stated (API default high)Maker's own figureVendor-reportedGoogle ↗—19 May 2026
8Muse Glimmer 30BMeta (Meta Superintelligence Labs, Muse)78.8%HighHigh reasoningMaker's own figureVendor-reportedMeta ↗—10 Aug 2026
9Gemini 3.5 Flash-LiteGoogle (Gemini / DeepMind)74.5%Highhigh thinkingMaker's own figureVendor-reportedGoogle ↗—21 Jul 2026
10Gemini 3.1 Flash-LiteGoogle (Gemini / DeepMind)73.2%HighMaker's own figureVendor-reportedGoogle ↗—3 Mar 2026