Skip to content
Bencher

TestsBenchmarks · Long context

GraphWalks BFS (up to 128k)

Graph traversal over long contexts up to 128k, BFS F1.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 1 · 1 models tested

Top 1 · best setting per model · 1 models, 1 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
GraphWalks BFS (up to 128k) leaderboard
Thinking levelSetting
1Gemini 4 ArgonGoogle (Gemini / DeepMind)99.7%Maxhighest thinking settingsMaker's own figureVendor-reportedGoogle ↗—30 Sep 2026