Skip to content
Bencher

TestsBenchmarks · Agentic

Claw-Eval

Personal-assistant / OpenClaw-style agent tasks (pass^3 unless noted).

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 1 · 1 models tested

Top 1 · best setting per model · 1 models, 1 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
Claw-Eval leaderboard
Thinking levelSetting
1MiniMax M3MiniMax74.5%Defaultsetting not statedMaker's own figureVendor-reportedMiniMax ↗—1 Jun 2026