Skip to content
Bencher

TestsBenchmarks · Tool use

tau3-bench

Third-generation tau-bench customer-service agent simulations with policy following.

% solvedHigher is betterThe test's websiteOfficial page ↗

The best 2 · 2 models tested

Top 2 · best setting per model · 2 models, 2 results (0 independent)

Measured by independent testersIndependent Reported by the makerVendor-reported
tau3-bench leaderboard
Thinking levelSetting
1Qwen3.6 PlusQwen (Alibaba)70.7%DefaultthinkingMaker's own figureVendor-reportedQwen (Alibaba) ↗—2 Apr 2026
2GLM-5.1Z.ai (Zhipu)70.6%DefaultthinkingMaker's own figureVendor-reportedZ.ai ↗—7 Apr 2026