TestsBenchmarks · Tool use
τ²-bench (Telecom)
Customer-service agent simulation, telecom domain.
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 99.3% | HighThinking (High) | Maker's own figureVendor-reportedGoogle ↗ | — | 19 Feb 2026 |
| 2 | GPT-5.5 | OpenAI | 98.0% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 23 Apr 2026 |
| 3 | GPT-5.4 | OpenAI | 92.8% | Extra highreasoning effort=xhigh | Maker's own figureVendor-reportedOpenAI ↗ | — | 23 Apr 2026 |