τ³-Bench Tool-Agent-User Evaluation leaderboard
10 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Mistral Medium 3.5 128B | #1 | Mistral AI | 91.4% |
| MiMo-V2.5-Pro | #2 | Xiaomi | 72.9% |
| Nemotron 3 Ultra | #3 | NVIDIA | 70.9% |
| Qwen3.6 Plus | #4 | Alibaba Cloud | 70.7% |
| GLM-5.1 | #5 | Z.AI | 70.6% |
| Claude Opus 4.5 | #6 | Anthropic | 70.2% |
| Qwen3.5 397B | #7 | Alibaba Cloud | 68.4% |
| Qwen3.6-35B-A3B | #8 | Alibaba Cloud | 67.2% |
| Kimi K2.5 | #9 | Moonshot AI | 65.7% |
| GLM-5 | #10 | Z.AI | 65.6% |

