单项评测榜
τ²-Bench 排行榜
客服类多轮工具调用 Agent 评测集,覆盖零售、航空、电信三个场景域,衡量模型在真实业务流程中正确使用工具完成任务的能力
τ²-Bench 数据更新于 2026-08-26
类型
许可
地区
| 出处 | |||
|---|---|---|---|
| Gemini 3 Pro | Google DeepMind | 82.46 / 100 | |
| DeepSeek-V3.2 | DeepSeek | 80.37 / 100 | |
| GPT-5 | OpenAI | 79.97 / 100 | |
| MiniMax-M2 | MiniMax 稀宇科技 | 77.2 / 100 | |
| Kimi K2 | 月之暗面 Moonshot AI | 64.3 / 100 | |
| Claude 3.7 Sonnet已下架 | Anthropic | 61.77 / 100 |
数据仅供参考,非官方权威判定,请以厂商官方发布为准。