单项评测榜

τ²-Bench 排行榜

客服类多轮工具调用 Agent 评测集,覆盖零售、航空、电信三个场景域,衡量模型在真实业务流程中正确使用工具完成任务的能力

τ²-Bench 数据更新于 2026-08-26

类型
许可
地区
出处
Gemini 3 ProGoogle DeepMind82.46 / 100
DeepSeek-V3.2DeepSeek80.37 / 100
GPT-5OpenAI79.97 / 100
MiniMax-M2MiniMax 稀宇科技77.2 / 100
Kimi K2月之暗面 Moonshot AI64.3 / 100
Claude 3.7 Sonnet已下架Anthropic61.77 / 100

数据仅供参考,非官方权威判定,请以厂商官方发布为准。