单项评测榜

Terminal-Bench 2.0 排行榜

89 道人工编写并验证的真实终端任务测试集,每题重复 5 次取成功率,评估 Agent 独立完成终端操作任务的能力;同一模型搭配不同 agent scaffold 分数不同,官方出处会注明具体 scaffold

Terminal-Bench 2.0 数据更新于 2026-08-26

类型
许可
地区
出处
Gemini 3.1 ProGoogle DeepMind80.2 / 100
Gemini 3 ProGoogle DeepMind69.4 / 100
GPT-5OpenAI49.6 / 100
DeepSeek-V3.2DeepSeek39.6 / 100
MiniMax-M2MiniMax 稀宇科技30 / 100
Kimi K2月之暗面 Moonshot AI27.8 / 100
Grok 4xAI27.2 / 100
Qwen3-Coder-480B-A35B-Instruct阿里云通义千问 Qwen27.2 / 100
GLM-4.6智谱 Zhipu/Z.ai24.5 / 100

数据仅供参考,非官方权威判定,请以厂商官方发布为准。