单项评测榜
Terminal-Bench 2.0 排行榜
89 道人工编写并验证的真实终端任务测试集,每题重复 5 次取成功率,评估 Agent 独立完成终端操作任务的能力;同一模型搭配不同 agent scaffold 分数不同,官方出处会注明具体 scaffold
Terminal-Bench 2.0 数据更新于 2026-08-26
类型
许可
地区
| 出处 | |||
|---|---|---|---|
| Gemini 3.1 Pro | Google DeepMind | 80.2 / 100 | |
| Gemini 3 Pro | Google DeepMind | 69.4 / 100 | |
| GPT-5 | OpenAI | 49.6 / 100 | |
| DeepSeek-V3.2 | DeepSeek | 39.6 / 100 | |
| MiniMax-M2 | MiniMax 稀宇科技 | 30 / 100 | |
| Kimi K2 | 月之暗面 Moonshot AI | 27.8 / 100 | |
| Grok 4 | xAI | 27.2 / 100 | |
| Qwen3-Coder-480B-A35B-Instruct | 阿里云通义千问 Qwen | 27.2 / 100 | |
| GLM-4.6 | 智谱 Zhipu/Z.ai | 24.5 / 100 |
数据仅供参考,非官方权威判定,请以厂商官方发布为准。