单项评测榜
SWE-bench Pro 排行榜
规模更大、抗数据污染设计的真实仓库代码修复测试集;本站只收录官方 Public Set(731 题,公开可复现)成绩,不采用 Private/Commercial 私有集数据
SWE-bench Pro 数据更新于 2026-08-26
类型
许可
地区
| 出处 | |||
|---|---|---|---|
| Gemini 3.1 Pro | Google DeepMind | 46.1 / 100 | |
| Gemini 3 Pro | Google DeepMind | 43.3 / 100 | |
| Qwen3-Coder-480B-A35B-Instruct | 阿里云通义千问 Qwen | 38.7 / 100 | |
| Kimi K2 | 月之暗面 Moonshot AI | 27.67 / 100 | |
| GLM-4.6 | 智谱 Zhipu/Z.ai | 9.67 / 100 | |
| Llama 4 Maverick | Meta | 5.24 / 100 |
数据仅供参考,非官方权威判定,请以厂商官方发布为准。