单项评测榜
SWE-bench Verified 排行榜
500 道人工验证过的真实 GitHub issue 修复任务,评估编码 Agent 解决实际软件工程问题的能力
SWE-bench Verified 数据更新于 2026-08-18
类型
许可
地区
| 出处 | |||
|---|---|---|---|
| Gemini 3 Pro | Google DeepMind | 76.2 / 100 | |
| GPT-5 | OpenAI | 74.9 / 100 | |
| Devstral 2 | Mistral AI | 72.2 / 100 | |
| DeepSeek-V3.2 | DeepSeek | 70 / 100 | |
| Qwen3-Coder-480B-A35B-Instruct | 阿里云通义千问 Qwen | 69.6 / 100 | |
| MiniMax-M2 | MiniMax 稀宇科技 | 69.4 / 100 | |
| GLM-4.6 | 智谱 Zhipu/Z.ai | 68.2 / 100 | |
| Kimi K2 | 月之暗面 Moonshot AI | 65.8 / 100 | |
| Claude 3.7 Sonnet已下架 | Anthropic | 63.7 / 100 | |
| Claude 3.5 Sonnet(2024-10-22 版)已下架 | Anthropic | 49 / 100 | |
| Llama 4 Maverick | Meta | 21.04 / 100 |
数据仅供参考,非官方权威判定,请以厂商官方发布为准。