排行榜
2026 AI 大模型排行榜
聚合多项标准化评测的综合指数榜,覆盖与 Agent/编程能力强相关的大模型。
综合分基于该模型已收录评测的归一化加权平均计算,缺项不计入、不补 0, 不是全维度综合评分;综合榜仅收录已有 2 项及以上评测成绩的模型, 样本不足的模型仍可在下方单项榜与模型详情页查看。计算方法与数据出处见 数据来源与评测方法。
排行榜数据更新于 2026-08-26
类型
许可
地区
| 出处 | |||
|---|---|---|---|
| Gemini 3.1 Pro | Google DeepMind | 63.2(基于 2 项已收录评测计算) | |
| Claude 3.7 Sonnet已下架 | Anthropic | 62.7(基于 2 项已收录评测计算) | |
| Gemini 3 Pro | Google DeepMind | 60.5(基于 5 项已收录评测计算) | |
| MiniMax-M2 | MiniMax 稀宇科技 | 58.9(基于 3 项已收录评测计算) | |
| GPT-5 | OpenAI | 53.6(基于 4 项已收录评测计算) | |
| DeepSeek-V3.2 | DeepSeek | 48.5(基于 4 项已收录评测计算) | |
| Kimi K2 | 月之暗面 Moonshot AI | 47.9(基于 5 项已收录评测计算) | |
| Qwen3-Coder-480B-A35B-Instruct | 阿里云通义千问 Qwen | 45.2(基于 3 项已收录评测计算) | |
| GLM-4.6 | 智谱 Zhipu/Z.ai | 34.1(基于 3 项已收录评测计算) | |
| Grok 4 | xAI | 21.6(基于 2 项已收录评测计算) | |
| Llama 4 Maverick | Meta | 8.8(基于 3 项已收录评测计算) |
数据仅供参考,非官方权威判定,请以厂商官方发布为准。