单项评测榜
ARC-AGI-2 排行榜
抽象推理与泛化能力测试集,评估模型在未见过的规则模式上做少样本推理的能力
ARC-AGI-2 数据更新于 2026-08-18
类型
许可
地区
| 出处 | |||
|---|---|---|---|
| Gemini 3 Pro | Google DeepMind | 31.11 / 100 | |
| Grok 4 | xAI | 15.98 / 100 | |
| GPT-5 | OpenAI | 9.86 / 100 | |
| DeepSeek-V3.2 | DeepSeek | 4.03 / 100 | |
| Llama 4 Maverick | Meta | 0 / 100 |
数据仅供参考,非官方权威判定,请以厂商官方发布为准。