单项评测榜

ARC-AGI-2 排行榜

抽象推理与泛化能力测试集,评估模型在未见过的规则模式上做少样本推理的能力

ARC-AGI-2 数据更新于 2026-08-18

类型
许可
地区
出处
Gemini 3 ProGoogle DeepMind31.11 / 100
Grok 4xAI15.98 / 100
GPT-5OpenAI9.86 / 100
DeepSeek-V3.2DeepSeek4.03 / 100
Llama 4 MaverickMeta0 / 100

数据仅供参考,非官方权威判定,请以厂商官方发布为准。