排行榜

数据来源与评测方法

排行榜数据出处、采集方式与版权口径说明。

本站不自建评测

本站不跑 benchmark,只做权威三方数据的聚合与可视化。收录的每一个 benchmark 都与 Agent/编程能力相关,有公开可复现的评测方法,结果由官方或可信第三方发布。

每一条分数都有一手出处

每一条分数必须标注一手出处:模型官方 model card、技术报告、论文、厂商博客, 或可复现的第三方评测方法说明,附具体 URL 与采集日期。榜单页每一行都能点到 对应的出处链接,鼠标悬停能看到抓取时读到的原文摘录。

采集方式与版权口径

数据采集仅取公开发布的内容,遵守目标站点的 robots.txt;不镜像、不转载目标站的 排版或文案,只提取分数与来源事实,用本站自己的呈现方式渲染。

综合分怎么算

不同 benchmark 的原始分数量纲不一样(有的 0-100,有的 0-1),直接相加没有意义。 综合分先把每条分数按所在 benchmark 的满分换算成 0-100 的百分比(分数越低越好的 指标先取反再换算),再取该模型已收录 benchmark 的加权平均(首期权重全部为 1, 等价于算术平均)。模型没跑过的 benchmark 不计入、不补 0——不会因为缺少某项数据 被拉低分数,也不会误当作它在那项上是 0 分。榜单页会显式标注综合分基于多少项 已收录评测计算,这不是全维度综合评分。综合榜只收录已有 2 项及以上评测成绩的 模型——只测过 1 项的模型样本太少,放进跨模型排名会失真,这些模型仍能在对应的 单项榜与自己的模型详情页里查到。

收录标准

在本站已收录的任一 benchmark 上有公开成绩就收录,没有就不收录,不做「这个模型 应该很强但还没测过」式的主观判断。首期只收录与 Agent/编程能力强相关的模型。 模型不会因为「过时」被剔除——收录后官方下架的模型页面仍会保留,只在页面上标注状态, 已收录的历史模型仍有查阅价值。

免责声明

以上数据仅供参考,不构成官方权威判定,请以厂商官方发布为准。