IT之家:https://www.ithome.com/ 9 月 18 日消息,Anthropic 今日发布了一套用于衡量前沿 AI 实验室研发进度的方法,并公布公司内部的阶段性数据。
该体系主要关注 3 项指标:AI 参与 AI 研发的程度、AI 智能体的监督情况,以及算力在 AI 研发与安全研究之间的分配。
Anthropic 称,随着 AI 能力的提升,AI 正在越来越多地参与下一代 AI 系统的研发。公司希望通过公开这些指标,让公众、第三方机构和政府更直观地了解前沿 AI 研发的推进速度。
Anthropic CEO 达里奥 · 阿莫代伊曾呼吁协调放缓前沿 AI 发展,若出现协调,相关数字预计会变化。
在 AI 参与 AI 研发方面,Anthropic 提出了“Anthropic 研发自动化指数”,用于衡量 Claude 参与公司 AI 研发工作的程度。该指标采用 Epoch AI 提出的自动化等级体系,从 AL0 到 AL5,分别对应没有 AI 参与、AI 辅助、AI 协作、AI 主导以及完全自主运行。
类似于汽车的自动驾驶评判等级,AL5 指的是 AI 完全自主运行、无需人类介入,AL4 指 AI 可依据高层提示完成大部分任务、人类只负责监督。
截至 2026 年 8 月,Claude 未在任何被测量的 AI 研发工作中实现“完全自主运行”,但已经“主导”Anthropic 约 26% 的 AI 研发工作,同时处于“AI 协作”及更高等级的工作占比已经超过 90%。
Anthropic 披露,这一比例在 2026 年 2 月还不到 1%。该公司认为,这类指标有助于观察 AI 研发自动化程度是否持续提高,以及距离“递归自我改进”—— 即 AI 能够完全自主开发下一代 AI—— 还有多远。
为建立这一指标,Anthropic 从 2026 年 7 月的内部工作记录、Slack 及其他文档中抽样整理出约 1.5 万个模型研发任务,并将其归纳为 542 个不同层级的任务节点,其中 378 个属于最细分的任务类别。随后由 Claude 研究这些任务的执行方式及 AI 参与程度,并由独立的 Claude 评估模型进行自动化等级判断。