Anthropic 今日对外发布了一套用于衡量前沿 AI 实验室研发进度的方法,并同步披露了公司内部阶段性数据。这套体系围绕 3 项核心指标展开:AI 参与 AI 研发的程度、AI 智能体的监督情况,以及算力在 AI 研发与安全研究之间的分配。
Anthropic 表示,随着 AI 能力提升,AI 正在更多参与下一代 AI 系统的研发。公开这些指标的目的,是让公众、第三方机构和政府更直观地掌握前沿 AI 研发的推进速度。值得注意的是,Anthropic CEO 达里奥 · 阿莫代伊此前曾呼吁协调放缓前沿 AI 发展;若未来出现相关协调,这些数字预计也会发生变化。
第一项指标聚焦“AI 参与 AI 研发”。Anthropic 提出“Anthropic 研发自动化指数”,用于衡量 Claude 在公司 AI 研发工作中的参与程度。该指标采用 Epoch AI 提出的自动化等级体系,划分为 AL0 至 AL5:从“没有 AI 参与”“AI 辅助”“AI 协作”,到“AI 主导”与“完全自主运行”。这一分级逻辑类似汽车自动驾驶评判:AL5 指 AI 完全自主运行、无需人类介入;AL4 则指 AI 可依据高层提示完成大部分任务,人类只负责监督。
数据显示,截至 2026 年 8 月,Claude 尚未在任何被测量的 AI 研发工作中达到“完全自主运行”,但已“主导”Anthropic 约 26% 的 AI 研发工作;处于“AI 协作”及更高等级的工作占比已超过 90%。而在 2026 年 2 月,这一比例还不到 1%。Anthropic 认为,这类指标可用于观察 AI 研发自动化程度是否持续提高,以及距离“递归自我改进”——即 AI 能够完全自主开发下一代 AI——还有多远。
为构建该指标,Anthropic 从 2026 年 7 月的内部工作记录、Slack 及其他文档中抽样整理出约 1.5 万个模型研发任务,归纳为 542 个不同层级的任务节点,其中 378 个属于最细分任务类别。之后由 Claude 研究这些任务的执行方式及 AI 参与程度,再由独立的 Claude 评估模型完成自动化等级判断。
第二项指标关注 AI 智能体的监督情况。Anthropic 的实时监控系统会在智能体执行操作前检查行为,发现危险操作时进行拦截或调整。对 2026 年 8 月超过 10 亿次智能体决策的分析显示,约 0.002% 的操作被该系统拦截(相当于约每 4.7 万次操作出现 1 次拦截)。事后监控系统则分析智能体已完成的操作,每周约标记 10 万份对话记录进入进一步检查,其中优先级最高的约 50 份会升级至人工审核;整体来看,约千分之一至千分之二的智能体活动会被标记为需要进一步审查。
第三项指标是算力分配。Anthropic 统计了 2026 年 7 月 13 日至 7 月 20 日期间的算力使用情况:用于 AI 研发的算力中,约 6% 投入安全研究;若仅统计基于 AI 的 AI 研发工作,安全研究算力占比约 12%。公司强调,这一比例属于较为保守的估计,因为同时促进模型能力和安全性的工作未被计入安全研究,统计也未包含用于安全分类器的另一部分算力。同时,安全研究通常并不需要像前沿模型训练那样消耗大量算力,因此算力占比不能直接代表安全工作的整体投入程度。
Anthropic 同时说明,这些指标目前仍属原型测量体系,跨实验室比较仍面临统一方法与独立验证等问题。公司计划引入来自多个组织的独立第三方评估人员,给予其与内部风险评估团队相近的流程、系统和数据访问权限,以验证安全实践并持续监测相关指标。Anthropic 表示,公布这些测量是为了让公众、第三方和政府更好了解前沿实验室内部的 AI 发展速度,并希望继续发布相关数据。





