Anthropic构建并公布R&D自动化指数原型:截至2026年8月Claude主导26%的内部AI研发工作,无任何被测工作完全自主,协作及以上占比超90%
事件全貌
AI 综述Anthropic 发布了一套用于衡量前沿 AI 实验室研发进度的方法,并公布公司内部的阶段性数据。其核心是“Anthropic 研发自动化指数”,用于衡量 Claude 参与公司 AI 研发工作的程度,采用 Epoch AI 提出的自动化等级体系(AL0 至 AL5,分别对应没有 AI 参与、AI 辅助、AI 协作、AI 主导以及完全自主运行)。该体系主要关注三项指标:AI 参与 AI 研发的程度、AI 智能体的监督情况,以及算力在 AI 研发与安全研究之间的分配。
据 Anthropic 公布的数据,截至 2026 年 8 月,Claude 未在任何被测量的 AI 研发工作中实现“完全自主运行”,但已“主导”约 26% 的 AI 研发工作,处于“AI 协作”及更高等级的工作占比超过 90%。为建立该指标,Anthropic 从 2026 年 7 月的内部工作记录、Slack 及其他文档中抽样整理出约 1.5 万个模型研发任务,归纳为 542 个不同层级的任务节点,其中 378 个属于最细分的任务类别;随后由 Claude 研究这些任务的执行方式及 AI 参与程度,并由独立的 Claude 评估模型进行自动化等级判断。
在智能体监督方面,Anthropic 称实时监控系统会在智能体执行操作前检查行为,并在发现危险操作时拦截或调整;对 2026 年 8 月超过 10 亿次智能体决策的分析显示,约 0.002% 的操作被该系统拦截(约每 4.7 万次操作出现 1 次拦截)。事后监控系统则分析智能体已完成的操作,每周约标记 10 万份对话记录进行进一步检查,其中优先级最高的约 50 份会升级至人工审核;约千分之一至千分之二的智能体活动会被标记为需要进一步审查。
在算力分配方面,Anthropic 统计了 2026 年 7 月 13 日至 7 月 20 日期间的使用情况:用于 AI 研发的算力中约 6% 投入安全研究;如果仅统计基于 AI 的 AI 研发工作,其安全研究算力占比约 12%。Anthropic 强调这是较为保守的估计,因为同时促进模型能力和安全性的工作未被计入安全研究,且该统计也未计算用于安全分类器的另一部分算力;公司同时指出安全研究通常不需要像前沿模型训练那样消耗大量算力,因此算力占比不能直接代表安全工作的整体投入程度。Anthropic 称这些指标目前仍属原型测量体系,跨实验室比较还面临统一方法和独立验证等问题,并计划引入来自多个组织的独立第三方评估人员,让其获得与内部风险评估团队相近的流程、系统和数据访问权限。
AI 汇总报道生成 · 59分钟前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- Anthropic 发布前沿 AI 研发进度测量体系,Claude 已主导 26% 内部 AI 研发工作
Anthropic 发布一套衡量前沿 AI 实验室研发进度的方法,涵盖 AI 参与 AI 研发程度、智能体监督和算力分配三项指标。
- Anthropic 公布内部指标:Claude 主导 26% 的 AI 研发工作,90% 以上工作已有 AI 深度参与
Anthropic 发布三项衡量 AI 发展速度的指标,并给出内部快照。截至 2026 年 8 月,26% 的 AI 研发工作达到 Claude 可从高层指令端到端完成大部分任务、人类主要负责监督的程度;90% 以上被衡量的研发工作已有 AI 完成大量环节。
- Anthropic 数据显示 Claude 主导的模型研发任务占比半年内从 1% 升至 26%
Anthropic 发布三项衡量 AI 发展节奏的指标:AI 承担的 AI 研发量、AI 智能体的受监督程度、算力分配,并给出内部数据快照。作者援引称,约六个月内 Claude 主导的 Anthropic 模型研发任务占比从 1% 升至 26%,Claude 协作或主导超过 90% 的模型研发工作,其内部智能体平台任意时刻约有 30,000 个智能体在从事研究与工程工作。
- Anthropic 发布前沿 AI 开发节奏测量工具与内部指标快照
Anthropic 发布一套测量前沿 AI 开发节奏的指标,覆盖 AI 主导研发、智能体监督和算力分配三方面。
- Anthropic 发布三项测量指标,公开 AI 驱动 AI 研发的进度数据
Anthropic 发布测量框架,公开三项内部指标以帮助外界了解前沿实验室的 AI 开发节奏。截至 2026 年 8 月,Claude 在 26% 的 Anthropic AI 研发工作中处于主导角色,90% 以上的工作至少达到协作级;内部平台约有 3 万个 Agent,10 亿多次决策中 0.002% 被在线监控拦截;7 月一周内约 6% 的 AI 研发算力用于安全工作。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。