Anthropic 发布原型测量体系:Claude 已主导约 26% 内部 AI 研发工作,尚未实现完全自主运行
先了解这件事
事实说明Anthropic 于 9 月 18 日(IT之家消息)发布一套用于衡量前沿 AI 实验室研发进度的方法,涵盖 AI 参与 AI 研发程度、智能体监督和算力分配三项指标,并公布内部数据:截至 2026 年 8 月,Claude 未在任何被测量的 AI 研发工作中实现完全自主运行,但已主导约 26% 的内部 AI 研发工作,处于 AI 协作及以上等级的工作占比超过 90%。公司强调该体系仍属原型测量,跨实验室比较尚面临统一方法和独立验证等问题,并计划引入独立第三方评估人员。
Anthropic 发布原型测量体系:Claude 已主导约 26% 内部 AI 研发工作,尚未实现完全自主运行
报道时间线
沿着报道,了解事件的不同侧面。
- Anthropic 发布衡量前沿实验室 AI 研发进度的三组指标
Anthropic 发文提出研发自动化指数、Agent 监督指标与算力分配三组口径;其内部快照显示 Claude 主导 26% 被测研发工作,无任务完全自主,并披露该文为内部披露、非行业普查,提出第三方核验方向。
- Anthropic披露指标:Claude按工时口径主导约26%内部研发工作,但评分由Claude自评且"lead"含义有限
Anthropic发布三项衡量自身AI研发自动化程度的指标:其中按2026年7月员工工时统计,约26%的工作处于Epoch AI的AL4(AI主导)级别,较2月不足1%大幅上升;但评分由Claude自身完成,员工与模型判断一致性约59%,且AL4并不意味着完全自主(AL5),Claude无处达到AL5。指标背景是Amodei呼吁协调放缓前沿AI发展。
- Anthropic 发布原型测量体系:Claude 已主导约 26% 内部 AI 研发工作,尚未实现完全自主运行
Anthropic 于 9 月 18 日(IT之家消息)发布一套用于衡量前沿 AI 实验室研发进度的方法,涵盖 AI 参与 AI 研发程度、智能体监督和算力分配三项指标,并公布内部数据:截至 2026 年 8 月,Claude 未在任何被测量的 AI 研发工作中实现完全自主运行,但已主导约 26% 的内部 AI 研发工作,处于 AI 协作及以上等级的工作占比超过 90%。公司强调该体系仍属原型测量,跨实验室比较尚面临统一方法和独立验证等问题,并计划引入独立第三方评估人员。
- Anthropic发布内部测量快照:26%的AI研发工作可由Claude端到端完成大部分任务
Anthropic发布内部测量快照,称其26%的AI研发工作已达到Claude可根据高层指令端到端完成大部分任务、人类主要监督的程度。
- 评论者批评Anthropic未界定AI研发范围但认可透明度进步
评论者指出Claude“领导”了Anthropic 26%的AI研发工作,但未界定AI研发工作的范围;评论者对此不满意,但认为这是透明度方向上的一步。
- Anthropic 发布三项指标以衡量 AI 发展步伐,并提供内部数据快照
Anthropic 宣布分享三项跟踪 AI 发展的测量指标,并提供来自其内部的指标快照,称任何前沿开发者都可发布同样指标且第三方可验证,同时发布了完整文章与方法论。
本事件热度走势
暂无可比热度趋势,待连续观测积累后展示。