Anthropic公布可监督和干预AI智能体行为的系统:截至2026年8月约3万个研究工程智能体,行为100%经在线与离线监控,超十亿次决策中0.002%被阻止,每周约50个最高优先级标记升级人工审查
事件全貌
AI 综述Anthropic公布了一套用于监督和干预其系统上AI智能体行为的系统,并给出三项衡量指标:覆盖率(智能体动作在执行前后经过监控的比例)、审查延迟(动作与审查之间的时间,先由自动监控、后由人工审查)以及升级率(被阻止或改道等处理的智能体活动占比)。
据其披露,截至2026年8月,在其最常用的内部平台上,任意时刻约有3万个智能体从事研究与工程工作;这些测量仅覆盖该平台。这些智能体的动作受在线与离线两类监控约束:在线监控实时检查动作,阻止危险行为或自动纠正不当行为,针对的是可能迅速发生且无法撤销的危害,例如智能体将模型权重复制出系统;离线监控事后读取智能体活动,针对发展缓慢且可逆的危险行为,如模型失准迹象,并用标记的活动改进分类器和确定性控制等缓解措施。若出现大规模迫近危险,将关闭该智能体部署中的危险部分。
覆盖率方面,这些智能体100%的动作在执行前经过在线监控,通常在数秒内;100%的动作在执行后被监控摄取。审查延迟方面,自动审查在智能体行动前进行,被阻止动作由人工在一周内审查。监控每周标记约10万条记录,随后由多个分类器进行误报审查和初步监督审查,多数标记在此流程中解决,最高优先级的标记(每周约50条)升级至人工审查。阻止/升级率方面,其分析了2026年8月研究与工程智能体超过十亿次决策,发现0.002%(约每4.7万次中1次)被该监控阻止;监控每千条记录中约标记1至2条以供进一步审查。
另有X平台用户Kim(@kimmonismus)称,Claude参与或主导Anthropic超过90%的模型研发工作,其主内部智能体平台上任意时刻约有3万个AI智能体从事研究与工程工作。
AI 汇总报道生成 · 2小时前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- Anthropic 数据显示 Claude 主导的模型研发任务占比半年内从 1% 升至 26%
Anthropic 发布三项衡量 AI 发展节奏的指标:AI 承担的 AI 研发量、AI 智能体的受监督程度、算力分配,并给出内部数据快照。作者援引称,约六个月内 Claude 主导的 Anthropic 模型研发任务占比从 1% 升至 26%,Claude 协作或主导超过 90% 的模型研发工作,其内部智能体平台任意时刻约有 30,000 个智能体在从事研究与工程工作。
- Anthropic 发布三项测量指标,公开 AI 驱动 AI 研发的进度数据
Anthropic 发布测量框架,公开三项内部指标以帮助外界了解前沿实验室的 AI 开发节奏。截至 2026 年 8 月,Claude 在 26% 的 Anthropic AI 研发工作中处于主导角色,90% 以上的工作至少达到协作级;内部平台约有 3 万个 Agent,10 亿多次决策中 0.002% 被在线监控拦截;7 月一周内约 6% 的 AI 研发算力用于安全工作。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。