热点事件 历史事件

Anthropic 发布前沿 AI 开发节奏测量工具与内部指标快照

8 篇报道7 个报道来源

事件全貌

AI 综述

Anthropic 公布了一套用于衡量前沿 AI 实验室研发进度的指标,涵盖三项内容:AI 参与 AI 研发的程度、AI 智能体的监督情况,以及算力在 AI 研发与安全研究之间的分配。公司同时公布了来自 Anthropic 内部的阶段性快照,并表示任何前沿开发者都可以发布同样的指标、第三方可以核验。

在 AI 参与研发方面,Anthropic 提出「Anthropic 研发自动化指数」,采用 Epoch AI 的自动化等级体系(AL0 无 AI 参与到 AL5 完全自主)。公司称,截至 2026 年 8 月,Claude 未在任何被测量的 AI 研发工作中实现完全自主运行,但「主导」了约 26% 的 AI 研发工作,处于「AI 协作」及更高等级的工作占比超过 90%。Anthropic 称该指数由梳理公司内部各类 AI 研发工作、为每项任务评级后汇总而成;IT之家报道称其从 2026 年 7 月内部工作记录、Slack 及其他文档中抽样整理出约 1.5 万个模型研发任务,归纳为 542 个任务节点。Ars Technica 报道称该数据由《华尔街日报》首先报道,26% 较 3 月的 1% 上升。

在智能体监督方面,Anthropic 称截至 2026 年 8 月,其最常用内部平台任一时刻约有 3 万个从事研究与工程工作的智能体,这些智能体的行动 100% 在执行前经过在线监控、执行后进入离线监控。公司称对 2026 年 8 月超过 10 亿次智能体决策的分析显示,约 0.002%(约每 4.7 万次中 1 次)被拦截;每周约标记 10 万份对话记录供进一步检查,其中优先级最高的约 50 份升级至人工审核。

在算力分配方面,Anthropic 统计了 2026 年 7 月 13 日至 7 月 20 日一周的算力使用:约 6% 的 AI 研发算力投向安全,约 12% 的 AI 驱动 AI 研发算力投向安全。公司强调这是刻意保守的估计——同时促进能力与安全的工作未被计入,且未计入用于安全分类器的另一部分算力;公司同时指出安全研究通常不需要像前沿模型训练那样消耗大量算力,因此算力占比不能直接代表安全工作的整体投入程度。Anthropic 称这些指标目前仍属原型测量体系,跨实验室比较面临统一方法和独立验证等问题,计划引入多个组织的独立第三方评估人员。

AI 汇总报道生成 · 4天前更新。单篇报道保留其发布时的原貌。

最新进展

历史报道归档。当前热点以新版榜单为准。

报道时间线

沿着报道,了解事件的不同侧面。

显示 8全部报道最新在前
  1. X:洪明 (@hongming731)
    Anthropic 披露内部 AI 研发自动化指标:Claude 主导 26% 被测研发工作

    Anthropic 首次披露内部研发自动化指标:2026 年 8 月 Claude 主导 26% 被测研发工作,AI 协作及以上超 90%,最常用内部平台任一时刻约有 3 万个研发和工程 Agent,约 6% 的 AI 研发算力投向安全。菜鸟内部 AI Coding 贡献率从约 10% 升至 90% 以上,但需求变更周期仅相差约 10%。

  2. X:洪明 (@hongming731)
    BestBlogs 早报:Anthropic 研发指标与 397B Agent RL 配方

    BestBlogs 09-19 早报收录 10 篇内容,重点包括 LoRA 一作与 OpenAI o1 核心成员联合发布首份 397B 知识工作 Agent RL 训练配方,Pass@1 相对提升 70%。

  3. Ars Technica:AI
    研究人员用 Claude 入侵 OpenAI 员工账号,Anthropic 同步披露 AI 研发占比数据

    研究人员利用 OpenAI 社区论坛(由第三方 Discourse 托管)的配置缺陷,获取内部登录入口,最终进入一名 OpenAI 员工的 ChatGPT 账号,该账号可通过 GitHub 访问内部代码。

  4. IT之家
    Anthropic 发布前沿 AI 研发进度测量体系,Claude 已主导 26% 内部 AI 研发工作

    Anthropic 发布一套衡量前沿 AI 实验室研发进度的方法,涵盖 AI 参与 AI 研发程度、智能体监督和算力分配三项指标。

  5. X:Rohan Paul (@rohanpaul_ai)
    Anthropic 公布内部指标:Claude 主导 26% 的 AI 研发工作,90% 以上工作已有 AI 深度参与

    Anthropic 发布三项衡量 AI 发展速度的指标,并给出内部快照。截至 2026 年 8 月,26% 的 AI 研发工作达到 Claude 可从高层指令端到端完成大部分任务、人类主要负责监督的程度;90% 以上被衡量的研发工作已有 AI 完成大量环节。

  6. X:Anthropic (@AnthropicAI)官方一手
    Anthropic 发布三项指标测量 AI 开发速度

    Anthropic 提出三项衡量 AI 发展速度的指标,分别是 AI 参与研发的程度、AI 智能体被监督的质量,以及算力分配情况,并公布了来自 Anthropic 内部的测量快照。

  7. Anthropic:The Institute(旗舰研究长文 · 网页)官方一手精选
    Anthropic 发布前沿 AI 开发节奏测量工具与内部指标快照

    Anthropic 发布一套测量前沿 AI 开发节奏的指标,覆盖 AI 主导研发、智能体监督和算力分配三方面。

  8. Anthropic:Newsroom官方一手精选
    Anthropic 发布三项测量指标,公开 AI 驱动 AI 研发的进度数据

    Anthropic 发布测量框架,公开三项内部指标以帮助外界了解前沿实验室的 AI 开发节奏。截至 2026 年 8 月,Claude 在 26% 的 Anthropic AI 研发工作中处于主导角色,90% 以上的工作至少达到协作级;内部平台约有 3 万个 Agent,10 亿多次决策中 0.002% 被在线监控拦截;7 月一周内约 6% 的 AI 研发算力用于安全工作。

24 HOURS

本事件热度走势

当前热度 5峰值 109月18日 04:57近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。