返回
精选AI 评分 60/100

METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

METR:Research(网页)·2025-08-13 00:00·396天前·METR
AI 导读

METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。

METR:Research(网页)
精选
60AI 编辑部评分,满分 100

METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

2025-08-13 00:00· 396天前· METR
AI 导读

METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。

推荐理由

METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:METR:Research(网页)· metr.org