按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)METR 研究更新:算法评分高估 AI 智能体真实软件工程能力
AI 导读
METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。
METR:Research(网页)
精选
60
AI 编辑部评分,满分 100METR 研究更新:算法评分高估 AI 智能体真实软件工程能力
METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。
推荐理由
METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。
来源:METR:Research(网页)· metr.org