返回
精选AI 评分 61/100

METR 研究:约半数通过 SWE-bench Verified 的 AI PR 不会被维护者合并

METR:Notes(网页)·2026-03-10 00:00·187天前
AI 导读

METR 让 scikit-learn、Sphinx、pytest 的 4 位维护者盲审 296 个 AI 生成的 PR,发现约一半通过 SWE-bench Verified 自动评分的补丁不会被合并进主分支;经金标准基线归一后,维护者合并率平均比自动评分低 24.2 个百分点。研究强调 AI 补丁未像人类开发者那样获得迭代反馈,不应据此断言是能力上限,但直接按基准分数推断智能体实际用处可能高估。

METR:Notes(网页)
精选
61AI 编辑部评分,满分 100

METR 研究:约半数通过 SWE-bench Verified 的 AI PR 不会被维护者合并

2026-03-10 00:00· 187天前
AI 导读

METR 让 scikit-learn、Sphinx、pytest 的 4 位维护者盲审 296 个 AI 生成的 PR,发现约一半通过 SWE-bench Verified 自动评分的补丁不会被合并进主分支;经金标准基线归一后,维护者合并率平均比自动评分低 24.2 个百分点。研究强调 AI 补丁未像人类开发者那样获得迭代反馈,不应据此断言是能力上限,但直接按基准分数推断智能体实际用处可能高估。

推荐理由

研究用真实仓库维护者盲审 AI 补丁,量化了 SWE-bench 分数与实际可合并之间的差距,为解读编码基准提供了参照。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:METR:Notes(网页)· metr.org