AgentLens:揭示软件工程智能体评估中的"幸运通过"问题

HuggingFace Daily Papers(社区热门论文)·2026-05-13 08:00·132天前
AI 导读

当前软件工程智能体评估仅依赖最终补丁是否通过测试的二元信号,掩盖了解决方案质量的差异。研究分析了2,614条轨迹,发现在可评估的1,815条通过轨迹中,10.7%属于“幸运通过”,表现为回归循环、盲目重试等问题。为此,研究团队提出了用于过程级评估的AgentLens框架,并发布了标注质量分数、冗余信号等信息的AgentLens-Bench数据集。基于质量分数,通过轨迹被划分为幸运、扎实和理想三个等级,不同模型的幸运通过率介于0.5%至23.2%之间。若按质量分数而非通过率排名,部分模型的排名变化显著。相关资源已开源。

HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

AgentLens:揭示软件工程智能体评估中的"幸运通过"问题

2026-05-13 08:00· 132天前
AI 导读

当前软件工程智能体评估仅依赖最终补丁是否通过测试的二元信号,掩盖了解决方案质量的差异。研究分析了2,614条轨迹,发现在可评估的1,815条通过轨迹中,10.7%属于“幸运通过”,表现为回归循环、盲目重试等问题。为此,研究团队提出了用于过程级评估的AgentLens框架,并发布了标注质量分数、冗余信号等信息的AgentLens-Bench数据集。基于质量分数,通过轨迹被划分为幸运、扎实和理想三个等级,不同模型的幸运通过率介于0.5%至23.2%之间。若按质量分数而非通过率排名,部分模型的排名变化显著。相关资源已开源。

推荐理由

SWE-agent评估只看通过率太粗暴了,这篇论文把乱试的“幸运通过”和真方案拆开看,10%的通过其实是蒙的,做agent评估的必读。

正文 · AI 翻译

软件工程(SWE)智能体的评估目前主要依赖一个二元信号:最终补丁是否通过测试。这种仅关注结果的视角,将基于原则的解决方案与混乱的试错过程视为等同。我们证明这种等同性在实证层面并不成立。我们在 60 个 SWE-bench Verified 任务上,评估了来自八个模型后端的 2,614 条 OpenHands 轨迹。

其中,47 个任务拥有足够多的通过轨迹,可以构建任务级过程参考,由此得到一个包含 1,815 条轨迹的评估子集。在该子集的通过轨迹中,有 10.7% 表现出我们称之为"幸运通过"的行为:回归重试、盲目重试、缺少验证,或探索、实现与验证在时间顺序上混乱。

我们引入了 AgentLens,一个用于对 SWE 智能体轨迹进行过程级评估的框架,并定义了 AgentLens-Bench,这是一个包含 1,815 条轨迹的数据集,每条轨迹都标注了质量分数、浪费信号、分歧点以及 47 个任务级前缀树接收器(PTA)参考。

AgentLens 通过合并同一任务的多个通过解决方案来构建 PTA 参考,并使用上下文敏感的意图标注器,基于轨迹历史(而非仅凭工具身份)将动作归类为探索、实现、验证或编排。在 AgentLens-Bench 上,质量分数将通过的轨迹划分为幸运、扎实和理想三个等级,并进一步将"幸运通过"分解为五种常见机制。

在八个模型后端中,幸运率从 0.5% 到 23.2% 不等,当按质量分数而非通过率排序时,某些模型的排名变动多达五位。我们计划很快发布项目仓库,包括 AgentLens-Bench 工件、AgentLens SDK 以及分析工具。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org