返回
精选AI 评分 68/100

Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题

Epoch AI:研究、数据与评测·2026-09-03 08:00·15天前
AI 导读

Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。

Epoch AI:研究、数据与评测
精选
68AI 编辑部评分,满分 100

Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题

2026-09-03 08:00· 15天前
AI 导读

Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。

推荐理由

Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。

该来源未收录可展示正文,站内仅提供摘要。

阅读原文(在新标签页打开)

来源:Epoch AI:研究、数据与评测· epoch.ai