热点事件 历史事件
OpenAI于2026-02-23发布SWE-bench Verified审计结果:抽检27.6%任务中59.4%存在拒绝正确提交的缺陷测试用例
先了解这件事
报道摘要Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。
报道时间线
沿着报道,了解事件的不同侧面。
显示 2 篇全部报道,最新在前
- Epoch AI 公布 Benchmark Reviews 收录基准列表及审查判定结果
Epoch AI 发布 Benchmark Reviews 文档,列出已审查基准及判定结果,其中 SWE-bench Verified、Terminal-Bench 4.0.0。
- Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题
Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。