# Epoch AI 评测 SWE-bench Verified：审计发现超两成题目存在评分问题

- 来源：Epoch AI：研究、数据与评测
- 发布时间：2026-09-03 08:00
- AIHOT 分数：68
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmu61xlxt049profjns27zc01
- 原文链接：https://epoch.ai/benchmarks/swe-bench-verified/review

## 精选理由

Epoch 汇总了 OpenAI 与 RDI 的公开审计结论，说明 SWE-bench Verified 的测试缺陷和污染问题，读者可据此调整对该基准的解读。

## AI 摘要

Epoch AI 发布对 SWE-bench Verified 的基准评审，认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型；OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%，59.4% 的被审任务测试用例会拒绝功能正确的提交，且所有受测前沿模型在训练中都见过部分题目。

## 正文

该来源未收录可展示正文，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
