热点事件 历史事件
Epoch AI 发布 SWE-Bench Pro 基准评审:基于多方审计(OpenAI 估计约30%任务损坏)及 Poolside 记录的 reward hacking,判断很可能逾20%题目含评分缺陷,评定其为 Flawed(部分评审)
先了解这件事
报道摘要Epoch AI 对 SWE-Bench Pro 的基准评审判定其为 Flawed,认为很可能超过 20% 的任务存在评分缺陷。
报道时间线
沿着报道,了解事件的不同侧面。
显示 1 篇全部报道,最新在前
- Epoch AI 评审 SWE-Bench Pro:超 20% 任务存在评分缺陷,判定为 Flawed
Epoch AI 对 SWE-Bench Pro 的基准评审判定其为 Flawed,认为很可能超过 20% 的任务存在评分缺陷。