热点事件 历史事件
作者抽样审计 Humanity's Last Exam 基准:48题中22题(46%)存在影响准确性的错误,判定为有缺陷(Flawed)
先了解这件事
报道摘要Epoch AI 对公开征集题目的知识型基准 Humanity's Last Exam 进行审计,按 8 个类别随机抽样 48 题,发现 22 题(46%)存在会实质改变准确率的错误,将该基准判定为 Flawed。其中 12 题按题面本就无法正确作答,10 题可能产生误判正确答案为错或错误答案为对的情况;其余 26 题答案正确,审计方法与错误明细已在原文公开。
报道时间线
沿着报道,了解事件的不同侧面。
显示 1 篇全部报道,最新在前
- Epoch AI 审计 Humanity's Last Exam:抽样 48 题中 46% 存在影响准确率的错误,判定为 Flawed
Epoch AI 对公开征集题目的知识型基准 Humanity's Last Exam 进行审计,按 8 个类别随机抽样 48 题,发现 22 题(46%)存在会实质改变准确率的错误,将该基准判定为 Flawed。其中 12 题按题面本就无法正确作答,10 题可能产生误判正确答案为错或错误答案为对的情况;其余 26 题答案正确,审计方法与错误明细已在原文公开。