热点事件 历史事件

作者抽样审计 Humanity's Last Exam 基准:48题中22题(46%)存在影响准确性的错误,判定为有缺陷(Flawed)

1 篇报道1 个精选信源

先了解这件事

报道摘要

Epoch AI 对公开征集题目的知识型基准 Humanity's Last Exam 进行审计,按 8 个类别随机抽样 48 题,发现 22 题(46%)存在会实质改变准确率的错误,将该基准判定为 Flawed。其中 12 题按题面本就无法正确作答,10 题可能产生误判正确答案为错或错误答案为对的情况;其余 26 题答案正确,审计方法与错误明细已在原文公开。

摘自 Epoch AI:研究、数据与评测

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Epoch AI:研究、数据与评测官方一手精选
    Epoch AI 审计 Humanity's Last Exam:抽样 48 题中 46% 存在影响准确率的错误,判定为 Flawed

    Epoch AI 对公开征集题目的知识型基准 Humanity's Last Exam 进行审计,按 8 个类别随机抽样 48 题,发现 22 题(46%)存在会实质改变准确率的错误,将该基准判定为 Flawed。其中 12 题按题面本就无法正确作答,10 题可能产生误判正确答案为错或错误答案为对的情况;其余 26 题答案正确,审计方法与错误明细已在原文公开。