该来源未收录可展示正文,站内仅提供摘要。
阅读原文(在新标签页打开)Epoch AI 审计 Humanity's Last Exam:抽样 48 题中 46% 存在影响准确率的错误,判定为 Flawed
AI 导读
Epoch AI 对公开征集题目的知识型基准 Humanity's Last Exam 进行审计,按 8 个类别随机抽样 48 题,发现 22 题(46%)存在会实质改变准确率的错误,将该基准判定为 Flawed。其中 12 题按题面本就无法正确作答,10 题可能产生误判正确答案为错或错误答案为对的情况;其余 26 题答案正确,审计方法与错误明细已在原文公开。
Epoch AI:研究、数据与评测
精选
61
AI 编辑部评分,满分 100Epoch AI 审计 Humanity's Last Exam:抽样 48 题中 46% 存在影响准确率的错误,判定为 Flawed
Epoch AI 对公开征集题目的知识型基准 Humanity's Last Exam 进行审计,按 8 个类别随机抽样 48 题,发现 22 题(46%)存在会实质改变准确率的错误,将该基准判定为 Flawed。其中 12 题按题面本就无法正确作答,10 题可能产生误判正确答案为错或错误答案为对的情况;其余 26 题答案正确,审计方法与错误明细已在原文公开。
推荐理由
Epoch AI 公开抽样审计 Humanity's Last Exam 的错误明细、方法与判定依据,读者可据此校准对该基准分数的解读。
来源:Epoch AI:研究、数据与评测· epoch.ai