← 评测来源
CAIS / Scale AI / 知识
官方评测 ↗Humanity’s Last Exam
横跨学科的高难度学术知识与推理。
在 AIHOT 中观察与参考
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集
它测什么,怎么测
固定题集、工具条件和裁判;HLE、HLE-Rolling 与带工具结果分别比较。AA v4.3 已包含 HLE,将来若有可用专项成绩,只用于分类,不在综合榜重复计票。
如何使用这份证据
观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。
尚未纳入可比成绩
观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。
查看上游官方页面 ↗评测局限与数据署名
观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。
数据许可:评测代码 MIT;官方榜单成绩再展示边界尚待确认。
成绩由 CAIS / Scale AI 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。