← 评测来源
CAIS / Scale AI / 知识

Humanity’s Last Exam

横跨学科的高难度学术知识与推理。

官方评测 ↗
在 AIHOT 中观察与参考
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集

它测什么,怎么测

固定题集、工具条件和裁判;HLE、HLE-Rolling 与带工具结果分别比较。AA v4.3 已包含 HLE,将来若有可用专项成绩,只用于分类,不在综合榜重复计票。

如何使用这份证据

观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。

尚未纳入可比成绩

观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。

查看上游官方页面 ↗
评测局限与数据署名

观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。

数据许可:评测代码 MIT;官方榜单成绩再展示边界尚待确认。

成绩由 CAIS / Scale AI 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。