跳到正文

Humanity’s Last Exam(Artificial Analysis 复跑)

Artificial Analysis / 推理 · 横跨学科的专家级难题,不用工具作答。

官方评测
在 AIHOT 中参与排名
所属领域推理
上游数据时间待核实
最近成功同步10/04 20:23

它测什么,怎么测

取 Artificial Analysis 智能指数中 Humanity’s Last Exam 的正确率(不用工具)。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:推理领域的专家难题一类。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-opus-5-5Anthropic61.4%Max 推理 · 含来源回退
2claude-fable-5-1Anthropic59.1%Max 推理 · 含来源回退
5gemini-4-argonGoogle57.1%High 推理
8claude-fable-5Anthropic55.5%Max 推理 · 含来源回退
9claude-sonnet-5-5Anthropic55.0%Max 推理 · 含来源回退
10claude-opus-5Anthropic54.9%Max 推理
12gpt-6-astraOpenAI54.7%Max 推理
17gpt-6-1-solOpenAI52.9%Max 推理
25gpt-5-6-solOpenAI49.5%Max 推理
26mimo-v2-6-proXiaomi49.4%来源默认配置
29muse-spark-1-3Meta48.7%Max 推理
30claude-opus-4-8Anthropic48.7%Max 推理
32gpt-6-solOpenAI47.9%Max 推理
33gemini-3-7-flashGoogle47.9%High 推理
34gemini-3-8-flashGoogle47.8%High 推理
38gemini-3-1-pro-previewGoogle47.0%来源默认配置
39kimi-k3Moonshot AI46.9%Max 推理
40step-5StepFun46.5%来源默认配置
42muse-spark-1-1Meta46.2%xHigh 推理
45gpt-5-5OpenAI45.8%xHigh 推理
46muse-spark-1-2Meta45.5%xHigh 推理
49grok-4-6-xhighxAI44.1%xHigh 推理
50jt-4-1-flash-236b-a21bChina Mobile43.6%来源默认配置
52grok-4-7xAI43.1%xHigh 推理
53qwen3-8-maxAlibaba43.1%来源默认配置
54qwen3-8-max-0803Alibaba43.0%来源默认配置
55gpt-5-6-terraOpenAI42.9%Max 推理
57gemini-3-5-flashGoogle42.7%High 推理
57grok-4-5xAI42.7%High 推理
59qwen3-8-2-4t-a95bAlibaba42.4%来源默认配置
评测局限与数据署名

部分题目答案存在争议;正确率普遍偏低,接近 0 的成绩只说明“至多这么强”。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。