Humanity’s Last Exam(Artificial Analysis 复跑)
Artificial Analysis / 推理 · 横跨学科的专家级难题,不用工具作答。
在 AIHOT 中参与排名
所属领域推理
上游数据时间待核实
最近成功同步10/04 20:23
它测什么,怎么测
取 Artificial Analysis 智能指数中 Humanity’s Last Exam 的正确率(不用工具)。同一型号按最高推理档位选代表配置,选择不看分数。
如何使用这份证据
计分:推理领域的专家难题一类。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5-5Anthropic | 61.4% | Max 推理 · 含来源回退 |
| 2 | claude-fable-5-1Anthropic | 59.1% | Max 推理 · 含来源回退 |
| 5 | gemini-4-argonGoogle | 57.1% | High 推理 |
| 8 | claude-fable-5Anthropic | 55.5% | Max 推理 · 含来源回退 |
| 9 | claude-sonnet-5-5Anthropic | 55.0% | Max 推理 · 含来源回退 |
| 10 | claude-opus-5Anthropic | 54.9% | Max 推理 |
| 12 | gpt-6-astraOpenAI | 54.7% | Max 推理 |
| 17 | gpt-6-1-solOpenAI | 52.9% | Max 推理 |
| 25 | gpt-5-6-solOpenAI | 49.5% | Max 推理 |
| 26 | mimo-v2-6-proXiaomi | 49.4% | 来源默认配置 |
| 29 | muse-spark-1-3Meta | 48.7% | Max 推理 |
| 30 | claude-opus-4-8Anthropic | 48.7% | Max 推理 |
| 32 | gpt-6-solOpenAI | 47.9% | Max 推理 |
| 33 | gemini-3-7-flashGoogle | 47.9% | High 推理 |
| 34 | gemini-3-8-flashGoogle | 47.8% | High 推理 |
| 38 | gemini-3-1-pro-previewGoogle | 47.0% | 来源默认配置 |
| 39 | kimi-k3Moonshot AI | 46.9% | Max 推理 |
| 40 | step-5StepFun | 46.5% | 来源默认配置 |
| 42 | muse-spark-1-1Meta | 46.2% | xHigh 推理 |
| 45 | gpt-5-5OpenAI | 45.8% | xHigh 推理 |
| 46 | muse-spark-1-2Meta | 45.5% | xHigh 推理 |
| 49 | grok-4-6-xhighxAI | 44.1% | xHigh 推理 |
| 50 | jt-4-1-flash-236b-a21bChina Mobile | 43.6% | 来源默认配置 |
| 52 | grok-4-7xAI | 43.1% | xHigh 推理 |
| 53 | qwen3-8-maxAlibaba | 43.1% | 来源默认配置 |
| 54 | qwen3-8-max-0803Alibaba | 43.0% | 来源默认配置 |
| 55 | gpt-5-6-terraOpenAI | 42.9% | Max 推理 |
| 57 | gemini-3-5-flashGoogle | 42.7% | High 推理 |
| 57 | grok-4-5xAI | 42.7% | High 推理 |
| 59 | qwen3-8-2-4t-a95bAlibaba | 42.4% | 来源默认配置 |
评测局限与数据署名
部分题目答案存在争议;正确率普遍偏低,接近 0 的成绩只说明“至多这么强”。
数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use
成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。