AA-Omniscience(Artificial Analysis)
Artificial Analysis / 知识与语言 · 事实问答,答错倒扣、拒答不扣,看模型知道什么、会不会乱编。
在 AIHOT 中参与排名
所属领域知识与语言
上游数据时间待核实
最近成功同步10/04 20:23
它测什么,怎么测
取 Artificial Analysis 智能指数中 Omniscience 的分数(−100 到 100)。同一型号按最高推理档位选代表配置,选择不看分数。
如何使用这份证据
计分:知识与语言领域,与 SimpleQA Verified 同属事实准确一类,两项合起来算一票。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5-5Anthropic | 46.4 | Max 推理 · 含来源回退 |
| 3 | claude-fable-5-1Anthropic | 43.5 | Max 推理 · 含来源回退 |
| 5 | gpt-6-astraOpenAI | 43.4 | Max 推理 |
| 6 | claude-fable-5Anthropic | 43.3 | Max 推理 · 含来源回退 |
| 9 | gemini-4-argonGoogle | 42.4 | High 推理 |
| 11 | gpt-6-1-solOpenAI | 41.5 | Max 推理 |
| 22 | claude-opus-5Anthropic | 37.1 | Max 推理 |
| 26 | claude-sonnet-5-5Anthropic | 32.3 | Max 推理 · 含来源回退 |
| 27 | grok-4-7xAI | 32 | xHigh 推理 |
| 28 | gemini-3-1-pro-previewGoogle | 31.9 | 来源默认配置 |
| 33 | gemini-3-8-flashGoogle | 29.6 | High 推理 |
| 34 | grok-4-6-xhighxAI | 29.3 | xHigh 推理 |
| 35 | claude-opus-4-8Anthropic | 28.8 | Max 推理 |
| 38 | muse-spark-1-1Meta | 28.1 | xHigh 推理 |
| 40 | muse-spark-1-2Meta | 27.2 | xHigh 推理 |
| 41 | gpt-6-solOpenAI | 27.1 | Max 推理 |
| 46 | gemini-3-7-flashGoogle | 26.5 | High 推理 |
| 48 | grok-4-5xAI | 25.3 | High 推理 |
| 49 | muse-spark-1-3Meta | 25 | Max 推理 |
| 52 | gemini-3-6-flashGoogle | 22.1 | High 推理 |
| 53 | gpt-5-6-solOpenAI | 22 | Max 推理 |
| 54 | gemini-3-5-flashGoogle | 21.2 | High 推理 |
| 57 | jt-4-1-flash-236b-a21bChina Mobile | 20.6 | 来源默认配置 |
| 58 | gpt-5-5OpenAI | 20.5 | xHigh 推理 |
| 61 | kimi-k3Moonshot AI | 19.7 | Max 推理 |
| 67 | grok-4-3xAI | 18 | High 推理 |
| 68 | claude-sonnet-5Anthropic | 16.5 | Max 推理 |
| 69 | step-5StepFun | 16.4 | 来源默认配置 |
| 70 | glm-5-3Z.ai | 14.3 | Max 推理 |
| 71 | qwen3-7-maxAlibaba | 13.5 | 来源默认配置 |
评测局限与数据署名
分数同时反映知识量和是否乱编,不单纯是知识量。
数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use
成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。