跳到正文

AA-Omniscience(Artificial Analysis)

Artificial Analysis / 知识与语言 · 事实问答,答错倒扣、拒答不扣,看模型知道什么、会不会乱编。

官方评测
在 AIHOT 中参与排名
所属领域知识与语言
上游数据时间待核实
最近成功同步10/04 20:23

它测什么,怎么测

取 Artificial Analysis 智能指数中 Omniscience 的分数(−100 到 100)。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:知识与语言领域,与 SimpleQA Verified 同属事实准确一类,两项合起来算一票。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-opus-5-5Anthropic46.4Max 推理 · 含来源回退
3claude-fable-5-1Anthropic43.5Max 推理 · 含来源回退
5gpt-6-astraOpenAI43.4Max 推理
6claude-fable-5Anthropic43.3Max 推理 · 含来源回退
9gemini-4-argonGoogle42.4High 推理
11gpt-6-1-solOpenAI41.5Max 推理
22claude-opus-5Anthropic37.1Max 推理
26claude-sonnet-5-5Anthropic32.3Max 推理 · 含来源回退
27grok-4-7xAI32xHigh 推理
28gemini-3-1-pro-previewGoogle31.9来源默认配置
33gemini-3-8-flashGoogle29.6High 推理
34grok-4-6-xhighxAI29.3xHigh 推理
35claude-opus-4-8Anthropic28.8Max 推理
38muse-spark-1-1Meta28.1xHigh 推理
40muse-spark-1-2Meta27.2xHigh 推理
41gpt-6-solOpenAI27.1Max 推理
46gemini-3-7-flashGoogle26.5High 推理
48grok-4-5xAI25.3High 推理
49muse-spark-1-3Meta25Max 推理
52gemini-3-6-flashGoogle22.1High 推理
53gpt-5-6-solOpenAI22Max 推理
54gemini-3-5-flashGoogle21.2High 推理
57jt-4-1-flash-236b-a21bChina Mobile20.6来源默认配置
58gpt-5-5OpenAI20.5xHigh 推理
61kimi-k3Moonshot AI19.7Max 推理
67grok-4-3xAI18High 推理
68claude-sonnet-5Anthropic16.5Max 推理
69step-5StepFun16.4来源默认配置
70glm-5-3Z.ai14.3Max 推理
71qwen3-7-maxAlibaba13.5来源默认配置
评测局限与数据署名

分数同时反映知识量和是否乱编,不单纯是知识量。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。