← 评测来源
Artificial Analysis
官方评测 ↗Artificial Analysis Intelligence Index
把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。
在 AIHOT 中参与排名
证据预算30%
上游数据时间待核实
最近成功同步09/10 06:31
它测什么,怎么测
只取官方 Artificial Analysis Intelligence Index;接口中的性能与价格字段不计分。
如何使用这份证据
综合任务证据占 30%;已核对 v4.3 的 10 项底层评测,与现役专项没有重复计票。整项保留,不将聚合分冒充单项成绩。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 3 | gpt-6-astraOpenAI | 52.8 | Max 推理 |
| 7 | claude-opus-5Anthropic | 50.7 | Max 推理 · 自适应 |
| 12 | muse-spark-1-3Meta | 48.2 | Max 推理 |
| 14 | gpt-5-6-solOpenAI | 47.1 | Max 推理 |
| 20 | glm-5-3Z.ai | 44.9 | Max 推理 |
| 22 | grok-4-6-xhighxAI | 44.3 | xHigh 推理 |
| 24 | kimi-k3Moonshot AI | 43.8 | Max 推理 |
| 27 | gpt-5-6-terraOpenAI | 42.3 | Max 推理 |
| 28 | qwen3-8-flash-nextAlibaba | 42.2 | 来源默认配置 |
| 29 | claude-opus-4-8Anthropic | 42 | Max 推理 · 自适应 |
| 30 | glm-5-3-flashZ.ai | 41.9 | 来源默认配置 |
| 31 | gemini-3-8-flashGoogle | 41.2 | High 推理 |
| 32 | claude-opus-4-7Anthropic | 40.7 | Max 推理 · 自适应 |
| 33 | qwen3-8-maxAlibaba | 40.3 | 来源默认配置 |
| 34 | qwen3-8-2-4t-a95bAlibaba | 40 | 来源默认配置 |
| 36 | muse-spark-1-2Meta | 39.8 | xHigh 推理 |
| 40 | gemini-3-7-flashGoogle | 39.4 | High 推理 |
| 41 | grok-4-5xAI | 39.1 | High 推理 |
| 42 | gpt-5-4OpenAI | 39 | xHigh 推理 |
| 43 | glm-5-2Z.ai | 38.6 | Max 推理 |
| 43 | gpt-5-5OpenAI | 38.6 | xHigh 推理 |
| 45 | claude-sonnet-5Anthropic | 38.4 | Max 推理 · 自适应 |
| 47 | gpt-5-6-lunaOpenAI | 37.5 | Max 推理 |
| 50 | deepseek-v4-proDeepSeek | 36.3 | Max 推理 |
| 52 | agnes-2-5-pro-betaSapiens AI | 35.2 | 来源默认配置 |
| 53 | deepseek-v4-flash-visionDeepSeek | 35 | Max 推理 |
| 55 | deepseek-v4-flashDeepSeek | 34.5 | Max 推理 |
| 58 | gemini-3-6-flashGoogle | 34.3 | High 推理 |
| 58 | muse-spark-1-1Meta | 34.3 | xHigh 推理 |
| 61 | qwen3-8-27bAlibaba | 33.9 | xHigh 推理 |
评测局限与数据署名
缺少 API key 时整张来源退出本轮,不补 50 分;严禁用网页抓取替代,展示时必须署名并保留指数版本。
数据许可:API 数据展示或分享须显著署名;再分发权与定制条款须另行取得并遵守 Terms of Use
成绩由 Artificial Analysis 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。