GDPval-AA(Artificial Analysis)
Artificial Analysis / 专业工作 · 按真实职业交付件出题,两两比较产出质量。
在 AIHOT 中参与排名
所属领域专业工作
上游数据时间待核实
最近成功同步10/04 20:23
它测什么,怎么测
取 Artificial Analysis 智能指数中 GDPval-AA 的 Elo 等级分。同一型号按最高推理档位选代表配置,选择不看分数。
如何使用这份证据
计分:专业工作领域,与 AA-Briefcase 同属职业交付一类,两项合起来算一票。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5-5Anthropic | 1,867.1 | Max 推理 · 含来源回退 |
| 2 | claude-sonnet-5-5Anthropic | 1,840.1 | Max 推理 · 含来源回退 |
| 4 | claude-fable-5-1Anthropic | 1,757.8 | Max 推理 · 含来源回退 |
| 7 | claude-opus-5Anthropic | 1,725.6 | Max 推理 |
| 8 | grok-4-7xAI | 1,715.5 | xHigh 推理 |
| 12 | mimo-v2-6-proXiaomi | 1,688.5 | 来源默认配置 |
| 13 | muse-spark-1-3Meta | 1,684.3 | Max 推理 |
| 14 | qwen3-8-maxAlibaba | 1,671.4 | 来源默认配置 |
| 15 | glm-5-3Z.ai | 1,652.9 | Max 推理 |
| 16 | glm-5-3-flashZ.ai | 1,646.8 | 来源默认配置 |
| 17 | grok-4-6-xhighxAI | 1,646.7 | xHigh 推理 |
| 19 | qwen3-8-flash-nextAlibaba | 1,633.1 | 来源默认配置 |
| 21 | gemini-4-argonGoogle | 1,627 | High 推理 |
| 22 | ling-3-1-flashInclusionAI | 1,621.8 | 来源默认配置 |
| 25 | claude-fable-5Anthropic | 1,612.7 | Max 推理 · 含来源回退 |
| 26 | qwen3-8-2-4t-a95bAlibaba | 1,612.5 | 来源默认配置 |
| 27 | gpt-5-6-solOpenAI | 1,611.3 | Max 推理 |
| 28 | mimo-v2-6-flashXiaomi | 1,610.5 | 来源默认配置 |
| 29 | qwen3-8-max-0803Alibaba | 1,607.7 | 来源默认配置 |
| 30 | deepseek-v4-1-flashDeepSeek | 1,600 | Max 推理 |
| 33 | step-5StepFun | 1,586.7 | 来源默认配置 |
| 35 | gpt-6-1-solOpenAI | 1,575.1 | Max 推理 |
| 39 | deepseek-v4-flash-visionDeepSeek | 1,548.1 | Max 推理 |
| 40 | gpt-6-astraOpenAI | 1,541.9 | Max 推理 |
| 41 | kimi-k3Moonshot AI | 1,537.7 | Max 推理 |
| 44 | gpt-6-solOpenAI | 1,509.1 | Max 推理 |
| 49 | muse-spark-1-2Meta | 1,477.5 | xHigh 推理 |
| 52 | claude-sonnet-5Anthropic | 1,465.8 | Max 推理 |
| 53 | gpt-5-6-lunaOpenAI | 1,463.9 | Max 推理 |
| 55 | claude-opus-4-8Anthropic | 1,455.5 | Max 推理 |
评测局限与数据署名
等级分来自模型裁判两两比较,不是正确率;它的刻度按同一批模型在其他领域的水平对齐,不能自定尺度。
数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use
成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。