跳到正文

GDPval-AA(Artificial Analysis)

Artificial Analysis / 专业工作 · 按真实职业交付件出题,两两比较产出质量。

官方评测
在 AIHOT 中参与排名
所属领域专业工作
上游数据时间待核实
最近成功同步10/04 20:23

它测什么,怎么测

取 Artificial Analysis 智能指数中 GDPval-AA 的 Elo 等级分。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:专业工作领域,与 AA-Briefcase 同属职业交付一类,两项合起来算一票。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-opus-5-5Anthropic1,867.1Max 推理 · 含来源回退
2claude-sonnet-5-5Anthropic1,840.1Max 推理 · 含来源回退
4claude-fable-5-1Anthropic1,757.8Max 推理 · 含来源回退
7claude-opus-5Anthropic1,725.6Max 推理
8grok-4-7xAI1,715.5xHigh 推理
12mimo-v2-6-proXiaomi1,688.5来源默认配置
13muse-spark-1-3Meta1,684.3Max 推理
14qwen3-8-maxAlibaba1,671.4来源默认配置
15glm-5-3Z.ai1,652.9Max 推理
16glm-5-3-flashZ.ai1,646.8来源默认配置
17grok-4-6-xhighxAI1,646.7xHigh 推理
19qwen3-8-flash-nextAlibaba1,633.1来源默认配置
21gemini-4-argonGoogle1,627High 推理
22ling-3-1-flashInclusionAI1,621.8来源默认配置
25claude-fable-5Anthropic1,612.7Max 推理 · 含来源回退
26qwen3-8-2-4t-a95bAlibaba1,612.5来源默认配置
27gpt-5-6-solOpenAI1,611.3Max 推理
28mimo-v2-6-flashXiaomi1,610.5来源默认配置
29qwen3-8-max-0803Alibaba1,607.7来源默认配置
30deepseek-v4-1-flashDeepSeek1,600Max 推理
33step-5StepFun1,586.7来源默认配置
35gpt-6-1-solOpenAI1,575.1Max 推理
39deepseek-v4-flash-visionDeepSeek1,548.1Max 推理
40gpt-6-astraOpenAI1,541.9Max 推理
41kimi-k3Moonshot AI1,537.7Max 推理
44gpt-6-solOpenAI1,509.1Max 推理
49muse-spark-1-2Meta1,477.5xHigh 推理
52claude-sonnet-5Anthropic1,465.8Max 推理
53gpt-5-6-lunaOpenAI1,463.9Max 推理
55claude-opus-4-8Anthropic1,455.5Max 推理
评测局限与数据署名

等级分来自模型裁判两两比较,不是正确率;它的刻度按同一批模型在其他领域的水平对齐,不能自定尺度。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。