跳到正文

AA-Briefcase(Artificial Analysis)

Artificial Analysis / 专业工作 · 办公知识工作的长任务,两两比较交付结果。

官方评测
在 AIHOT 中参与排名
所属领域专业工作
上游数据时间待核实
最近成功同步10/04 20:23

它测什么,怎么测

取 Artificial Analysis 智能指数中 AA-Briefcase 的 Elo 等级分。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:专业工作领域,与 GDPval-AA 同属职业交付一类,两项合起来算一票。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-sonnet-5-5Anthropic1,824.3Max 推理 · 含来源回退
2claude-opus-5-5Anthropic1,807.8Max 推理 · 含来源回退
6claude-fable-5-1Anthropic1,675.5Max 推理 · 含来源回退
7claude-opus-5Anthropic1,662Max 推理
9grok-4-7xAI1,644.6xHigh 推理
14qwen3-8-maxAlibaba1,620.5来源默认配置
15muse-spark-1-3Meta1,583Max 推理
16qwen3-8-flash-nextAlibaba1,582.7来源默认配置
18gpt-6-astraOpenAI1,568.9Max 推理
19gpt-6-1-solOpenAI1,564.2Max 推理
21grok-4-6-xhighxAI1,544.4xHigh 推理
23claude-fable-5Anthropic1,539Max 推理 · 含来源回退
26mimo-v2-6-proXiaomi1,516.6来源默认配置
27glm-5-3Z.ai1,510Max 推理
31kimi-k3Moonshot AI1,500.8Max 推理
32mimo-v2-6-flashXiaomi1,494.7来源默认配置
33gemini-4-argonGoogle1,490.5High 推理
37gpt-6-solOpenAI1,479.5Max 推理
38gpt-5-6-solOpenAI1,478.4Max 推理
41glm-5-3-flashZ.ai1,454.2来源默认配置
44qwen3-8-2-4t-a95bAlibaba1,435.6来源默认配置
46deepseek-v4-flash-visionDeepSeek1,425.5Max 推理
47step-5StepFun1,424.4来源默认配置
48deepseek-v4-1-flashDeepSeek1,420.9Max 推理
49ling-3-1-flashInclusionAI1,400.4来源默认配置
50qwen3-8-27bAlibaba1,396.9xHigh 推理
51qwen3-8-max-0803Alibaba1,386.5来源默认配置
56claude-sonnet-5Anthropic1,358.1Max 推理
57gpt-5-6-lunaOpenAI1,342.7Max 推理
58gpt-6-lunaOpenAI1,336Max 推理
评测局限与数据署名

等级分来自模型裁判两两比较,不是正确率;它的刻度按同一批模型在其他领域的水平对齐,不能自定尺度。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。