跳到正文

AutomationBench-AA(Artificial Analysis)

Artificial Analysis / 专业工作 · 跨办公软件完成一整条业务自动化流程。

官方评测
在 AIHOT 中参与排名
所属领域专业工作
上游数据时间待核实
最近成功同步10/04 20:23

它测什么,怎么测

取 Artificial Analysis 智能指数中 AutomationBench-AA 的完成率。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:专业工作领域的业务流程一类。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1gemini-4-argonGoogle77.5%High 推理
2claude-sonnet-5-5Anthropic71.8%Max 推理 · 含来源回退
3claude-opus-5-5Anthropic69.5%Max 推理 · 含来源回退
4deepseek-v4-1-flashDeepSeek68.9%Max 推理
5gpt-6-astraOpenAI68.5%Max 推理
7grok-4-6-xhighxAI67.0%xHigh 推理
11grok-4-7xAI65.6%xHigh 推理
14gpt-6-1-solOpenAI64.9%Max 推理
17mimo-v2-6-flashXiaomi64.1%来源默认配置
22glm-5-3Z.ai62.2%Max 推理
23gemini-3-7-flashGoogle62.0%High 推理
24ling-3-1-flashInclusionAI61.7%来源默认配置
26gpt-6-solOpenAI61.6%Max 推理
29glm-5-3-flashZ.ai60.4%来源默认配置
31gpt-5-6-solOpenAI60.1%Max 推理
32gemini-3-8-flashGoogle59.9%High 推理
33gpt-5-6-terraOpenAI59.6%Max 推理
35claude-fable-5-1Anthropic59.4%Max 推理 · 含来源回退
37mimo-v2-6-proXiaomi58.6%来源默认配置
38kimi-k3Moonshot AI58.3%Max 推理
40grok-4-5xAI57.9%High 推理
41muse-spark-1-3Meta57.9%Max 推理
43qwen3-8-2-4t-a95bAlibaba57.2%来源默认配置
46deepseek-v4-proDeepSeek56.7%Max 推理
47claude-opus-5Anthropic56.6%Max 推理
48deepseek-v4-pro-0424DeepSeek56.3%Max 推理
49qwen3-8-maxAlibaba56.2%来源默认配置
50qwen3-8-flash-nextAlibaba55.9%来源默认配置
57claude-fable-5Anthropic54.1%Max 推理 · 含来源回退
58deepseek-v4-flashDeepSeek54.0%Max 推理
评测局限与数据署名

在 AA 的统一环境中运行,与 Zapier 官方榜单的私有测试集不同。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。