AutomationBench-AA(Artificial Analysis)
Artificial Analysis / 专业工作 · 跨办公软件完成一整条业务自动化流程。
在 AIHOT 中参与排名
所属领域专业工作
上游数据时间待核实
最近成功同步10/04 20:23
它测什么,怎么测
取 Artificial Analysis 智能指数中 AutomationBench-AA 的完成率。同一型号按最高推理档位选代表配置,选择不看分数。
如何使用这份证据
计分:专业工作领域的业务流程一类。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | gemini-4-argonGoogle | 77.5% | High 推理 |
| 2 | claude-sonnet-5-5Anthropic | 71.8% | Max 推理 · 含来源回退 |
| 3 | claude-opus-5-5Anthropic | 69.5% | Max 推理 · 含来源回退 |
| 4 | deepseek-v4-1-flashDeepSeek | 68.9% | Max 推理 |
| 5 | gpt-6-astraOpenAI | 68.5% | Max 推理 |
| 7 | grok-4-6-xhighxAI | 67.0% | xHigh 推理 |
| 11 | grok-4-7xAI | 65.6% | xHigh 推理 |
| 14 | gpt-6-1-solOpenAI | 64.9% | Max 推理 |
| 17 | mimo-v2-6-flashXiaomi | 64.1% | 来源默认配置 |
| 22 | glm-5-3Z.ai | 62.2% | Max 推理 |
| 23 | gemini-3-7-flashGoogle | 62.0% | High 推理 |
| 24 | ling-3-1-flashInclusionAI | 61.7% | 来源默认配置 |
| 26 | gpt-6-solOpenAI | 61.6% | Max 推理 |
| 29 | glm-5-3-flashZ.ai | 60.4% | 来源默认配置 |
| 31 | gpt-5-6-solOpenAI | 60.1% | Max 推理 |
| 32 | gemini-3-8-flashGoogle | 59.9% | High 推理 |
| 33 | gpt-5-6-terraOpenAI | 59.6% | Max 推理 |
| 35 | claude-fable-5-1Anthropic | 59.4% | Max 推理 · 含来源回退 |
| 37 | mimo-v2-6-proXiaomi | 58.6% | 来源默认配置 |
| 38 | kimi-k3Moonshot AI | 58.3% | Max 推理 |
| 40 | grok-4-5xAI | 57.9% | High 推理 |
| 41 | muse-spark-1-3Meta | 57.9% | Max 推理 |
| 43 | qwen3-8-2-4t-a95bAlibaba | 57.2% | 来源默认配置 |
| 46 | deepseek-v4-proDeepSeek | 56.7% | Max 推理 |
| 47 | claude-opus-5Anthropic | 56.6% | Max 推理 |
| 48 | deepseek-v4-pro-0424DeepSeek | 56.3% | Max 推理 |
| 49 | qwen3-8-maxAlibaba | 56.2% | 来源默认配置 |
| 50 | qwen3-8-flash-nextAlibaba | 55.9% | 来源默认配置 |
| 57 | claude-fable-5Anthropic | 54.1% | Max 推理 · 含来源回退 |
| 58 | deepseek-v4-flashDeepSeek | 54.0% | Max 推理 |
评测局限与数据署名
在 AA 的统一环境中运行,与 Zapier 官方榜单的私有测试集不同。
数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use
成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。