跳到正文

AA-Analyst Agent

Artificial Analysis / 专业办公 · 可靠地分析数据并回答专业问题。

官方评测
在 AIHOT 中参与排名
所属领域专业办公
上游数据时间待核实
最近成功同步10/08 02:05

它测什么,怎么测

80 个私有问题、14 个领域,统一 Stirrup 工具环境;每题独立运行五次,五次全部成功才通过(pass^5)。

如何使用这份证据

计分:数据分析;与 LiveBench Data Analysis 共用一类评测。 固定十个对照型号至少测到六个,才参与计算。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1gemini-3-7-flashGoogle60.0%High 推理
2claude-fable-5-1Anthropic57.5%Max 推理 · 含来源回退
2claude-sonnet-5-5Anthropic57.5%Max 推理 · 含来源回退
4claude-opus-5-5Anthropic56.3%Max 推理 · 含来源回退
5claude-opus-5Anthropic53.8%Max 推理
6gpt-6-astraOpenAI51.2%Max 推理
7gpt-5-5OpenAI50.0%xHigh 推理
7gpt-6-1-solOpenAI50.0%Max 推理
9claude-fable-5Anthropic48.8%Max 推理 · 含来源回退
10gpt-5-6-solOpenAI47.5%Max 推理
11claude-sonnet-5Anthropic46.3%Max 推理
12qwen3-8-maxAlibaba45.0%来源默认配置
12gemini-3-5-flashGoogle45.0%High 推理
12claude-opus-4-8Anthropic45.0%Max 推理
15claude-opus-4-7Anthropic43.8%Max 推理
16gemini-3-1-pro-previewGoogle41.3%来源默认配置
16grok-4-6xAI41.3%High 推理
18kimi-k3Moonshot AI38.8%Max 推理
19grok-4-5xAI35.0%High 推理
19step-5StepFun35.0%来源默认配置
21inkling-smallThinking Machines Lab27.5%来源默认配置
22deepseek-v4-flash-0420DeepSeek25.0%Max 推理
23inklingThinking Machines Lab23.8%xHigh 推理
24claude-sonnet-4-6-adaptiveAnthropic20.0%Max 推理
24mimo-v2-5-proXiaomi20.0%来源默认配置
26deepseek-v4-pro-0424DeepSeek18.8%Max 推理
26qwen3-7-maxAlibaba18.8%来源默认配置
28ling-3-0-flash-fininclusionai16.3%来源默认配置
29gpt-5-4-miniOpenAI15.0%xHigh 推理
29claude-4-5-haiku-reasoningAnthropic15.0%来源默认配置
评测局限与数据署名

pass^5 不是五次至少成功一次的 pass@5。 缺测留空;回退成绩计入并标注,受影响题目过半不计。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。