AA-Analyst Agent
Artificial Analysis / 专业办公 · 可靠地分析数据并回答专业问题。
在 AIHOT 中参与排名
所属领域专业办公
上游数据时间待核实
最近成功同步10/08 02:05
它测什么,怎么测
80 个私有问题、14 个领域,统一 Stirrup 工具环境;每题独立运行五次,五次全部成功才通过(pass^5)。
如何使用这份证据
计分:数据分析;与 LiveBench Data Analysis 共用一类评测。 固定十个对照型号至少测到六个,才参与计算。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | gemini-3-7-flashGoogle | 60.0% | High 推理 |
| 2 | claude-fable-5-1Anthropic | 57.5% | Max 推理 · 含来源回退 |
| 2 | claude-sonnet-5-5Anthropic | 57.5% | Max 推理 · 含来源回退 |
| 4 | claude-opus-5-5Anthropic | 56.3% | Max 推理 · 含来源回退 |
| 5 | claude-opus-5Anthropic | 53.8% | Max 推理 |
| 6 | gpt-6-astraOpenAI | 51.2% | Max 推理 |
| 7 | gpt-5-5OpenAI | 50.0% | xHigh 推理 |
| 7 | gpt-6-1-solOpenAI | 50.0% | Max 推理 |
| 9 | claude-fable-5Anthropic | 48.8% | Max 推理 · 含来源回退 |
| 10 | gpt-5-6-solOpenAI | 47.5% | Max 推理 |
| 11 | claude-sonnet-5Anthropic | 46.3% | Max 推理 |
| 12 | qwen3-8-maxAlibaba | 45.0% | 来源默认配置 |
| 12 | gemini-3-5-flashGoogle | 45.0% | High 推理 |
| 12 | claude-opus-4-8Anthropic | 45.0% | Max 推理 |
| 15 | claude-opus-4-7Anthropic | 43.8% | Max 推理 |
| 16 | gemini-3-1-pro-previewGoogle | 41.3% | 来源默认配置 |
| 16 | grok-4-6xAI | 41.3% | High 推理 |
| 18 | kimi-k3Moonshot AI | 38.8% | Max 推理 |
| 19 | grok-4-5xAI | 35.0% | High 推理 |
| 19 | step-5StepFun | 35.0% | 来源默认配置 |
| 21 | inkling-smallThinking Machines Lab | 27.5% | 来源默认配置 |
| 22 | deepseek-v4-flash-0420DeepSeek | 25.0% | Max 推理 |
| 23 | inklingThinking Machines Lab | 23.8% | xHigh 推理 |
| 24 | claude-sonnet-4-6-adaptiveAnthropic | 20.0% | Max 推理 |
| 24 | mimo-v2-5-proXiaomi | 20.0% | 来源默认配置 |
| 26 | deepseek-v4-pro-0424DeepSeek | 18.8% | Max 推理 |
| 26 | qwen3-7-maxAlibaba | 18.8% | 来源默认配置 |
| 28 | ling-3-0-flash-fininclusionai | 16.3% | 来源默认配置 |
| 29 | gpt-5-4-miniOpenAI | 15.0% | xHigh 推理 |
| 29 | claude-4-5-haiku-reasoningAnthropic | 15.0% | 来源默认配置 |
评测局限与数据署名
pass^5 不是五次至少成功一次的 pass@5。 缺测留空;回退成绩计入并标注,受影响题目过半不计。
数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use
成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。