AA-LCR(Artificial Analysis)
Artificial Analysis / 知识与语言 · 读很长的文档后,回答需要综合推理的问题。
在 AIHOT 中参与排名
所属领域知识与语言
上游数据时间待核实
最近成功同步10/04 20:23
它测什么,怎么测
取 Artificial Analysis 智能指数中 AA-LCR 的正确率。同一型号按最高推理档位选代表配置,选择不看分数。
如何使用这份证据
计分:知识与语言领域的长文理解一类。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | kimi-k3Moonshot AI | 88.7% | Max 推理 |
| 2 | step-5StepFun | 88.3% | 来源默认配置 |
| 3 | mimo-v2-6-proXiaomi | 86.3% | 来源默认配置 |
| 4 | claude-fable-5-1Anthropic | 85.3% | Max 推理 · 含来源回退 |
| 5 | claude-opus-5-5Anthropic | 84.7% | Max 推理 · 含来源回退 |
| 8 | gpt-5-5OpenAI | 84.3% | xHigh 推理 |
| 11 | gpt-5-6-solOpenAI | 84.0% | Max 推理 |
| 11 | deepseek-v4-1-flashDeepSeek | 84.0% | Max 推理 |
| 15 | gpt-6-solOpenAI | 83.7% | Max 推理 |
| 15 | gpt-5-6-lunaOpenAI | 83.7% | Max 推理 |
| 19 | solar-mini4Upstage | 83.3% | 来源默认配置 |
| 19 | muse-glimmerMeta | 83.3% | High 推理 |
| 19 | gpt-6-lunaOpenAI | 83.3% | Max 推理 |
| 23 | gpt-6-1-solOpenAI | 83.0% | Max 推理 |
| 23 | gpt-5-6-terraOpenAI | 83.0% | Max 推理 |
| 23 | muse-spark-1-3Meta | 83.0% | Max 推理 |
| 23 | minimax-m3MiniMax | 83.0% | 来源默认配置 |
| 23 | ling-3-1-flashInclusionAI | 83.0% | 来源默认配置 |
| 31 | claude-sonnet-5-5Anthropic | 82.7% | Max 推理 · 含来源回退 |
| 33 | claude-fable-5Anthropic | 82.3% | Max 推理 · 含来源回退 |
| 38 | gemini-3-1-pro-previewGoogle | 82.0% | 来源默认配置 |
| 38 | qwen3-8-27bAlibaba | 82.0% | xHigh 推理 |
| 38 | claude-sonnet-5Anthropic | 82.0% | Max 推理 |
| 42 | gemini-3-7-flashGoogle | 81.7% | High 推理 |
| 45 | gemini-3-8-flashGoogle | 81.3% | High 推理 |
| 45 | deepseek-v4-flash-visionDeepSeek | 81.3% | Max 推理 |
| 49 | kimi-k2-6Moonshot AI | 81.0% | 来源默认配置 |
| 49 | grok-4-6-xhighxAI | 81.0% | xHigh 推理 |
| 52 | gpt-6-astraOpenAI | 80.7% | Max 推理 |
| 55 | qwen3-8-2-4t-a95bAlibaba | 80.3% | 来源默认配置 |
评测局限与数据署名
只考英文长文。
数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use
成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。