跳到正文

MLCR-AA

Artificial Analysis / 知识问答 · 准确、完整且简洁地理解医疗长记录。

官方评测
在 AIHOT 中参与排名
所属领域知识问答
上游数据时间待核实
最近成功同步10/08 02:05

它测什么,怎么测

25k–64k token 医疗记录;专家参考答案、三个模型裁判多数表决;每题三次,取总体 pass@1,空答或超过参考答案五倍长度失败。

如何使用这份证据

计分:长文理解;与 AA-LCR 共用一类评测。 固定十个对照型号至少测到六个,才参与计算。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-sonnet-5-5Anthropic75.0%Max 推理 · 含来源回退
2claude-fable-5-1Anthropic71.1%Max 推理 · 含来源回退
3claude-opus-5-5Anthropic66.7%Max 推理 · 含来源回退
4claude-fable-5Anthropic64.4%Max 推理 · 含来源回退
8claude-opus-5Anthropic55.6%Max 推理
9claude-sonnet-5Anthropic55.0%Max 推理
11glm-5-3-flashZ.ai51.1%来源默认配置
12glm-5-3Z.ai48.3%Max 推理
13claude-opus-4-8Anthropic45.6%Max 推理
14muse-spark-1-3Meta43.3%Max 推理
15kimi-k3Moonshot AI38.3%Max 推理
16gpt-6-astraOpenAI35.0%Max 推理
17gpt-6-1-solOpenAI33.9%Max 推理
18gpt-5-6-terraOpenAI31.7%Max 推理
19muse-spark-1-2Meta31.1%xHigh 推理
20claude-opus-4-7-non-reasoningAnthropic28.9%High 推理
21gpt-5-6-solOpenAI26.1%Max 推理
22claude-sonnet-4-6-adaptiveAnthropic24.4%Max 推理
23deepseek-v4-1-flashDeepSeek22.8%Max 推理
24gemini-3-8-flashGoogle21.7%High 推理
24qwen3-8-27bAlibaba21.7%xHigh 推理
27deepseek-v4-pro-0424DeepSeek21.1%Max 推理
29qwen3-8-maxAlibaba20.0%来源默认配置
29muse-glimmerMeta20.0%High 推理
32gpt-5-6-lunaOpenAI19.4%Max 推理
32qwen3-8-max-0803Alibaba19.4%来源默认配置
34mimo-v2-6-proXiaomi18.3%来源默认配置
34gemini-3-5-flashGoogle18.3%High 推理
37deepseek-v4-proDeepSeek17.8%Max 推理
37gpt-5-5OpenAI17.8%xHigh 推理
评测局限与数据署名

只取 mlcrOverall,包含长度失败;不替换成仅对合格长度作答的准确率。 缺测留空;回退成绩计入并标注,受影响题目过半不计。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。