跳到正文

MedCode

Vals AI / 专业办公 · 根据住院记录给出医疗诊断编码。

官方评测
在 AIHOT 中参与排名
所属领域专业办公
上游数据时间10/06 08:00
最近成功同步10/08 02:05

它测什么,怎么测

去标识化住院记录,由两名认证编码员标注并解决分歧;统一温度 1、最多 30k 输出 token,核对 ICD-10-CM 主次诊断编码。

如何使用这份证据

计分:医疗编码一类评测。 固定十个对照型号至少测到六个,才参与计算。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1anthropic/claude-opus-5Anthropic63.6%Max 推理
2google/gemini-3.1-pro-previewGoogle59.1%High 推理
3google/gemini-4-argonGoogle58.8%High 推理
4anthropic/claude-fable-5Anthropic56.1%Max 推理
5google/gemini-3-flash-previewGoogle55.9%High 推理
6google/gemini-3.5-flashGoogle55.8%High 推理
7anthropic/claude-opus-4-7Anthropic54.9%Max 推理
8anthropic/claude-fable-5-1Anthropic53.5%Max 推理
9google/gemini-3.7-flashGoogle53.4%High 推理
10anthropic/claude-opus-4-8Anthropic53.2%Max 推理
11google/gemini-3.6-flashGoogle53.2%High 推理
12anthropic/claude-sonnet-5-5Anthropic52.9%Max 推理
13openai/gpt-5.1-2025-11-13OpenAI52.7%High 推理
14google/gemini-3-pro-previewGoogle52.2%High 推理
15meta/muse_sparkMeta51.3%来源默认配置
16google/gemini-2.5-proGoogle50.6%来源默认配置
17anthropic/claude-opus-5-5Anthropic49.8%Max 推理
18openai/gpt-5.2-2025-12-11OpenAI49.7%xHigh 推理
19openai/gpt-5-2025-08-07OpenAI49.6%High 推理
20grok/grok-4.7xAI49.6%xHigh 推理
21kimi/kimi-k3Moonshot AI49.4%Max 推理
22meta/muse_spark_1_2Meta49.3%xHigh 推理
25openai/gpt-5.5OpenAI49.1%xHigh 推理
26openai/gpt-6.1-solOpenAI48.8%Max 推理
27openai/gpt-6-astraOpenAI48.5%Max 推理
28anthropic/claude-opus-4-6Anthropic48.2%Max 推理
29google/gemini-3.8-flashGoogle48.1%High 推理
30google/gemini-3.1-flash-lite-previewGoogle47.6%High 推理
31anthropic/claude-sonnet-5Anthropic47.5%Max 推理
32openai/o3-2025-04-16OpenAI47.3%High 推理
评测局限与数据署名

取总体编码得分,不等同于整份病例完全正确率;不混用主次诊断切片。 缺测留空;回退成绩计入并标注,受影响题目过半不计。

数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准

成绩由 Vals AI 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。