MedCode
Vals AI / 专业办公 · 根据住院记录给出医疗诊断编码。
在 AIHOT 中参与排名
所属领域专业办公
上游数据时间10/06 08:00
最近成功同步10/08 02:05
它测什么,怎么测
去标识化住院记录,由两名认证编码员标注并解决分歧;统一温度 1、最多 30k 输出 token,核对 ICD-10-CM 主次诊断编码。
如何使用这份证据
计分:医疗编码一类评测。 固定十个对照型号至少测到六个,才参与计算。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | anthropic/claude-opus-5Anthropic | 63.6% | Max 推理 |
| 2 | google/gemini-3.1-pro-previewGoogle | 59.1% | High 推理 |
| 3 | google/gemini-4-argonGoogle | 58.8% | High 推理 |
| 4 | anthropic/claude-fable-5Anthropic | 56.1% | Max 推理 |
| 5 | google/gemini-3-flash-previewGoogle | 55.9% | High 推理 |
| 6 | google/gemini-3.5-flashGoogle | 55.8% | High 推理 |
| 7 | anthropic/claude-opus-4-7Anthropic | 54.9% | Max 推理 |
| 8 | anthropic/claude-fable-5-1Anthropic | 53.5% | Max 推理 |
| 9 | google/gemini-3.7-flashGoogle | 53.4% | High 推理 |
| 10 | anthropic/claude-opus-4-8Anthropic | 53.2% | Max 推理 |
| 11 | google/gemini-3.6-flashGoogle | 53.2% | High 推理 |
| 12 | anthropic/claude-sonnet-5-5Anthropic | 52.9% | Max 推理 |
| 13 | openai/gpt-5.1-2025-11-13OpenAI | 52.7% | High 推理 |
| 14 | google/gemini-3-pro-previewGoogle | 52.2% | High 推理 |
| 15 | meta/muse_sparkMeta | 51.3% | 来源默认配置 |
| 16 | google/gemini-2.5-proGoogle | 50.6% | 来源默认配置 |
| 17 | anthropic/claude-opus-5-5Anthropic | 49.8% | Max 推理 |
| 18 | openai/gpt-5.2-2025-12-11OpenAI | 49.7% | xHigh 推理 |
| 19 | openai/gpt-5-2025-08-07OpenAI | 49.6% | High 推理 |
| 20 | grok/grok-4.7xAI | 49.6% | xHigh 推理 |
| 21 | kimi/kimi-k3Moonshot AI | 49.4% | Max 推理 |
| 22 | meta/muse_spark_1_2Meta | 49.3% | xHigh 推理 |
| 25 | openai/gpt-5.5OpenAI | 49.1% | xHigh 推理 |
| 26 | openai/gpt-6.1-solOpenAI | 48.8% | Max 推理 |
| 27 | openai/gpt-6-astraOpenAI | 48.5% | Max 推理 |
| 28 | anthropic/claude-opus-4-6Anthropic | 48.2% | Max 推理 |
| 29 | google/gemini-3.8-flashGoogle | 48.1% | High 推理 |
| 30 | google/gemini-3.1-flash-lite-previewGoogle | 47.6% | High 推理 |
| 31 | anthropic/claude-sonnet-5Anthropic | 47.5% | Max 推理 |
| 32 | openai/o3-2025-04-16OpenAI | 47.3% | High 推理 |
评测局限与数据署名
取总体编码得分,不等同于整份病例完全正确率;不混用主次诊断切片。 缺测留空;回退成绩计入并标注,受影响题目过半不计。
数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准
成绩由 Vals AI 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。