← 返回综合榜CAPABILITY PROFILE UNDERSTANDING THE RANK
查看 GPT-6 Astra 的完整证据 →
查看 Claude Fable 5.1 的完整证据 →
查看 Claude Fable 5 的完整证据 →
查看 Claude Opus 5 的完整证据 →
查看 Muse Spark 1.3 的完整证据 →BEHIND THE SCORE
Claude Opus 5.5
Anthropic · 2026-09-17 发布 · 09/24 06:00 更新
分类成绩1 / 4 项分类
已有成绩7 项评测
上下文窗口100万 Token
API 输入 / 输出 · 每百万 Token¥26.83 / ¥134.15厂商官方价格 ↗
各有所长,看得更清楚。
每项能力单独计算。没有足够的实测,就留空。
不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。
综合名次,有多稳定?
依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。
重新检查资格后的名次1—4 名
2 个情景下参评证据不足。保持原候选不变时为 1—4 名。这个范围不是置信区间,也不包含从未公开的成绩。
查看与附近模型的共同证据
净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。
GPT-6 Astra7 项共同评测共同证据支持本模型
双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Creative Writing v3 ↗ | 2,050 | 2,173.1 | 3.6% |
| Longform Writing ↗ | 84.6 | 82.8 | 2.4% |
| LiveBench · 编程综合 ↗ | 80.5% | 68.8% | 2.4% |
| LiveBench · 推理与数学 ↗ | 94.6% | 94.7% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.0% | 82.5% | 3.0% |
| APEX-Agents 1.1 ↗ | 73.5% | 64.7% | 4.0% |
| Vals Finance Agent ↗ | 58.6% | 53.5% | 3.0% |
Claude Fable 5.17 项共同评测共同证据支持本模型
双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Creative Writing v3 ↗ | 2,050 | 2,161.8 | 3.6% |
| Longform Writing ↗ | 84.6 | 85.3 | 2.4% |
| LiveBench · 编程综合 ↗ | 80.5% | 76.2% | 2.4% |
| LiveBench · 推理与数学 ↗ | 94.6% | 94.3% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.0% | 81.2% | 3.0% |
| APEX-Agents 1.1 ↗ | 73.5% | 68.6% | 4.0% |
| Vals Finance Agent ↗ | 58.6% | 58.9% | 3.0% |
Claude Fable 57 项共同评测共同证据支持本模型
双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Creative Writing v3 ↗ | 2,050 | 1,943.2 | 3.6% |
| Longform Writing ↗ | 84.6 | 83 | 2.4% |
| LiveBench · 编程综合 ↗ | 80.5% | 74.1% | 2.4% |
| LiveBench · 推理与数学 ↗ | 94.6% | 92.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.0% | 83.2% | 3.0% |
| APEX-Agents 1.1 ↗ | 73.5% | 63.6% | 4.0% |
| Vals Finance Agent ↗ | 58.6% | 56.3% | 3.0% |
Claude Opus 57 项共同评测共同证据支持本模型
双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Creative Writing v3 ↗ | 2,050 | 2,132.3 | 3.6% |
| Longform Writing ↗ | 84.6 | 86.3 | 2.4% |
| LiveBench · 编程综合 ↗ | 80.5% | 73.3% | 2.4% |
| LiveBench · 推理与数学 ↗ | 94.6% | 93.5% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.0% | 76.2% | 3.0% |
| APEX-Agents 1.1 ↗ | 73.5% | 65.8% | 4.0% |
| Vals Finance Agent ↗ | 58.6% | 58.6% | 3.0% |
Muse Spark 1.37 项共同评测共同证据支持本模型
双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Creative Writing v3 ↗ | 2,050 | 1,908.7 | 3.6% |
| Longform Writing ↗ | 84.6 | 82.8 | 2.4% |
| LiveBench · 编程综合 ↗ | 80.5% | 72.6% | 2.4% |
| LiveBench · 推理与数学 ↗ | 94.6% | 92.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.0% | 80.4% | 3.0% |
| APEX-Agents 1.1 ↗ | 73.5% | 57.8% | 4.0% |
| Vals Finance Agent ↗ | 58.6% | 60.0% | 3.0% |
每一项成绩,都有来处。
下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。