跳到正文

Claude Opus 5.5

Anthropic · 2026-09-22 发布 · 10/09 08:05 更新

AIHOT 评分 · 综合73.9分综合第 1 名评分不是正确率 · 证据覆盖 96%
可比较分类4/ 4 项分类
已有成绩34项评测
上下文窗口100万Token
API 输入 / 输出 · 每百万 Token¥26.81 / ¥134.05缓存 ¥1.34原价 $4 / $20厂商官方价格
CAPABILITY PROFILE

各有所长,看得更清楚。

每个领域单独评分,与综合评分在同一条刻度上。具体能力请看下面每项成绩。

覆盖比例是这个领域里已有成绩的评测类别占比,不代表能力高低;没测的不补分,也不扣分。

BEHIND THE SCORE

每一项成绩,都有来处。

按领域列出每项公开成绩,以及它在同一条刻度上的读数。展开可查看运行配置与采用方式。

编程74.38 项

科研76.88 项

专业办公71.310 项

知识问答72.77 项

真人盲选72.11 项

测过,但按规则不计入

这些公开成绩没有计入,原因如下:例如评测方公布超过一半题目被转给了旧型号,或者无法确认测的是哪个版本。

  • Code Migration:评测方公布这次运行有 82% 的题目被转给了同厂商的旧型号,超过一半,不代表这个型号。

尚无成绩的评测

这些评测尚无可采用的公开成绩,缺测不补分。

怎么看这些读数

每项成绩按这项评测的难度换算到同一条刻度上:难的评测考得一般也能读出高分,刷满的评测读不出更多。领域分是这些读数的平均,再向模型的整体水平收一点;同类评测只算一票。相差不到 1 分的两个模型,先后接近抛硬币。

了解计算方法 →