← 返回综合
分类成绩1 / 4 项分类
已有成绩7 项评测
上下文窗口100万 Token
API 输入 / 输出 · 每百万 Token¥26.83 / ¥134.15厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次1—4 名

2 个情景下参评证据不足。保持原候选不变时为 14 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

GPT-6 Astra7 项共同评测共同证据支持本模型

双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Creative Writing v32,0502,173.13.6%
Longform Writing84.682.82.4%
LiveBench · 编程综合80.5%68.8%2.4%
LiveBench · 推理与数学94.6%94.7%4.2%
LiveBench · 语言与指令76.0%82.5%3.0%
APEX-Agents 1.173.5%64.7%4.0%
Vals Finance Agent58.6%53.5%3.0%
查看 GPT-6 Astra 的完整证据 →
Claude Fable 5.17 项共同评测共同证据支持本模型

双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Creative Writing v32,0502,161.83.6%
Longform Writing84.685.32.4%
LiveBench · 编程综合80.5%76.2%2.4%
LiveBench · 推理与数学94.6%94.3%4.2%
LiveBench · 语言与指令76.0%81.2%3.0%
APEX-Agents 1.173.5%68.6%4.0%
Vals Finance Agent58.6%58.9%3.0%
查看 Claude Fable 5.1 的完整证据 →
Claude Fable 57 项共同评测共同证据支持本模型

双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Creative Writing v32,0501,943.23.6%
Longform Writing84.6832.4%
LiveBench · 编程综合80.5%74.1%2.4%
LiveBench · 推理与数学94.6%92.8%4.2%
LiveBench · 语言与指令76.0%83.2%3.0%
APEX-Agents 1.173.5%63.6%4.0%
Vals Finance Agent58.6%56.3%3.0%
查看 Claude Fable 5 的完整证据 →
Claude Opus 57 项共同评测共同证据支持本模型

双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Creative Writing v32,0502,132.33.6%
Longform Writing84.686.32.4%
LiveBench · 编程综合80.5%73.3%2.4%
LiveBench · 推理与数学94.6%93.5%4.2%
LiveBench · 语言与指令76.0%76.2%3.0%
APEX-Agents 1.173.5%65.8%4.0%
Vals Finance Agent58.6%58.6%3.0%
查看 Claude Opus 5 的完整证据 →
Muse Spark 1.37 项共同评测共同证据支持本模型

双方共同拥有当前榜单 22.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Creative Writing v32,0501,908.73.6%
Longform Writing84.682.82.4%
LiveBench · 编程综合80.5%72.6%2.4%
LiveBench · 推理与数学94.6%92.8%4.2%
LiveBench · 语言与指令76.0%80.4%3.0%
APEX-Agents 1.173.5%57.8%4.0%
Vals Finance Agent58.6%60.0%3.0%
查看 Muse Spark 1.3 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验3

Creative Writing v3已计入综合排名2,050
原榜型号claude-opus-5-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/24 05:19 · 核验 09/24 06:00 · 实测日期未公开
Longform Writing已计入综合排名84.6
原榜型号claude-opus-5-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/24 05:19 · 核验 09/24 06:00 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名76.0%两项均分
原榜型号claude-opus-5-5-max-effort
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/23 04:51 · 核验 09/24 06:00 · 实测日期未公开

Language + IF 各占 50%,使用未舍入的分项成绩求平均。

  • Language86.3%
  • IF65.7%

编程1

LiveBench · 编程综合已计入综合排名80.5%两项均分
原榜型号claude-opus-5-5-max-effort
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/23 04:51 · 核验 09/24 06:00 · 实测日期未公开

Coding + Agentic Coding 各占 50%,使用未舍入的分项成绩求平均。

  • Coding89.3%
  • Agentic Coding71.7%

推理1

LiveBench · 推理与数学已计入综合排名94.6%两项均分
原榜型号claude-opus-5-5-max-effort
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/23 04:51 · 核验 09/24 06:00 · 实测日期未公开

Reasoning + Mathematics 各占 50%,使用未舍入的分项成绩求平均。

  • Reasoning92.2%
  • Mathematics97.1%

专业办公2

APEX-Agents 1.1已计入综合排名73.5%
原榜型号claude-opus-5-5
代表配置Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/08 08:00 · 核验 09/24 06:00 · 实测日期未公开
Vals Finance Agent已计入综合排名58.6%
原榜型号anthropic/claude-opus-5-5
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/22 08:00 · 核验 09/24 06:00 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →