← 返回综合
分类成绩4 / 4 项分类
已有成绩20 项评测
上下文窗口100万 Token
API 输入 / 输出 · 每百万 Token¥67.12 / ¥335.58厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次2—4 名

已完成的对照中均具备参评资格。保持原候选不变时为 24 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

Claude Fable 5.117 项共同评测共同证据支持对方

双方共同拥有当前榜单 56.4% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,504.11,486.35.0%
Arena Text1,505.71,498.55.0%
Arena Vision1,309.51,288.96.0%
Arena WebDev1,6281,7582.4%
Chess Puzzles41.0%47.0%1.8%
FrontierMath v2 · Tiers 1–387.0%90.2%3.6%
FrontierMath v2 · Tier 490.2%87.8%1.2%
Mystery Game Puzzles52.0%58.0%1.2%
SimpleQA Verified70.7%70.8%4.0%
Creative Writing v31,934.62,152.73.6%
Longform Writing8385.32.4%
LiveBench · 编程74.1%76.2%2.4%
LiveBench · 推理92.8%94.3%4.2%
LiveBench · 语言与指令83.2%81.2%3.0%
APEX-Agents 1.163.6%68.6%4.0%
TapTap Maker89.0%90.5%3.6%
Vals Finance Agent56.3%58.9%3.0%
查看 Claude Fable 5.1 的完整证据 →
Claude Opus 520 项共同评测共同证据支持本模型

双方共同拥有当前榜单 64.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,504.11,471.95.0%
Arena Text1,505.71,487.45.0%
Arena Vision1,309.51,2896.0%
Arena WebDev1,6281,6872.4%
DeepSWE v1.169.7%73.6%3.6%
Chess Puzzles41.0%42.0%1.8%
FrontierMath v2 · Tiers 1–387.0%85.6%3.6%
FrontierMath v2 · Tier 490.2%73.2%1.2%
GPQA Diamond85.9%93.9%2.0%
Mystery Game Puzzles52.0%59.0%1.2%
SimpleQA Verified70.7%59.9%4.0%
Creative Writing v31,934.62,120.63.6%
Longform Writing8386.32.4%
LiveBench · 编程74.1%73.3%2.4%
LiveBench · 推理92.8%93.5%4.2%
LiveBench · 语言与指令83.2%76.2%3.0%
APEX-Agents 1.163.6%65.8%4.0%
TapTap Maker89.0%88.9%3.6%
τ³-Banking39.7%48.7%2.0%
Vals Finance Agent56.3%58.6%3.0%
查看 Claude Opus 5 的完整证据 →
GPT-6 Astra19 项共同评测共同证据支持对方

双方共同拥有当前榜单 62.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,504.11,460.75.0%
Arena Text1,505.71,479.85.0%
Arena Vision1,309.51,2846.0%
Arena WebDev1,6281,800.32.4%
DeepSWE v1.169.7%73.2%3.6%
Chess Puzzles41.0%72.0%1.8%
FrontierMath v2 · Tiers 1–387.0%93.7%3.6%
FrontierMath v2 · Tier 490.2%97.6%1.2%
GPQA Diamond85.9%95.8%2.0%
Mystery Game Puzzles52.0%84.0%1.2%
SimpleQA Verified70.7%75.6%4.0%
Creative Writing v31,934.62,163.93.6%
Longform Writing8382.82.4%
LiveBench · 编程74.1%68.8%2.4%
LiveBench · 推理92.8%94.7%4.2%
LiveBench · 语言与指令83.2%82.5%3.0%
APEX-Agents 1.163.6%64.7%4.0%
TapTap Maker89.0%88.9%3.6%
Vals Finance Agent56.3%53.5%3.0%
查看 GPT-6 Astra 的完整证据 →
Muse Spark 1.311 项共同评测共同证据支持本模型

双方共同拥有当前榜单 41.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,504.11,452.85.0%
Arena Text1,505.71,493.15.0%
Arena Vision1,309.51,294.16.0%
Arena WebDev1,6281,651.92.4%
Creative Writing v31,934.61,905.53.6%
Longform Writing8382.82.4%
LiveBench · 编程74.1%72.6%2.4%
LiveBench · 推理92.8%92.8%4.2%
LiveBench · 语言与指令83.2%80.4%3.0%
APEX-Agents 1.163.6%57.8%4.0%
Vals Finance Agent56.3%60.0%3.0%
查看 Muse Spark 1.3 的完整证据 →
GPT-5.6 Sol20 项共同评测共同证据支持本模型

双方共同拥有当前榜单 64.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,504.11,473.15.0%
Arena Text1,505.71,483.55.0%
Arena Vision1,309.51,285.96.0%
Arena WebDev1,6281,617.32.4%
DeepSWE v1.169.7%72.7%3.6%
Chess Puzzles41.0%55.0%1.8%
FrontierMath v2 · Tiers 1–387.0%89.1%3.6%
FrontierMath v2 · Tier 490.2%82.9%1.2%
GPQA Diamond85.9%93.5%2.0%
Mystery Game Puzzles52.0%58.0%1.2%
SimpleQA Verified70.7%69.7%4.0%
Creative Writing v31,934.61,963.43.6%
Longform Writing8381.72.4%
LiveBench · 编程74.1%70.1%2.4%
LiveBench · 推理92.8%93.9%4.2%
LiveBench · 语言与指令83.2%79.8%3.0%
APEX-Agents 1.163.6%51.4%4.0%
TapTap Maker89.0%86.5%3.6%
τ³-Banking39.7%46.9%2.0%
Vals Finance Agent56.3%53.8%3.0%
查看 GPT-5.6 Sol 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验6

Creative Writing v3已计入综合排名1,934.6
原榜型号claude-fable-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/16 02:57 · 实测日期未公开
Longform Writing已计入综合排名83
原榜型号claude-fable-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/16 02:57 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名83.2%
原榜型号claude-fable-5-max-effort
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:57 · 实测日期未公开
Arena Text已计入综合排名1,505.7
原榜型号claude-fable-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:57 · 实测日期未公开
Arena WebDev已计入综合排名1,628
原榜型号claude-fable-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:57 · 实测日期未公开
Arena 创作盲选已计入综合排名1,504.1
原榜型号claude-fable-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:57 · 实测日期未公开

编程3

DeepSWE v1.1已计入综合排名69.7%
原榜型号claude-fable-5
代表配置Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/04 06:24 · 核验 09/16 02:57 · 实测日期未公开
LiveBench · 编程已计入综合排名74.1%
原榜型号claude-fable-5-max-effort
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:57 · 实测日期未公开
TapTap Maker已计入综合排名89.0%
原榜型号claude-fable-5
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 08:00 · 核验 09/16 02:57 · 实测日期未公开

推理5

FrontierMath v2 · Tiers 1–3已计入综合排名87.0%
原榜型号claude-fable-5_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 06/10 02:12 · 核验 09/16 02:57 · 实测日期未公开
FrontierMath v2 · Tier 4已计入综合排名90.2%
原榜型号claude-fable-5_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 06/10 02:12 · 核验 09/16 02:57 · 实测日期未公开
Chess Puzzles已计入综合排名41.0%
原榜型号claude-fable-5_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 06/10 04:20 · 核验 09/16 02:57 · 实测日期未公开
Mystery Game Puzzles已计入综合排名52.0%
原榜型号claude-fable-5_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/01 03:05 · 核验 09/16 02:57 · 实测日期未公开
LiveBench · 推理已计入综合排名92.8%
原榜型号claude-fable-5-max-effort
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:57 · 实测日期未公开

知识2

SimpleQA Verified已计入综合排名70.7%
原榜型号claude-fable-5_xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/11 07:44 · 核验 09/16 02:57 · 实测日期未公开
GPQA Diamond已计入综合排名85.9%
原榜型号claude-fable-5_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/07 06:17 · 核验 09/16 02:57 · 实测日期未公开

专业办公3

APEX-Agents 1.1已计入综合排名63.6%
原榜型号claude-fable-5
代表配置Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/08 08:00 · 核验 09/16 02:57 · 实测日期未公开
τ³-Banking已计入综合排名39.7%
原榜型号Claude Fable 5
代表配置Max 推理 · tau3-banking-standard-alltools · tau3-banking:v1.0.1:alltools:gpt-5.2

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 07/23 08:00 · 核验 09/16 02:57 · 实测日期未公开
Vals Finance Agent已计入综合排名56.3%
原榜型号anthropic/claude-fable-5
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:57 · 实测日期未公开

视觉理解1

Arena Vision已计入综合排名1,309.5
原榜型号claude-fable-5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:57 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →