← 返回综合
分类成绩2 / 4 项分类
已有成绩13 项评测
上下文窗口105万 Token
API 输入 / 输出 · 每百万 Token¥16.78 / ¥100.67厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次20—24 名

已完成的对照中均具备参评资格。保持原候选不变时为 2225 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

GPT-5.513 项共同评测共同证据支持对方

双方共同拥有当前榜单 73.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,444.21,451.15.0%
Arena Text1,476.41,481.85.0%
Arena Vision1,284.81,283.46.0%
Arena WebDev1,4631,510.12.4%
AA Index3938.630.0%
DeepSWE v1.151.8%67.0%3.6%
Creative Writing v31,835.61,843.53.6%
Longform Writing78.378.22.4%
LiveBench · 编程65.7%68.1%2.4%
LiveBench · 推理91.1%92.8%4.2%
LiveBench · 语言与指令76.4%79.0%3.0%
APEX-Agents 1.152.4%55.1%4.0%
τ³-Banking39.4%44.6%2.0%
查看 GPT-5.5 的完整证据 →
Claude Sonnet 512 项共同评测共同证据支持本模型

双方共同拥有当前榜单 71.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,444.21,4375.0%
Arena Text1,476.41,461.25.0%
Arena Vision1,284.81,266.36.0%
Arena WebDev1,4631,536.72.4%
AA Index3938.430.0%
DeepSWE v1.151.8%53.8%3.6%
Creative Writing v31,835.61,790.53.6%
Longform Writing78.378.32.4%
LiveBench · 编程65.7%70.0%2.4%
LiveBench · 推理91.1%90.8%4.2%
LiveBench · 语言与指令76.4%69.4%3.0%
APEX-Agents 1.152.4%54.5%4.0%
查看 Claude Sonnet 5 的完整证据 →
Grok 4.512 项共同评测共同证据支持对方

双方共同拥有当前榜单 71.2% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,444.21,450.45.0%
Arena Text1,476.41,468.15.0%
Arena Vision1,284.81,279.56.0%
Arena WebDev1,4631,555.12.4%
AA Index3939.130.0%
DeepSWE v1.151.8%53.8%3.6%
Creative Writing v31,835.61,5763.6%
LiveBench · 编程65.7%62.5%2.4%
LiveBench · 推理91.1%89.0%4.2%
LiveBench · 语言与指令76.4%77.2%3.0%
APEX-Agents 1.152.4%56.2%4.0%
τ³-Banking39.4%47.9%2.0%
查看 Grok 4.5 的完整证据 →
GPT-5.6 Luna11 项共同评测共同证据支持本模型

双方共同拥有当前榜单 67.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,444.21,4115.0%
Arena Text1,476.41,452.55.0%
Arena Vision1,284.81,258.16.0%
Arena WebDev1,4631,518.92.4%
AA Index3937.530.0%
DeepSWE v1.151.8%67.2%3.6%
Creative Writing v31,835.61,825.83.6%
Longform Writing78.375.52.4%
LiveBench · 编程65.7%65.7%2.4%
LiveBench · 推理91.1%86.4%4.2%
LiveBench · 语言与指令76.4%66.3%3.0%
查看 GPT-5.6 Luna 的完整证据 →
Gemini 3.7 Flash10 项共同评测共同证据支持对方

双方共同拥有当前榜单 63.2% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,444.21,494.85.0%
Arena Text1,476.41,489.85.0%
Arena WebDev1,4631,587.32.4%
AA Index3939.430.0%
DeepSWE v1.151.8%65.3%3.6%
Creative Writing v31,835.61,7223.6%
LiveBench · 编程65.7%68.6%2.4%
LiveBench · 推理91.1%90.6%4.2%
LiveBench · 语言与指令76.4%82.7%3.0%
APEX-Agents 1.152.4%67.8%4.0%
查看 Gemini 3.7 Flash 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验7

AA Index已计入综合排名39
原榜型号gpt-5-4
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/15 14:00 · 核验 09/15 17:11 · 实测日期未公开
Creative Writing v3已计入综合排名1,835.6
原榜型号gpt-5.4
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/16 02:00 · 实测日期未公开
Longform Writing已计入综合排名78.3
原榜型号gpt-5.4
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/16 02:00 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名76.4%
原榜型号gpt-5.4-xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开
Arena Text已计入综合排名1,476.4
原榜型号gpt-5.4-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开
Arena WebDev已计入综合排名1,463
原榜型号gpt-5.4-high (codex-harness)
代表配置High 推理 · codex-harness

按预先固定的配置优先级选为代表行;配置明细保留,成绩归到基础模型参与 LatentRank。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:00 · 实测日期未公开
Arena 创作盲选已计入综合排名1,444.2
原榜型号gpt-5.4-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开

编程2

DeepSWE v1.1已计入综合排名51.8%
原榜型号gpt-5-4
代表配置xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/04 06:24 · 核验 09/16 02:00 · 实测日期未公开
LiveBench · 编程已计入综合排名65.7%
原榜型号gpt-5.4-xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开

推理1

LiveBench · 推理已计入综合排名91.1%
原榜型号gpt-5.4-xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开

专业办公2

APEX-Agents 1.1已计入综合排名52.4%
原榜型号responses/gpt-5.4
代表配置xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/08 08:00 · 核验 09/16 02:00 · 实测日期未公开
τ³-Banking已计入综合排名39.4%
原榜型号GPT-5.4
代表配置xHigh 推理 · tau3-banking-standard-alltools · tau3-banking:v1.0.1:alltools:gpt-5.2

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 05/06 08:00 · 核验 09/16 02:00 · 实测日期未公开

视觉理解1

Arena Vision已计入综合排名1,284.8
原榜型号gpt-5.4-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →