← 返回综合
分类成绩3 / 4 项分类
已有成绩19 项评测
上下文窗口100万 Token
API 输入 / 输出 · 每百万 Token¥33.56 / ¥167.79厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次14—15 名

已完成的对照中均具备参评资格。保持原候选不变时为 1415 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

GLM-5.3 Flash15 项共同评测共同证据支持对方

双方共同拥有当前榜单 74.8% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,488.41,434.95.0%
Arena Text1,501.71,475.45.0%
Arena Vision1,300.91,274.86.0%
Arena WebDev1,555.21,607.12.4%
AA Index40.741.930.0%
Chess Puzzles7.0%14.0%1.8%
FrontierMath v2 · Tiers 1–370.2%55.8%3.6%
FrontierMath v2 · Tier 431.7%17.1%1.2%
GPQA Diamond86.4%90.2%2.0%
Mystery Game Puzzles28.0%8.0%1.2%
LiveBench · 编程66.4%67.9%2.4%
LiveBench · 推理90.0%79.4%4.2%
LiveBench · 语言与指令72.3%65.1%3.0%
APEX-Agents 1.149.2%52.8%4.0%
Vals Finance Agent51.5%57.9%3.0%
查看 GLM-5.3 Flash 的完整证据 →
Qwen3.8 Max16 项共同评测共同证据支持本模型

双方共同拥有当前榜单 76.8% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,488.41,471.55.0%
Arena Text1,501.71,480.65.0%
Arena Vision1,300.91,301.86.0%
Arena WebDev1,555.21,670.62.4%
AA Index40.740.330.0%
Chess Puzzles7.0%29.0%1.8%
FrontierMath v2 · Tiers 1–370.2%74.7%3.6%
FrontierMath v2 · Tier 431.7%46.3%1.2%
GPQA Diamond86.4%92.7%2.0%
Mystery Game Puzzles28.0%38.0%1.2%
SimpleQA Verified51.7%45.8%4.0%
LiveBench · 编程66.4%68.8%2.4%
LiveBench · 推理90.0%89.8%4.2%
LiveBench · 语言与指令72.3%76.9%3.0%
τ³-Banking40.2%55.2%2.0%
Vals Finance Agent51.5%50.6%3.0%
查看 Qwen3.8 Max 的完整证据 →
Qwen3.8 Max 09026 项共同评测共同证据支持本模型

双方共同拥有当前榜单 15.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,555.21,680.82.4%
Chess Puzzles7.0%40.0%1.8%
FrontierMath v2 · Tiers 1–370.2%65.6%3.6%
FrontierMath v2 · Tier 431.7%34.1%1.2%
GPQA Diamond86.4%92.3%2.0%
SimpleQA Verified51.7%47.3%4.0%
查看 Qwen3.8 Max 0902 的完整证据 →
Qwen3.8 Flash Next5 项共同评测共同证据支持本模型

双方共同拥有当前榜单 42.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,555.21,635.32.4%
AA Index40.739.930.0%
LiveBench · 编程66.4%67.1%2.4%
LiveBench · 推理90.0%86.6%4.2%
LiveBench · 语言与指令72.3%75.9%3.0%
查看 Qwen3.8 Flash Next 的完整证据 →
Gemini 3.8 Flash17 项共同评测共同证据支持对方

双方共同拥有当前榜单 78.8% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,488.41,495.95.0%
Arena Text1,501.71,4935.0%
Arena WebDev1,555.21,567.92.4%
AA Index40.741.230.0%
Chess Puzzles7.0%61.0%1.8%
FrontierMath v2 · Tiers 1–370.2%68.4%3.6%
FrontierMath v2 · Tier 431.7%22.0%1.2%
GPQA Diamond86.4%95.4%2.0%
Mystery Game Puzzles28.0%47.0%1.2%
SimpleQA Verified51.7%69.7%4.0%
Creative Writing v31,907.11,749.73.6%
Longform Writing81.876.82.4%
LiveBench · 编程66.4%63.4%2.4%
LiveBench · 推理90.0%90.4%4.2%
LiveBench · 语言与指令72.3%84.6%3.0%
APEX-Agents 1.149.2%64.3%4.0%
Vals Finance Agent51.5%61.4%3.0%
查看 Gemini 3.8 Flash 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验7

AA Index已计入综合排名40.7
原榜型号claude-opus-4-7
代表配置Max 推理 · 自适应

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/16 02:57 · 核验 09/16 03:10 · 实测日期未公开
Creative Writing v3已计入综合排名1,907.1
原榜型号claude-opus-4-7
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/16 03:10 · 实测日期未公开
Longform Writing已计入综合排名81.8
原榜型号claude-opus-4-7
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/16 03:10 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名72.3%
原榜型号claude-opus-4-7-xhigh-effort
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 03:10 · 实测日期未公开
Arena Text已计入综合排名1,501.7
原榜型号claude-opus-4-7-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 03:10 · 实测日期未公开
Arena WebDev已计入综合排名1,555.2
原榜型号claude-opus-4-7-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 03:10 · 实测日期未公开
Arena 创作盲选已计入综合排名1,488.4
原榜型号claude-opus-4-7-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 03:10 · 实测日期未公开

编程1

LiveBench · 编程已计入综合排名66.4%
原榜型号claude-opus-4-7-xhigh-effort
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 03:10 · 实测日期未公开

推理5

FrontierMath v2 · Tiers 1–3已计入综合排名70.2%
原榜型号claude-opus-4-7_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 06/11 05:41 · 核验 09/16 03:10 · 实测日期未公开
FrontierMath v2 · Tier 4已计入综合排名31.7%
原榜型号claude-opus-4-7_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 06/11 05:41 · 核验 09/16 03:10 · 实测日期未公开
Chess Puzzles已计入综合排名7.0%
原榜型号claude-opus-4-7_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/07 06:19 · 核验 09/16 03:10 · 实测日期未公开
Mystery Game Puzzles已计入综合排名28.0%
原榜型号claude-opus-4-7_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 07/25 09:43 · 核验 09/16 03:10 · 实测日期未公开
LiveBench · 推理已计入综合排名90.0%
原榜型号claude-opus-4-7-xhigh-effort
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 03:10 · 实测日期未公开

知识2

SimpleQA Verified已计入综合排名51.7%
原榜型号claude-opus-4-7_xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/28 03:27 · 核验 09/16 03:10 · 实测日期未公开
GPQA Diamond已计入综合排名86.4%
原榜型号claude-opus-4-7_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/07 06:19 · 核验 09/16 03:10 · 实测日期未公开

专业办公3

APEX-Agents 1.1已计入综合排名49.2%
原榜型号claude-opus-4-7
代表配置Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/08 08:00 · 核验 09/16 03:10 · 实测日期未公开
τ³-Banking已计入综合排名40.2%
原榜型号Claude Opus 4.7
代表配置Max 推理 · tau3-banking-standard-alltools · tau3-banking:v1.0.1:alltools:gpt-5.2

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 07/23 08:00 · 核验 09/16 03:10 · 实测日期未公开
Vals Finance Agent已计入综合排名51.5%
原榜型号anthropic/claude-opus-4-7
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 03:10 · 实测日期未公开

视觉理解1

Arena Vision已计入综合排名1,300.9
原榜型号claude-opus-4-7-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 03:10 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →