← 返回综合
分类成绩3 / 4 项分类
已有成绩17 项评测
上下文窗口131.1万 Token
API 输入 / 输出 · 每百万 Token¥0.8 / ¥2.8厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次12—30 名

已完成的对照中均具备参评资格。保持原候选不变时为 1231 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

Qwen3.8 Max 09026 项共同评测共同证据支持对方

双方共同拥有当前榜单 14.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,607.11,680.82.4%
Chess Puzzles14.0%40.0%1.8%
FrontierMath v2 · Tiers 1–355.8%65.6%3.6%
FrontierMath v2 · Tier 417.1%34.1%1.2%
GPQA Diamond90.2%92.3%2.0%
TapTap Maker81.5%83.3%3.6%
查看 Qwen3.8 Max 0902 的完整证据 →
Claude Opus 4.715 项共同评测共同证据支持本模型

双方共同拥有当前榜单 74.8% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,434.91,488.45.0%
Arena Text1,475.41,501.75.0%
Arena Vision1,274.81,300.96.0%
Arena WebDev1,607.11,555.22.4%
AA Index41.940.730.0%
Chess Puzzles14.0%7.0%1.8%
FrontierMath v2 · Tiers 1–355.8%70.2%3.6%
FrontierMath v2 · Tier 417.1%31.7%1.2%
GPQA Diamond90.2%86.4%2.0%
Mystery Game Puzzles8.0%28.0%1.2%
LiveBench · 编程67.9%66.4%2.4%
LiveBench · 推理79.4%90.0%4.2%
LiveBench · 语言与指令65.1%72.3%3.0%
APEX-Agents 1.152.8%49.2%4.0%
Vals Finance Agent57.9%51.5%3.0%
查看 Claude Opus 4.7 的完整证据 →
Gemini 3.8 Flash16 项共同评测共同证据支持对方

双方共同拥有当前榜单 76.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,434.91,495.95.0%
Arena Text1,475.41,4935.0%
Arena WebDev1,607.11,567.92.4%
AA Index41.941.230.0%
DeepSWE v1.163.4%73.8%3.6%
Chess Puzzles14.0%61.0%1.8%
FrontierMath v2 · Tiers 1–355.8%68.4%3.6%
FrontierMath v2 · Tier 417.1%22.0%1.2%
GPQA Diamond90.2%95.4%2.0%
Mystery Game Puzzles8.0%47.0%1.2%
LiveBench · 编程67.9%63.4%2.4%
LiveBench · 推理79.4%90.4%4.2%
LiveBench · 语言与指令65.1%84.6%3.0%
APEX-Agents 1.152.8%64.3%4.0%
TapTap Maker81.5%86.8%3.6%
Vals Finance Agent57.9%61.4%3.0%
查看 Gemini 3.8 Flash 的完整证据 →
Qwen3.8 Max16 项共同评测共同证据支持对方

双方共同拥有当前榜单 78.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,434.91,471.55.0%
Arena Text1,475.41,480.65.0%
Arena Vision1,274.81,301.86.0%
Arena WebDev1,607.11,670.62.4%
AA Index41.940.330.0%
DeepSWE v1.163.4%57.5%3.6%
Chess Puzzles14.0%29.0%1.8%
FrontierMath v2 · Tiers 1–355.8%74.7%3.6%
FrontierMath v2 · Tier 417.1%46.3%1.2%
GPQA Diamond90.2%92.7%2.0%
Mystery Game Puzzles8.0%38.0%1.2%
LiveBench · 编程67.9%68.8%2.4%
LiveBench · 推理79.4%89.8%4.2%
LiveBench · 语言与指令65.1%76.9%3.0%
TapTap Maker81.5%82.5%3.6%
Vals Finance Agent57.9%50.6%3.0%
查看 Qwen3.8 Max 的完整证据 →
Claude Opus 4.817 项共同评测共同证据支持对方

双方共同拥有当前榜单 82.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,434.91,464.55.0%
Arena Text1,475.41,481.45.0%
Arena Vision1,274.81,283.46.0%
Arena WebDev1,607.11,558.82.4%
AA Index41.94230.0%
DeepSWE v1.163.4%59.0%3.6%
Chess Puzzles14.0%34.0%1.8%
FrontierMath v2 · Tiers 1–355.8%80.0%3.6%
FrontierMath v2 · Tier 417.1%56.1%1.2%
GPQA Diamond90.2%91.0%2.0%
Mystery Game Puzzles8.0%36.0%1.2%
LiveBench · 编程67.9%66.2%2.4%
LiveBench · 推理79.4%91.8%4.2%
LiveBench · 语言与指令65.1%75.8%3.0%
APEX-Agents 1.152.8%48.9%4.0%
TapTap Maker81.5%82.8%3.6%
Vals Finance Agent57.9%53.9%3.0%
查看 Claude Opus 4.8 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验5

AA Index已计入综合排名41.9
原榜型号glm-5-3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/15 14:00 · 核验 09/15 17:11 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名65.1%
原榜型号glm-5.3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开
Arena Text已计入综合排名1,475.4
原榜型号glm-5.3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开
Arena WebDev已计入综合排名1,607.1
原榜型号glm-5.3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:00 · 实测日期未公开
Arena 创作盲选已计入综合排名1,434.9
原榜型号glm-5.3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开

编程3

DeepSWE v1.1已计入综合排名63.4%
原榜型号glm-5-3-flash
代表配置Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/04 06:24 · 核验 09/16 02:00 · 实测日期未公开
LiveBench · 编程已计入综合排名67.9%
原榜型号glm-5.3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开
TapTap Maker已计入综合排名81.5%
原榜型号glm-5.3-flash
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 08:00 · 核验 09/16 02:00 · 实测日期未公开

推理5

FrontierMath v2 · Tiers 1–3已计入综合排名55.8%
原榜型号glm-5.3-flash_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/27 21:29 · 核验 09/16 02:00 · 实测日期未公开
FrontierMath v2 · Tier 4已计入综合排名17.1%
原榜型号glm-5.3-flash_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/27 21:29 · 核验 09/16 02:00 · 实测日期未公开
Chess Puzzles已计入综合排名14.0%
原榜型号glm-5.3-flash_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/27 06:26 · 核验 09/16 02:00 · 实测日期未公开
Mystery Game Puzzles已计入综合排名8.0%
原榜型号glm-5.3-flash_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/28 22:38 · 核验 09/16 02:00 · 实测日期未公开
LiveBench · 推理已计入综合排名79.4%
原榜型号glm-5.3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开

知识1

GPQA Diamond已计入综合排名90.2%
原榜型号glm-5.3-flash_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/27 06:26 · 核验 09/16 02:00 · 实测日期未公开

专业办公2

APEX-Agents 1.1已计入综合排名52.8%
原榜型号glm-5-3-flash
代表配置Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/08 08:00 · 核验 09/16 02:00 · 实测日期未公开
Vals Finance Agent已计入综合排名57.9%
原榜型号zai/glm-5.3-flash
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:00 · 实测日期未公开

视觉理解1

Arena Vision已计入综合排名1,274.8
原榜型号glm-5.3-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →