← 返回综合
分类成绩0 / 4 项分类
已有成绩5 项评测
上下文窗口 Token
API 输入 / 输出 · 每百万 Token¥0.8 / ¥2.7厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次16—17 名

7 个情景下参评证据不足。保持原候选不变时为 1617 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

Qwen3.8 Max5 项共同评测共同证据支持对方

双方共同拥有当前榜单 42.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,635.31,670.62.4%
AA Index39.940.330.0%
LiveBench · 编程67.1%68.8%2.4%
LiveBench · 推理86.6%89.8%4.2%
LiveBench · 语言与指令75.9%76.9%3.0%
查看 Qwen3.8 Max 的完整证据 →
Muse Spark 1.25 项共同评测共同证据支持本模型

双方共同拥有当前榜单 42.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,635.31,534.42.4%
AA Index39.939.830.0%
LiveBench · 编程67.1%67.6%2.4%
LiveBench · 推理86.6%90.6%4.2%
LiveBench · 语言与指令75.9%76.4%3.0%
查看 Muse Spark 1.2 的完整证据 →
Claude Opus 4.75 项共同评测共同证据支持对方

双方共同拥有当前榜单 42.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,635.31,555.22.4%
AA Index39.940.730.0%
LiveBench · 编程67.1%66.4%2.4%
LiveBench · 推理86.6%90.0%4.2%
LiveBench · 语言与指令75.9%72.3%3.0%
查看 Claude Opus 4.7 的完整证据 →
DeepSeek V4.1 Flash5 项共同评测共同证据支持本模型

双方共同拥有当前榜单 42.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,635.31,6142.4%
AA Index39.939.530.0%
LiveBench · 编程67.1%78.7%2.4%
LiveBench · 推理86.6%90.0%4.2%
LiveBench · 语言与指令75.9%75.6%3.0%
查看 DeepSeek V4.1 Flash 的完整证据 →
GLM-5.3 Flash5 项共同评测共同证据支持对方

双方共同拥有当前榜单 42.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,635.31,607.12.4%
AA Index39.941.930.0%
LiveBench · 编程67.1%67.9%2.4%
LiveBench · 推理86.6%79.4%4.2%
LiveBench · 语言与指令75.9%65.1%3.0%
查看 GLM-5.3 Flash 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验3

AA Index已计入综合排名39.9
原榜型号qwen3-8-flash-next
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/15 14:00 · 核验 09/15 17:11 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名75.9%
原榜型号qwen3.8-flash-next
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开
Arena WebDev已计入综合排名1,635.3
原榜型号qwen3.8-flash-next
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:00 · 实测日期未公开

编程1

LiveBench · 编程已计入综合排名67.1%
原榜型号qwen3.8-flash-next
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开

推理1

LiveBench · 推理已计入综合排名86.6%
原榜型号qwen3.8-flash-next
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →