← 返回综合
Alibaba

Qwen3.8 Max 0902

2026-09-01 发布 · 09/10 06:31 更新

综合共识指数66.3综合榜第 14 名
分类成绩1 / 4 项分类
已有成绩7 项评测
上下文窗口100万 Token
API 输入 / 输出 · 每百万 Token待核实
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的表现,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次7—19 名

5 个情景下参评证据不足。保持原候选不变时为 520 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

Gemini 3.8 Flash7 项共同评测共同证据支持对方

双方共同拥有当前榜单 18.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,685.21,568.22.4%
Chess Puzzles40.0%61.0%1.8%
FrontierMath v2 · Tiers 1–365.6%68.4%3.6%
FrontierMath v2 · Tier 434.1%22.0%1.2%
GPQA Diamond92.3%95.4%2.0%
SimpleQA Verified47.3%69.7%4.0%
TapTap Maker83.3%86.8%3.6%
查看 Gemini 3.8 Flash 的完整证据 →
GLM-5.3 Flash6 项共同评测共同证据支持本模型

双方共同拥有当前榜单 14.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,685.21,604.52.4%
Chess Puzzles40.0%14.0%1.8%
FrontierMath v2 · Tiers 1–365.6%55.8%3.6%
FrontierMath v2 · Tier 434.1%17.1%1.2%
GPQA Diamond92.3%90.2%2.0%
TapTap Maker83.3%81.5%3.6%
查看 GLM-5.3 Flash 的完整证据 →
Claude Opus 4.87 项共同评测共同证据支持对方

双方共同拥有当前榜单 18.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,685.21,5612.4%
Chess Puzzles40.0%34.0%1.8%
FrontierMath v2 · Tiers 1–365.6%80.0%3.6%
FrontierMath v2 · Tier 434.1%56.1%1.2%
GPQA Diamond92.3%91.0%2.0%
SimpleQA Verified47.3%53.0%4.0%
TapTap Maker83.3%82.8%3.6%
查看 Claude Opus 4.8 的完整证据 →
Claude Opus 4.76 项共同评测共同证据支持对方

双方共同拥有当前榜单 15.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,685.21,555.12.4%
Chess Puzzles40.0%7.0%1.8%
FrontierMath v2 · Tiers 1–365.6%70.2%3.6%
FrontierMath v2 · Tier 434.1%31.7%1.2%
GPQA Diamond92.3%86.4%2.0%
SimpleQA Verified47.3%51.7%4.0%
查看 Claude Opus 4.7 的完整证据 →
Qwen3.8 Flash Next1 项共同评测共同证据支持本模型

双方共同拥有当前榜单 2.4% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena WebDev1,685.21,630.52.4%
查看 Qwen3.8 Flash Next 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验1

Arena WebDev已计入综合排名1,685.2
原榜型号qwen3.8-max-0902
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/08 08:00 · 核验 09/10 06:31 · 实测日期未公开

编程1

TapTap Maker已计入综合排名83.3%
原榜型号qwen3.8-max-0902
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/07 08:00 · 核验 09/10 06:31 · 实测日期未公开

推理3

FrontierMath v2 · Tiers 1–3已计入综合排名65.6%
原榜型号qwen3.8-max-0902_xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/03 02:04 · 核验 09/10 06:31 · 实测日期未公开
FrontierMath v2 · Tier 4已计入综合排名34.1%
原榜型号qwen3.8-max-0902_xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/03 02:04 · 核验 09/10 06:31 · 实测日期未公开
Chess Puzzles已计入综合排名40.0%
原榜型号qwen3.8-max-0902_xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/03 02:04 · 核验 09/10 06:31 · 实测日期未公开

知识2

SimpleQA Verified已计入综合排名47.3%
原榜型号qwen3.8-max-0902_xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/03 02:04 · 核验 09/10 06:31 · 实测日期未公开
GPQA Diamond已计入综合排名92.3%
原榜型号qwen3.8-max-0902_xhigh
代表配置xHigh 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/03 02:04 · 核验 09/10 06:31 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →