← 返回综合
分类成绩3 / 4 项分类
已有成绩15 项评测
上下文窗口131.1万 Token
API 输入 / 输出 · 每百万 Token¥3 / ¥9厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次25—42 名

已完成的对照中均具备参评资格。保持原候选不变时为 2747 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

DeepSeek V4 Pro 081315 项共同评测共同证据支持对方

双方共同拥有当前榜单 72.4% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,407.81,442.35.0%
Arena Text1,435.61,463.45.0%
Arena WebDev1,580.21,580.52.4%
AA Index34.536.330.0%
Chess Puzzles33.0%47.0%1.8%
FrontierMath v2 · Tiers 1–357.5%64.6%3.6%
FrontierMath v2 · Tier 424.4%26.8%1.2%
GPQA Diamond91.0%91.7%2.0%
Mystery Game Puzzles34.0%43.0%1.2%
SimpleQA Verified33.6%52.9%4.0%
LiveBench · 编程60.9%66.1%2.4%
LiveBench · 推理86.7%90.5%4.2%
LiveBench · 语言与指令72.3%74.9%3.0%
TapTap Maker74.6%77.8%3.6%
Vals Finance Agent49.5%50.4%3.0%
查看 DeepSeek V4 Pro 0813 的完整证据 →
Muse Spark 1.19 项共同评测共同证据支持本模型

双方共同拥有当前榜单 59.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,407.81,451.15.0%
Arena Text1,435.61,492.65.0%
Arena WebDev1,580.21,541.52.4%
AA Index34.534.330.0%
SimpleQA Verified33.6%57.8%4.0%
LiveBench · 编程60.9%67.8%2.4%
LiveBench · 推理86.7%87.4%4.2%
LiveBench · 语言与指令72.3%72.0%3.0%
Vals Finance Agent49.5%57.2%3.0%
查看 Muse Spark 1.1 的完整证据 →
GPT-5.6 Luna15 项共同评测共同证据支持对方

双方共同拥有当前榜单 72.4% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,407.81,4115.0%
Arena Text1,435.61,452.55.0%
Arena WebDev1,580.21,518.92.4%
AA Index34.537.530.0%
Chess Puzzles33.0%40.0%1.8%
FrontierMath v2 · Tiers 1–357.5%82.1%3.6%
FrontierMath v2 · Tier 424.4%61.0%1.2%
GPQA Diamond91.0%91.6%2.0%
Mystery Game Puzzles34.0%21.0%1.2%
SimpleQA Verified33.6%41.0%4.0%
LiveBench · 编程60.9%65.7%2.4%
LiveBench · 推理86.7%86.4%4.2%
LiveBench · 语言与指令72.3%66.3%3.0%
TapTap Maker74.6%77.8%3.6%
Vals Finance Agent49.5%55.0%3.0%
查看 GPT-5.6 Luna 的完整证据 →
Gemini 3.6 Flash14 项共同评测共同证据支持本模型

双方共同拥有当前榜单 68.8% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,407.81,469.85.0%
Arena Text1,435.61,479.95.0%
Arena WebDev1,580.21,5372.4%
AA Index34.534.330.0%
Chess Puzzles33.0%40.0%1.8%
FrontierMath v2 · Tiers 1–357.5%58.9%3.6%
FrontierMath v2 · Tier 424.4%22.0%1.2%
GPQA Diamond91.0%94.1%2.0%
Mystery Game Puzzles34.0%30.0%1.2%
SimpleQA Verified33.6%66.2%4.0%
LiveBench · 编程60.9%60.6%2.4%
LiveBench · 推理86.7%85.8%4.2%
LiveBench · 语言与指令72.3%79.6%3.0%
Vals Finance Agent49.5%56.3%3.0%
查看 Gemini 3.6 Flash 的完整证据 →
Claude Sonnet 515 项共同评测共同证据支持对方

双方共同拥有当前榜单 72.4% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,407.81,4375.0%
Arena Text1,435.61,461.25.0%
Arena WebDev1,580.21,536.72.4%
AA Index34.538.430.0%
Chess Puzzles33.0%16.0%1.8%
FrontierMath v2 · Tiers 1–357.5%65.6%3.6%
FrontierMath v2 · Tier 424.4%29.3%1.2%
GPQA Diamond91.0%80.3%2.0%
Mystery Game Puzzles34.0%35.0%1.2%
SimpleQA Verified33.6%33.7%4.0%
LiveBench · 编程60.9%70.0%2.4%
LiveBench · 推理86.7%90.8%4.2%
LiveBench · 语言与指令72.3%69.4%3.0%
TapTap Maker74.6%76.2%3.6%
Vals Finance Agent49.5%53.9%3.0%
查看 Claude Sonnet 5 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验5

AA Index已计入综合排名34.5
原榜型号deepseek-v4-flash
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/15 14:00 · 核验 09/15 17:11 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名72.3%
原榜型号deepseek-v4-flash-0731
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开
Arena Text已计入综合排名1,435.6
原榜型号deepseek-v4-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开
Arena WebDev已计入综合排名1,580.2
原榜型号deepseek-v4-flash-high
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:00 · 实测日期未公开
Arena 创作盲选已计入综合排名1,407.8
原榜型号deepseek-v4-flash
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/16 02:00 · 实测日期未公开

编程2

LiveBench · 编程已计入综合排名60.9%
原榜型号deepseek-v4-flash-0731
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开
TapTap Maker已计入综合排名74.6%
原榜型号deepseek-v4-flash
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 08:00 · 核验 09/16 02:00 · 实测日期未公开

推理5

FrontierMath v2 · Tiers 1–3已计入综合排名57.5%
原榜型号deepseek-v4-flash-0731_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/02 10:15 · 核验 09/16 02:00 · 实测日期未公开
FrontierMath v2 · Tier 4已计入综合排名24.4%
原榜型号deepseek-v4-flash-0731_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/02 10:15 · 核验 09/16 02:00 · 实测日期未公开
Chess Puzzles已计入综合排名33.0%
原榜型号deepseek-v4-flash-0731_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/02 08:22 · 核验 09/16 02:00 · 实测日期未公开
Mystery Game Puzzles已计入综合排名34.0%
原榜型号deepseek-v4-flash-0731_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/06 07:40 · 核验 09/16 02:00 · 实测日期未公开
LiveBench · 推理已计入综合排名86.7%
原榜型号deepseek-v4-flash-0731
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 23:13 · 核验 09/16 02:00 · 实测日期未公开

知识2

SimpleQA Verified已计入综合排名33.6%
原榜型号deepseek-v4-flash-0731_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/28 03:30 · 核验 09/16 02:00 · 实测日期未公开
GPQA Diamond已计入综合排名91.0%
原榜型号deepseek-v4-flash-0731_max
代表配置Max 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/02 08:22 · 核验 09/16 02:00 · 实测日期未公开

专业办公1

Vals Finance Agent已计入综合排名49.5%
原榜型号deepseek/deepseek-v4-flash-0731
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/11 08:00 · 核验 09/16 02:00 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →