← 返回综合
分类成绩4 / 4 项分类
已有成绩20 项评测
上下文窗口104.9万 Token
API 输入 / 输出 · 每百万 Token¥13.4 / ¥80.4厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

综合名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次29—40 名

已完成的对照中均具备参评资格。保持原候选不变时为 3140 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

DeepSeek V4 Flash 073116 项共同评测共同证据支持对方

双方共同拥有当前榜单 76.4% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,480.31,407.85.0%
Arena Text1,486.81,435.65.0%
Arena WebDev1,446.71,579.92.4%
AA Index29.734.330.0%
Chess Puzzles49.0%33.0%1.8%
FrontierMath v2 · Tiers 1–359.6%57.5%3.6%
FrontierMath v2 · Tier 426.8%24.4%1.2%
GPQA Diamond94.4%91.0%2.0%
Mystery Game Puzzles34.0%34.0%1.2%
SimpleQA Verified73.5%33.6%4.0%
LiveBench · 编程综合60.3%60.9%2.4%
LiveBench · 推理与数学87.5%86.7%4.2%
LiveBench · 语言与指令82.2%72.3%3.0%
APEX-Agents 1.135.3%55.3%4.0%
TapTap Maker64.7%74.6%3.6%
Vals Finance Agent43.0%49.5%3.0%
查看 DeepSeek V4 Flash 0731 的完整证据 →
DeepSeek V4 Pro 081316 项共同评测共同证据支持对方

双方共同拥有当前榜单 76.4% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,480.31,442.35.0%
Arena Text1,486.81,463.45.0%
Arena WebDev1,446.71,580.22.4%
AA Index29.73630.0%
Chess Puzzles49.0%47.0%1.8%
FrontierMath v2 · Tiers 1–359.6%64.6%3.6%
FrontierMath v2 · Tier 426.8%26.8%1.2%
GPQA Diamond94.4%91.7%2.0%
Mystery Game Puzzles34.0%43.0%1.2%
SimpleQA Verified73.5%52.9%4.0%
LiveBench · 编程综合60.3%66.1%2.4%
LiveBench · 推理与数学87.5%90.5%4.2%
LiveBench · 语言与指令82.2%74.9%3.0%
APEX-Agents 1.135.3%47.3%4.0%
TapTap Maker64.7%77.8%3.6%
Vals Finance Agent43.0%50.4%3.0%
查看 DeepSeek V4 Pro 0813 的完整证据 →
GPT-6 Luna5 项共同评测共同证据支持对方

双方共同拥有当前榜单 42.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
AA Index29.737.330.0%
LiveBench · 编程综合60.3%65.1%2.4%
LiveBench · 推理与数学87.5%85.4%4.2%
LiveBench · 语言与指令82.2%64.9%3.0%
Vals Finance Agent43.0%49.9%3.0%
查看 GPT-6 Luna 的完整证据 →
GPT-5.6 Luna20 项共同评测共同证据支持对方

双方共同拥有当前榜单 92.0% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,480.31,4115.0%
Arena Text1,486.81,452.55.0%
Arena Vision1,278.71,258.16.0%
Arena WebDev1,446.71,519.82.4%
AA Index29.737.330.0%
DeepSWE v1.111.7%67.2%3.6%
Chess Puzzles49.0%40.0%1.8%
FrontierMath v2 · Tiers 1–359.6%82.1%3.6%
FrontierMath v2 · Tier 426.8%61.0%1.2%
GPQA Diamond94.4%91.6%2.0%
Mystery Game Puzzles34.0%21.0%1.2%
SimpleQA Verified73.5%41.0%4.0%
Creative Writing v31,488.91,825.83.6%
Longform Writing68.275.52.4%
LiveBench · 编程综合60.3%65.7%2.4%
LiveBench · 推理与数学87.5%86.4%4.2%
LiveBench · 语言与指令82.2%66.3%3.0%
APEX-Agents 1.135.3%43.0%4.0%
TapTap Maker64.7%77.8%3.6%
Vals Finance Agent43.0%55.0%3.0%
查看 GPT-5.6 Luna 的完整证据 →
Claude Sonnet 520 项共同评测共同证据支持对方

双方共同拥有当前榜单 92.0% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
Arena 创作盲选1,480.31,4375.0%
Arena Text1,486.81,461.25.0%
Arena Vision1,278.71,266.36.0%
Arena WebDev1,446.71,537.82.4%
AA Index29.738.230.0%
DeepSWE v1.111.7%53.8%3.6%
Chess Puzzles49.0%16.0%1.8%
FrontierMath v2 · Tiers 1–359.6%65.6%3.6%
FrontierMath v2 · Tier 426.8%29.3%1.2%
GPQA Diamond94.4%80.3%2.0%
Mystery Game Puzzles34.0%35.0%1.2%
SimpleQA Verified73.5%33.7%4.0%
Creative Writing v31,488.91,790.53.6%
Longform Writing68.278.32.4%
LiveBench · 编程综合60.3%70.0%2.4%
LiveBench · 推理与数学87.5%90.8%4.2%
LiveBench · 语言与指令82.2%69.4%3.0%
APEX-Agents 1.135.3%54.5%4.0%
TapTap Maker64.7%76.2%3.6%
Vals Finance Agent43.0%53.9%3.0%
查看 Claude Sonnet 5 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验7

AA Index已计入综合排名29.7
原榜型号gemini-3-1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/23 14:42 · 核验 09/23 14:42 · 实测日期未公开
Creative Writing v3已计入综合排名1,488.9
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/23 14:42 · 实测日期未公开
Longform Writing已计入综合排名68.2
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/23 14:42 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名82.2%两项均分
原榜型号gemini-3.1-pro-preview-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/23 04:51 · 核验 09/23 14:42 · 实测日期未公开

Language + IF 各占 50%,使用未舍入的分项成绩求平均。

  • Language85.4%
  • IF79.1%
Arena Text已计入综合排名1,486.8
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/23 14:42 · 实测日期未公开
Arena WebDev已计入综合排名1,446.7
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/22 08:00 · 核验 09/23 14:42 · 实测日期未公开
Arena 创作盲选已计入综合排名1,480.3
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/23 14:42 · 实测日期未公开

编程3

DeepSWE v1.1已计入综合排名11.7%
原榜型号gemini-3-1-pro-preview
代表配置High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/22 14:27 · 核验 09/23 14:42 · 实测日期未公开
LiveBench · 编程综合已计入综合排名60.3%两项均分
原榜型号gemini-3.1-pro-preview-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/23 04:51 · 核验 09/23 14:42 · 实测日期未公开

Coding + Agentic Coding 各占 50%,使用未舍入的分项成绩求平均。

  • Coding76.5%
  • Agentic Coding44.1%
TapTap Maker已计入综合排名64.7%
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/10 08:00 · 核验 09/23 14:42 · 实测日期未公开

推理5

FrontierMath v2 · Tiers 1–3已计入综合排名59.6%
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 06/12 07:35 · 核验 09/23 14:42 · 实测日期未公开
FrontierMath v2 · Tier 4已计入综合排名26.8%
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 06/12 07:35 · 核验 09/23 14:42 · 实测日期未公开
Chess Puzzles已计入综合排名49.0%
原榜型号gemini-3.1-pro-preview_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/07 06:30 · 核验 09/23 14:42 · 实测日期未公开
Mystery Game Puzzles已计入综合排名34.0%
原榜型号gemini-3.1-pro-preview_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 07/28 02:29 · 核验 09/23 14:42 · 实测日期未公开
LiveBench · 推理与数学已计入综合排名87.5%两项均分
原榜型号gemini-3.1-pro-preview-high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/23 04:51 · 核验 09/23 14:42 · 实测日期未公开

Reasoning + Mathematics 各占 50%,使用未舍入的分项成绩求平均。

  • Reasoning84.0%
  • Mathematics91.0%

知识2

SimpleQA Verified已计入综合排名73.5%
原榜型号gemini-3.1-pro-preview_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/11 05:35 · 核验 09/23 14:42 · 实测日期未公开
GPQA Diamond已计入综合排名94.4%
原榜型号gemini-3.1-pro-preview_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/07 06:30 · 核验 09/23 14:42 · 实测日期未公开

专业办公2

APEX-Agents 1.1已计入综合排名35.3%
原榜型号gemini-3.1-pro-preview-high
代表配置High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/08 08:00 · 核验 09/23 14:42 · 实测日期未公开
Vals Finance Agent已计入综合排名43.0%
原榜型号google/gemini-3.1-pro-preview
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/22 08:00 · 核验 09/23 14:42 · 实测日期未公开

视觉理解1

Arena Vision已计入综合排名1,278.7
原榜型号gemini-3.1-pro-preview
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/13 08:00 · 核验 09/23 14:42 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →