← 返回编程
xAI

Grok 4.5

2026-07-08 发布 · 09/10 06:31 更新

综合共识指数59.8综合榜第 20 名
分类成绩4 / 4 项分类
已有成绩19 项评测
上下文窗口50万 Token
API 输入 / 输出 · 每百万 Token¥13.42 / ¥40.25厂商官方价格 ↗
CAPABILITY PROFILE

各有所长,看得更清楚。

每项能力单独计算。没有足够的实测,就留空。

不同分类的分数反映各自参照组中的表现,不能直接相加或用来比较不同能力的绝对高低。

UNDERSTANDING THE RANK

编程名次,有多稳定?

依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。

重新检查资格后的名次14—23 名

已完成的对照中均具备参评资格。保持原候选不变时为 1925 名。这个范围不是置信区间,也不包含从未公开的成绩。

查看与附近模型的共同证据

净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。

DeepSeek V4 Pro Preview2 项共同评测共同证据支持对方

双方共同拥有当前榜单 62.5% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
DeepSWE v1.153.8%62.8%37.5%
LiveBench · 编程62.5%56.3%25.0%
查看 DeepSeek V4 Pro Preview 的完整证据 →
GPT-5.42 项共同评测共同证据支持本模型

双方共同拥有当前榜单 62.5% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
DeepSWE v1.153.8%51.8%37.5%
LiveBench · 编程62.5%65.7%25.0%
查看 GPT-5.4 的完整证据 →
DeepSeek V4 Pro 08132 项共同评测共同证据支持对方

双方共同拥有当前榜单 62.5% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
LiveBench · 编程62.5%66.1%25.0%
TapTap Maker78.3%77.8%37.5%
查看 DeepSeek V4 Pro 0813 的完整证据 →
DeepSeek V4 Flash Preview2 项共同评测共同证据支持本模型

双方共同拥有当前榜单 62.5% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
DeepSWE v1.153.8%53.3%37.5%
LiveBench · 编程62.5%53.4%25.0%
查看 DeepSeek V4 Flash Preview 的完整证据 →
Muse Spark 1.22 项共同评测共同证据支持对方

双方共同拥有当前榜单 62.5% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。

共同评测本模型对方票权
DeepSWE v1.153.8%54.9%37.5%
LiveBench · 编程62.5%67.6%25.0%
查看 Muse Spark 1.2 的完整证据 →
BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验6

AA Index已计入综合排名39.1
原榜型号grok-4-5
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/10 06:31 · 核验 09/10 06:31 · 实测日期未公开
Creative Writing v3已计入综合排名1,576
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/07 12:49 · 核验 09/10 06:31 · 实测日期未公开
LiveBench · 语言与指令已计入综合排名77.2%
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/08 03:32 · 核验 09/10 06:31 · 实测日期未公开
Arena Text已计入综合排名1,471.1
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/02 08:00 · 核验 09/10 06:31 · 实测日期未公开
Arena WebDev已计入综合排名1,555.5
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/08 08:00 · 核验 09/10 06:31 · 实测日期未公开
Arena 创作盲选已计入综合排名1,451.2
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/02 08:00 · 核验 09/10 06:31 · 实测日期未公开

编程3

DeepSWE v1.1已计入综合排名53.8%
原榜型号grok-4-5
代表配置High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/04 06:24 · 核验 09/10 06:31 · 实测日期未公开
LiveBench · 编程已计入综合排名62.5%
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/08 03:32 · 核验 09/10 06:31 · 实测日期未公开
TapTap Maker已计入综合排名78.3%
原榜型号grok-4.5
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/07 08:00 · 核验 09/10 06:31 · 实测日期未公开

推理4

FrontierMath v2 · Tiers 1–3已计入综合排名57.2%
原榜型号grok-4.5_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 07/09 09:53 · 核验 09/10 06:31 · 实测日期未公开
FrontierMath v2 · Tier 4已计入综合排名24.4%
原榜型号grok-4.5_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 07/09 09:53 · 核验 09/10 06:31 · 实测日期未公开
Chess Puzzles已计入综合排名36.0%
原榜型号grok-4.5_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 07/09 07:54 · 核验 09/10 06:31 · 实测日期未公开
LiveBench · 推理已计入综合排名89.0%
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 09/08 03:32 · 核验 09/10 06:31 · 实测日期未公开

知识2

SimpleQA Verified已计入综合排名48.3%
原榜型号grok-4.5_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 08/28 03:29 · 核验 09/10 06:31 · 实测日期未公开
GPQA Diamond已计入综合排名93.4%
原榜型号grok-4.5_high
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 07/09 07:54 · 核验 09/10 06:31 · 实测日期未公开

专业办公3

APEX-Agents 1.1已计入综合排名56.2%
原榜型号grok-4-5
代表配置High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 09/08 08:00 · 核验 09/10 06:31 · 实测日期未公开
τ³-Banking已计入综合排名47.9%
原榜型号Grok 4.5
代表配置High 推理 · tau3-banking-standard-alltools · tau3-banking:v1.0.1:alltools:gpt-5.2

该来源对所有模型使用同一受控系统;按预先固定的推理档位优先级选择,配置明细保留,成绩归到基础模型。

本轮采用记录来源数据 07/24 08:00 · 核验 09/10 06:31 · 实测日期未公开
Vals Finance Agent已计入综合排名48.3%
原榜型号grok/grok-4.5
代表配置High 推理

按预先固定的规则,采用该来源可用的最高第一方推理档位;选择不参考跑分高低。

本轮采用记录来源数据 09/05 08:00 · 核验 09/10 06:31 · 实测日期未公开

视觉理解1

Arena Vision已计入综合排名1,282.2
原榜型号grok-4.5
代表配置来源默认配置

该来源没有区分推理档位,采用其官方默认配置。

本轮采用记录来源数据 08/27 08:00 · 核验 09/10 06:31 · 实测日期未公开
还有一些未知

缺失的评测不会记成零分。模型的名次会随新证据变化,分数相近时不宜过度解读细小差距。

了解计算方法 →