← 返回综合榜CAPABILITY PROFILE UNDERSTANDING THE RANK
查看 Muse Spark 1.3 的完整证据 →
查看 GLM-5.3 的完整证据 →
查看 Claude Opus 5 的完整证据 →
查看 Grok 4.6 的完整证据 →
查看 Claude Fable 5 的完整证据 →BEHIND THE SCORE
GPT-5.6 Sol
OpenAI · 2026-07-09 发布 · 09/16 01:02 更新
分类成绩4 / 4 项分类
已有成绩21 项评测
上下文窗口105万 Token
API 输入 / 输出 · 每百万 Token¥26.85 / ¥134.23厂商官方价格 ↗
各有所长,看得更清楚。
每项能力单独计算。没有足够的实测,就留空。
不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。
综合名次,有多稳定?
依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。
重新检查资格后的名次6—7 名
已完成的对照中均具备参评资格。保持原候选不变时为 6—7 名。这个范围不是置信区间,也不包含从未公开的成绩。
查看与附近模型的共同证据
净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。
Muse Spark 1.312 项共同评测共同证据支持对方
双方共同拥有当前榜单 71.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,473.1 | 1,452.8 | 5.0% |
| Arena Text ↗ | 1,483.5 | 1,493.1 | 5.0% |
| Arena Vision ↗ | 1,285.9 | 1,294.1 | 6.0% |
| Arena WebDev ↗ | 1,617.3 | 1,651.9 | 2.4% |
| AA Index ↗ | 47.1 | 48.2 | 30.0% |
| Creative Writing v3 ↗ | 1,963.4 | 1,905.5 | 3.6% |
| Longform Writing ↗ | 81.7 | 82.8 | 2.4% |
| LiveBench · 编程 ↗ | 70.1% | 72.6% | 2.4% |
| LiveBench · 推理 ↗ | 93.9% | 92.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 79.8% | 80.4% | 3.0% |
| APEX-Agents 1.1 ↗ | 51.4% | 57.8% | 4.0% |
| Vals Finance Agent ↗ | 53.8% | 60.0% | 3.0% |
GLM-5.319 项共同评测共同证据支持本模型
双方共同拥有当前榜单 86.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,473.1 | 1,462.4 | 5.0% |
| Arena Text ↗ | 1,483.5 | 1,483 | 5.0% |
| Arena WebDev ↗ | 1,617.3 | 1,614.4 | 2.4% |
| AA Index ↗ | 47.1 | 44.9 | 30.0% |
| DeepSWE v1.1 ↗ | 72.7% | 69.0% | 3.6% |
| Chess Puzzles ↗ | 55.0% | 21.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 89.1% | 68.8% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 82.9% | 29.3% | 1.2% |
| GPQA Diamond ↗ | 93.5% | 90.9% | 2.0% |
| Mystery Game Puzzles ↗ | 58.0% | 33.0% | 1.2% |
| SimpleQA Verified ↗ | 69.7% | 41.0% | 4.0% |
| Creative Writing v3 ↗ | 1,963.4 | 2,064.1 | 3.6% |
| Longform Writing ↗ | 81.7 | 81.8 | 2.4% |
| LiveBench · 编程 ↗ | 70.1% | 69.9% | 2.4% |
| LiveBench · 推理 ↗ | 93.9% | 86.9% | 4.2% |
| LiveBench · 语言与指令 ↗ | 79.8% | 74.6% | 3.0% |
| APEX-Agents 1.1 ↗ | 51.4% | 56.6% | 4.0% |
| TapTap Maker ↗ | 86.5% | 83.6% | 3.6% |
| Vals Finance Agent ↗ | 53.8% | 55.8% | 3.0% |
Claude Opus 521 项共同评测共同证据支持对方
双方共同拥有当前榜单 94.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,473.1 | 1,471.9 | 5.0% |
| Arena Text ↗ | 1,483.5 | 1,487.4 | 5.0% |
| Arena Vision ↗ | 1,285.9 | 1,289 | 6.0% |
| Arena WebDev ↗ | 1,617.3 | 1,687 | 2.4% |
| AA Index ↗ | 47.1 | 50.7 | 30.0% |
| DeepSWE v1.1 ↗ | 72.7% | 73.6% | 3.6% |
| Chess Puzzles ↗ | 55.0% | 42.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 89.1% | 85.6% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 82.9% | 73.2% | 1.2% |
| GPQA Diamond ↗ | 93.5% | 93.9% | 2.0% |
| Mystery Game Puzzles ↗ | 58.0% | 59.0% | 1.2% |
| SimpleQA Verified ↗ | 69.7% | 59.9% | 4.0% |
| Creative Writing v3 ↗ | 1,963.4 | 2,120.6 | 3.6% |
| Longform Writing ↗ | 81.7 | 86.3 | 2.4% |
| LiveBench · 编程 ↗ | 70.1% | 73.3% | 2.4% |
| LiveBench · 推理 ↗ | 93.9% | 93.5% | 4.2% |
| LiveBench · 语言与指令 ↗ | 79.8% | 76.2% | 3.0% |
| APEX-Agents 1.1 ↗ | 51.4% | 65.8% | 4.0% |
| TapTap Maker ↗ | 86.5% | 88.9% | 3.6% |
| τ³-Banking ↗ | 46.9% | 48.7% | 2.0% |
| Vals Finance Agent ↗ | 53.8% | 58.6% | 3.0% |
Grok 4.618 项共同评测共同证据支持本模型
双方共同拥有当前榜单 86.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,473.1 | 1,451.3 | 5.0% |
| Arena Text ↗ | 1,483.5 | 1,455.6 | 5.0% |
| Arena Vision ↗ | 1,285.9 | 1,264.5 | 6.0% |
| Arena WebDev ↗ | 1,617.3 | 1,617.6 | 2.4% |
| AA Index ↗ | 47.1 | 44.3 | 30.0% |
| DeepSWE v1.1 ↗ | 72.7% | 66.7% | 3.6% |
| Chess Puzzles ↗ | 55.0% | 31.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 89.1% | 66.0% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 82.9% | 31.7% | 1.2% |
| GPQA Diamond ↗ | 93.5% | 93.2% | 2.0% |
| Mystery Game Puzzles ↗ | 58.0% | 34.0% | 1.2% |
| SimpleQA Verified ↗ | 69.7% | 48.9% | 4.0% |
| LiveBench · 编程 ↗ | 70.1% | 66.9% | 2.4% |
| LiveBench · 推理 ↗ | 93.9% | 91.5% | 4.2% |
| LiveBench · 语言与指令 ↗ | 79.8% | 77.8% | 3.0% |
| APEX-Agents 1.1 ↗ | 51.4% | 65.3% | 4.0% |
| TapTap Maker ↗ | 86.5% | 87.3% | 3.6% |
| Vals Finance Agent ↗ | 53.8% | 53.7% | 3.0% |
Claude Fable 520 项共同评测共同证据支持对方
双方共同拥有当前榜单 64.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,473.1 | 1,504.1 | 5.0% |
| Arena Text ↗ | 1,483.5 | 1,505.7 | 5.0% |
| Arena Vision ↗ | 1,285.9 | 1,309.5 | 6.0% |
| Arena WebDev ↗ | 1,617.3 | 1,628 | 2.4% |
| DeepSWE v1.1 ↗ | 72.7% | 69.7% | 3.6% |
| Chess Puzzles ↗ | 55.0% | 41.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 89.1% | 87.0% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 82.9% | 90.2% | 1.2% |
| GPQA Diamond ↗ | 93.5% | 85.9% | 2.0% |
| Mystery Game Puzzles ↗ | 58.0% | 52.0% | 1.2% |
| SimpleQA Verified ↗ | 69.7% | 70.7% | 4.0% |
| Creative Writing v3 ↗ | 1,963.4 | 1,934.6 | 3.6% |
| Longform Writing ↗ | 81.7 | 83 | 2.4% |
| LiveBench · 编程 ↗ | 70.1% | 74.1% | 2.4% |
| LiveBench · 推理 ↗ | 93.9% | 92.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 79.8% | 83.2% | 3.0% |
| APEX-Agents 1.1 ↗ | 51.4% | 63.6% | 4.0% |
| TapTap Maker ↗ | 86.5% | 89.0% | 3.6% |
| τ³-Banking ↗ | 46.9% | 39.7% | 2.0% |
| Vals Finance Agent ↗ | 53.8% | 56.3% | 3.0% |
每一项成绩,都有来处。
下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。