← 返回综合榜CAPABILITY PROFILE UNDERSTANDING THE RANK
查看 DeepSeek V4 Flash 0731 的完整证据 →
查看 DeepSeek V4 Pro 0813 的完整证据 →
查看 GPT-6 Luna 的完整证据 →
查看 GPT-5.6 Luna 的完整证据 →
查看 Claude Sonnet 5 的完整证据 →BEHIND THE SCORE
Gemini 3.1 Pro Preview
Google · 2026-02-19 发布 · 09/23 14:42 更新
分类成绩4 / 4 项分类
已有成绩20 项评测
上下文窗口104.9万 Token
API 输入 / 输出 · 每百万 Token¥13.4 / ¥80.4厂商官方价格 ↗
各有所长,看得更清楚。
每项能力单独计算。没有足够的实测,就留空。
不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。
综合名次,有多稳定?
依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。
重新检查资格后的名次29—40 名
已完成的对照中均具备参评资格。保持原候选不变时为 31—40 名。这个范围不是置信区间,也不包含从未公开的成绩。
查看与附近模型的共同证据
净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。
DeepSeek V4 Flash 073116 项共同评测共同证据支持对方
双方共同拥有当前榜单 76.4% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,480.3 | 1,407.8 | 5.0% |
| Arena Text ↗ | 1,486.8 | 1,435.6 | 5.0% |
| Arena WebDev ↗ | 1,446.7 | 1,579.9 | 2.4% |
| AA Index ↗ | 29.7 | 34.3 | 30.0% |
| Chess Puzzles ↗ | 49.0% | 33.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 59.6% | 57.5% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 26.8% | 24.4% | 1.2% |
| GPQA Diamond ↗ | 94.4% | 91.0% | 2.0% |
| Mystery Game Puzzles ↗ | 34.0% | 34.0% | 1.2% |
| SimpleQA Verified ↗ | 73.5% | 33.6% | 4.0% |
| LiveBench · 编程综合 ↗ | 60.3% | 60.9% | 2.4% |
| LiveBench · 推理与数学 ↗ | 87.5% | 86.7% | 4.2% |
| LiveBench · 语言与指令 ↗ | 82.2% | 72.3% | 3.0% |
| APEX-Agents 1.1 ↗ | 35.3% | 55.3% | 4.0% |
| TapTap Maker ↗ | 64.7% | 74.6% | 3.6% |
| Vals Finance Agent ↗ | 43.0% | 49.5% | 3.0% |
DeepSeek V4 Pro 081316 项共同评测共同证据支持对方
双方共同拥有当前榜单 76.4% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,480.3 | 1,442.3 | 5.0% |
| Arena Text ↗ | 1,486.8 | 1,463.4 | 5.0% |
| Arena WebDev ↗ | 1,446.7 | 1,580.2 | 2.4% |
| AA Index ↗ | 29.7 | 36 | 30.0% |
| Chess Puzzles ↗ | 49.0% | 47.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 59.6% | 64.6% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 26.8% | 26.8% | 1.2% |
| GPQA Diamond ↗ | 94.4% | 91.7% | 2.0% |
| Mystery Game Puzzles ↗ | 34.0% | 43.0% | 1.2% |
| SimpleQA Verified ↗ | 73.5% | 52.9% | 4.0% |
| LiveBench · 编程综合 ↗ | 60.3% | 66.1% | 2.4% |
| LiveBench · 推理与数学 ↗ | 87.5% | 90.5% | 4.2% |
| LiveBench · 语言与指令 ↗ | 82.2% | 74.9% | 3.0% |
| APEX-Agents 1.1 ↗ | 35.3% | 47.3% | 4.0% |
| TapTap Maker ↗ | 64.7% | 77.8% | 3.6% |
| Vals Finance Agent ↗ | 43.0% | 50.4% | 3.0% |
GPT-6 Luna5 项共同评测共同证据支持对方
双方共同拥有当前榜单 42.6% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| AA Index ↗ | 29.7 | 37.3 | 30.0% |
| LiveBench · 编程综合 ↗ | 60.3% | 65.1% | 2.4% |
| LiveBench · 推理与数学 ↗ | 87.5% | 85.4% | 4.2% |
| LiveBench · 语言与指令 ↗ | 82.2% | 64.9% | 3.0% |
| Vals Finance Agent ↗ | 43.0% | 49.9% | 3.0% |
GPT-5.6 Luna20 项共同评测共同证据支持对方
双方共同拥有当前榜单 92.0% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,480.3 | 1,411 | 5.0% |
| Arena Text ↗ | 1,486.8 | 1,452.5 | 5.0% |
| Arena Vision ↗ | 1,278.7 | 1,258.1 | 6.0% |
| Arena WebDev ↗ | 1,446.7 | 1,519.8 | 2.4% |
| AA Index ↗ | 29.7 | 37.3 | 30.0% |
| DeepSWE v1.1 ↗ | 11.7% | 67.2% | 3.6% |
| Chess Puzzles ↗ | 49.0% | 40.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 59.6% | 82.1% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 26.8% | 61.0% | 1.2% |
| GPQA Diamond ↗ | 94.4% | 91.6% | 2.0% |
| Mystery Game Puzzles ↗ | 34.0% | 21.0% | 1.2% |
| SimpleQA Verified ↗ | 73.5% | 41.0% | 4.0% |
| Creative Writing v3 ↗ | 1,488.9 | 1,825.8 | 3.6% |
| Longform Writing ↗ | 68.2 | 75.5 | 2.4% |
| LiveBench · 编程综合 ↗ | 60.3% | 65.7% | 2.4% |
| LiveBench · 推理与数学 ↗ | 87.5% | 86.4% | 4.2% |
| LiveBench · 语言与指令 ↗ | 82.2% | 66.3% | 3.0% |
| APEX-Agents 1.1 ↗ | 35.3% | 43.0% | 4.0% |
| TapTap Maker ↗ | 64.7% | 77.8% | 3.6% |
| Vals Finance Agent ↗ | 43.0% | 55.0% | 3.0% |
Claude Sonnet 520 项共同评测共同证据支持对方
双方共同拥有当前榜单 92.0% 的名义票权。下表展示各项评测采用的成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,480.3 | 1,437 | 5.0% |
| Arena Text ↗ | 1,486.8 | 1,461.2 | 5.0% |
| Arena Vision ↗ | 1,278.7 | 1,266.3 | 6.0% |
| Arena WebDev ↗ | 1,446.7 | 1,537.8 | 2.4% |
| AA Index ↗ | 29.7 | 38.2 | 30.0% |
| DeepSWE v1.1 ↗ | 11.7% | 53.8% | 3.6% |
| Chess Puzzles ↗ | 49.0% | 16.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 59.6% | 65.6% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 26.8% | 29.3% | 1.2% |
| GPQA Diamond ↗ | 94.4% | 80.3% | 2.0% |
| Mystery Game Puzzles ↗ | 34.0% | 35.0% | 1.2% |
| SimpleQA Verified ↗ | 73.5% | 33.7% | 4.0% |
| Creative Writing v3 ↗ | 1,488.9 | 1,790.5 | 3.6% |
| Longform Writing ↗ | 68.2 | 78.3 | 2.4% |
| LiveBench · 编程综合 ↗ | 60.3% | 70.0% | 2.4% |
| LiveBench · 推理与数学 ↗ | 87.5% | 90.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 82.2% | 69.4% | 3.0% |
| APEX-Agents 1.1 ↗ | 35.3% | 54.5% | 4.0% |
| TapTap Maker ↗ | 64.7% | 76.2% | 3.6% |
| Vals Finance Agent ↗ | 43.0% | 53.9% | 3.0% |
每一项成绩,都有来处。
下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。