← 返回综合榜CAPABILITY PROFILE UNDERSTANDING THE RANK
查看 Claude Opus 4.8 的完整证据 →
查看 Qwen3.8 Max 0902 的完整证据 →
查看 GPT-5.6 Terra 的完整证据 →
查看 GLM-5.3 Flash 的完整证据 →
查看 Kimi K3 的完整证据 →BEHIND THE SCORE
Gemini 3.8 Flash
Google · 2026-09-02 发布 · 09/16 02:00 更新
分类成绩4 / 4 项分类
已有成绩19 项评测
上下文窗口104.9万 Token
API 输入 / 输出 · 每百万 Token¥5.03 / ¥25.17厂商官方价格 ↗
各有所长,看得更清楚。
每项能力单独计算。没有足够的实测,就留空。
不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。
综合名次,有多稳定?
依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。
重新检查资格后的名次6—13 名
已完成的对照中均具备参评资格。保持原候选不变时为 6—14 名。这个范围不是置信区间,也不包含从未公开的成绩。
查看与附近模型的共同证据
净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。
Claude Opus 4.819 项共同评测共同证据支持对方
双方共同拥有当前榜单 86.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,495.9 | 1,464.5 | 5.0% |
| Arena Text ↗ | 1,493 | 1,481.4 | 5.0% |
| Arena WebDev ↗ | 1,567.9 | 1,558.8 | 2.4% |
| AA Index ↗ | 41.2 | 42 | 30.0% |
| DeepSWE v1.1 ↗ | 73.8% | 59.0% | 3.6% |
| Chess Puzzles ↗ | 61.0% | 34.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 68.4% | 80.0% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 22.0% | 56.1% | 1.2% |
| GPQA Diamond ↗ | 95.4% | 91.0% | 2.0% |
| Mystery Game Puzzles ↗ | 47.0% | 36.0% | 1.2% |
| SimpleQA Verified ↗ | 69.7% | 53.0% | 4.0% |
| Creative Writing v3 ↗ | 1,749.7 | 1,835.2 | 3.6% |
| Longform Writing ↗ | 76.8 | 80.8 | 2.4% |
| LiveBench · 编程 ↗ | 63.4% | 66.2% | 2.4% |
| LiveBench · 推理 ↗ | 90.4% | 91.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 84.6% | 75.8% | 3.0% |
| APEX-Agents 1.1 ↗ | 64.3% | 48.9% | 4.0% |
| TapTap Maker ↗ | 86.8% | 82.8% | 3.6% |
| Vals Finance Agent ↗ | 61.4% | 53.9% | 3.0% |
Qwen3.8 Max 09027 项共同评测共同证据支持本模型
双方共同拥有当前榜单 18.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena WebDev ↗ | 1,567.9 | 1,680.8 | 2.4% |
| Chess Puzzles ↗ | 61.0% | 40.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 68.4% | 65.6% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 22.0% | 34.1% | 1.2% |
| GPQA Diamond ↗ | 95.4% | 92.3% | 2.0% |
| SimpleQA Verified ↗ | 69.7% | 47.3% | 4.0% |
| TapTap Maker ↗ | 86.8% | 83.3% | 3.6% |
GPT-5.6 Terra19 项共同评测共同证据支持对方
双方共同拥有当前榜单 86.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,495.9 | 1,426.4 | 5.0% |
| Arena Text ↗ | 1,493 | 1,466 | 5.0% |
| Arena WebDev ↗ | 1,567.9 | 1,521.2 | 2.4% |
| AA Index ↗ | 41.2 | 42.3 | 30.0% |
| DeepSWE v1.1 ↗ | 73.8% | 69.6% | 3.6% |
| Chess Puzzles ↗ | 61.0% | 54.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 68.4% | 86.0% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 22.0% | 70.7% | 1.2% |
| GPQA Diamond ↗ | 95.4% | 93.3% | 2.0% |
| Mystery Game Puzzles ↗ | 47.0% | 35.0% | 1.2% |
| SimpleQA Verified ↗ | 69.7% | 43.2% | 4.0% |
| Creative Writing v3 ↗ | 1,749.7 | 1,850.3 | 3.6% |
| Longform Writing ↗ | 76.8 | 78 | 2.4% |
| LiveBench · 编程 ↗ | 63.4% | 66.6% | 2.4% |
| LiveBench · 推理 ↗ | 90.4% | 92.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 84.6% | 73.8% | 3.0% |
| APEX-Agents 1.1 ↗ | 64.3% | 58.2% | 4.0% |
| TapTap Maker ↗ | 86.8% | 81.8% | 3.6% |
| Vals Finance Agent ↗ | 61.4% | 54.4% | 3.0% |
GLM-5.3 Flash16 项共同评测共同证据支持本模型
双方共同拥有当前榜单 76.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,495.9 | 1,434.9 | 5.0% |
| Arena Text ↗ | 1,493 | 1,475.4 | 5.0% |
| Arena WebDev ↗ | 1,567.9 | 1,607.1 | 2.4% |
| AA Index ↗ | 41.2 | 41.9 | 30.0% |
| DeepSWE v1.1 ↗ | 73.8% | 63.4% | 3.6% |
| Chess Puzzles ↗ | 61.0% | 14.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 68.4% | 55.8% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 22.0% | 17.1% | 1.2% |
| GPQA Diamond ↗ | 95.4% | 90.2% | 2.0% |
| Mystery Game Puzzles ↗ | 47.0% | 8.0% | 1.2% |
| LiveBench · 编程 ↗ | 63.4% | 67.9% | 2.4% |
| LiveBench · 推理 ↗ | 90.4% | 79.4% | 4.2% |
| LiveBench · 语言与指令 ↗ | 84.6% | 65.1% | 3.0% |
| APEX-Agents 1.1 ↗ | 64.3% | 52.8% | 4.0% |
| TapTap Maker ↗ | 86.8% | 81.5% | 3.6% |
| Vals Finance Agent ↗ | 61.4% | 57.9% | 3.0% |
Kimi K319 项共同评测共同证据支持对方
双方共同拥有当前榜单 86.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,495.9 | 1,458.4 | 5.0% |
| Arena Text ↗ | 1,493 | 1,484.8 | 5.0% |
| Arena WebDev ↗ | 1,567.9 | 1,674.3 | 2.4% |
| AA Index ↗ | 41.2 | 43.8 | 30.0% |
| DeepSWE v1.1 ↗ | 73.8% | 68.5% | 3.6% |
| Chess Puzzles ↗ | 61.0% | 39.0% | 1.8% |
| FrontierMath v2 · Tiers 1–3 ↗ | 68.4% | 72.2% | 3.6% |
| FrontierMath v2 · Tier 4 ↗ | 22.0% | 39.0% | 1.2% |
| GPQA Diamond ↗ | 95.4% | 93.1% | 2.0% |
| Mystery Game Puzzles ↗ | 47.0% | 26.0% | 1.2% |
| SimpleQA Verified ↗ | 69.7% | 50.6% | 4.0% |
| Creative Writing v3 ↗ | 1,749.7 | 2,070.6 | 3.6% |
| Longform Writing ↗ | 76.8 | 79.6 | 2.4% |
| LiveBench · 编程 ↗ | 63.4% | 71.8% | 2.4% |
| LiveBench · 推理 ↗ | 90.4% | 87.6% | 4.2% |
| LiveBench · 语言与指令 ↗ | 84.6% | 78.4% | 3.0% |
| APEX-Agents 1.1 ↗ | 64.3% | 50.6% | 4.0% |
| TapTap Maker ↗ | 86.8% | 79.7% | 3.6% |
| Vals Finance Agent ↗ | 61.4% | 54.4% | 3.0% |
每一项成绩,都有来处。
下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。