← 返回编程榜CAPABILITY PROFILE UNDERSTANDING THE RANK
查看 GPT-5.6 Sol 的完整证据 →
查看 GLM-5.3 的完整证据 →
查看 Claude Fable 5 的完整证据 →
查看 GPT-5.6 Terra 的完整证据 →
查看 GPT-6 Astra 的完整证据 →BEHIND THE SCORE
Google
Gemini 3.8 Flash
2026-09-02 发布 · 09/10 06:31 更新
综合共识指数71.8综合榜第 13 名
分类成绩4 / 4 项分类
已有成绩19 项评测
上下文窗口104.9万 Token
API 输入 / 输出 · 每百万 Token¥5.03 / ¥25.15厂商官方价格 ↗
各有所长,看得更清楚。
每项能力单独计算。没有足够的实测,就留空。
不同分类的分数反映各自参照组中的表现,不能直接相加或用来比较不同能力的绝对高低。
编程名次,有多稳定?
依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。
重新检查资格后的名次3—9 名
已完成的对照中均具备参评资格。保持原候选不变时为 4—24 名。这个范围不是置信区间,也不包含从未公开的成绩。
查看与附近模型的共同证据
净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。
GPT-5.6 Sol3 项共同评测共同证据支持对方
双方共同拥有当前榜单 100.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| DeepSWE v1.1 ↗ | 73.8% | 72.7% | 37.5% |
| LiveBench · 编程 ↗ | 63.4% | 70.1% | 25.0% |
| TapTap Maker ↗ | 86.8% | 86.5% | 37.5% |
GLM-5.33 项共同评测共同证据支持本模型
双方共同拥有当前榜单 100.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| DeepSWE v1.1 ↗ | 73.8% | 69.0% | 37.5% |
| LiveBench · 编程 ↗ | 63.4% | 69.9% | 25.0% |
| TapTap Maker ↗ | 86.8% | 83.6% | 37.5% |
Claude Fable 53 项共同评测共同证据支持对方
双方共同拥有当前榜单 100.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| DeepSWE v1.1 ↗ | 73.8% | 69.7% | 37.5% |
| LiveBench · 编程 ↗ | 63.4% | 74.1% | 25.0% |
| TapTap Maker ↗ | 86.8% | 89.0% | 37.5% |
GPT-5.6 Terra3 项共同评测共同证据支持本模型
双方共同拥有当前榜单 100.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| DeepSWE v1.1 ↗ | 73.8% | 69.6% | 37.5% |
| LiveBench · 编程 ↗ | 63.4% | 66.6% | 25.0% |
| TapTap Maker ↗ | 86.8% | 81.8% | 37.5% |
GPT-6 Astra3 项共同评测共同证据支持对方
双方共同拥有当前榜单 100.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| DeepSWE v1.1 ↗ | 73.8% | 73.2% | 37.5% |
| LiveBench · 编程 ↗ | 63.4% | 68.8% | 25.0% |
| TapTap Maker ↗ | 86.8% | 88.9% | 37.5% |
每一项成绩,都有来处。
下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。