跳到正文

Gemini 3 Pro Preview

Google · 2025-11-18 发布 · 10/02 17:36 更新

综合参考位次第 16 位综合榜 · 证据覆盖 34%情景 3—33 位4 个情景证据不足
可比较分类0/ 4 项分类
已有成绩6项评测
上下文窗口—Token
API 输入 / 输出 · 每百万 Token待核验尚未核到厂商官网价格
CAPABILITY PROFILE

各有所长,看得更清楚。

每类单独比较。参考位次用于浏览,能力表现请看分项成绩与配置。

各分类的参考位次只在该分类内比较。缺测不补分;覆盖比例不代表能力高低。

UNDERSTANDING THE RANK

参考顺序对条件有多敏感?

依次移除题族或机构,调整题族权重、参照尺度与误差假设,观察参考位次怎样变化。

情景范围 · 重新检查参评资格3—33 位

已检查 243 个情景。4 个情景下参评证据不足。保持原候选不变时为 3—40 位。这个范围不是置信区间,也不是真实能力名次的区间,不包含从未公开的成绩。

BEHIND THE SCORE

每一项成绩,都有来处。

下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。

综合评测与体验3 项

推理1 项

知识1 项

视觉理解1 项

还有一些未知

参考顺序只概括已取得的公开证据,缺测不补分。不同运行配置、未知误差与新评测都可能改变顺序,相邻位次不等于已证明的能力差距。

尚缺能力维度:编程、语言理解与指令、行业专业任务、中文与多语言。

2 项采用的成绩未公开可用标准误;未知不按零误差处理。

了解计算方法 →