gpt-oss-20b
开源权重 ↗OpenAI · 2025-08-05 发布 · 10/02 17:36 更新
综合参考位次第 79 位综合榜前 30 位之外 · 证据覆盖 22%情景 74—79 位7 个情景证据不足
可比较分类0/ 4 项分类
已有成绩5项评测
上下文窗口13.1万Token
API 输入 / 输出 · 每百万 Token待核验尚未核到厂商官网价格
各有所长,看得更清楚。
每类单独比较。参考位次用于浏览,能力表现请看分项成绩与配置。
编程参考位次—暂无足够的可比成绩0 项评测 · 覆盖 0%推理参考位次—暂无足够的可比成绩1 项评测 · 覆盖 25%知识参考位次—暂无足够的可比成绩1 项评测 · 覆盖 50%专业办公参考位次—暂无足够的可比成绩0 项评测 · 覆盖 0%
各分类的参考位次只在该分类内比较。缺测不补分;覆盖比例不代表能力高低。
参考顺序对条件有多敏感?
依次移除题族或机构,调整题族权重、参照尺度与误差假设,观察参考位次怎样变化。
情景范围 · 重新检查参评资格74—79 位
已检查 243 个情景。7 个情景下参评证据不足。保持原候选不变时为 79—79 位。这个范围不是置信区间,也不是真实能力名次的区间,不包含从未公开的成绩。
每一项成绩,都有来处。
下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。
综合评测与体验3 项
推理1 项
知识1 项
还有一些未知
参考顺序只概括已取得的公开证据,缺测不补分。不同运行配置、未知误差与新评测都可能改变顺序,相邻位次不等于已证明的能力差距。
尚缺能力维度:编程、语言理解与指令、视觉理解、行业专业任务、中文与多语言。
2 项采用的成绩未公开可用标准误;未知不按零误差处理。
了解计算方法 →