返回模型榜
LATENTRANK V9

AIHOT 排名与共识分算法规则

综合分汇总各类评测中的真实表现,区分模型的综合实力和它在某类评测上的优势。每个模型只有一个综合分,正式名次按综合分从高到低排列。

方法版本 2026.09-latent-rank-v9锚点版本 2026-08-10-a
核心过程

共同参评 → 区分评测特长 → 估计综合实力 → 共识分与排名

成对比赛只在本轮入榜圈(至少具备 3 个独立证据家族的型号)和冻结锚点之间进行。源榜长尾不投票,也不能帮圈内不足最低可比人数的指标凑门槛。一张榜没有收录某个入榜圈模型时,这张榜对这一对不产生任何胜、负或平局。空缺预算不转给其他来源;证据减少后,综合实力估计更依赖已有证据和先验。全部来源在同一个模型中联合计算,评分之后不再额外改序。

页面读法

共识分、评测完整度和证据可信度分别表示什么

AIHOT 共识分

先用分层 Bradley–Terry 模型估计综合能力,再计算该能力相对 18 个模型组成的固定锚点池中当期可用成员的平均预测胜率,映射到 0—100 分。它不是来源分数的算术平均,也不是当期模型百分位。

评测完整度

首页百分比是模型实际拿到的证据预算:逐项计算“来源组固定权重 × 榜单组内份额 × 已评子项目份额”后求和。一张榜单只测到部分子项目,只计对应份额,不会再被显示为整张跑满;完整度本身不作为扣分项。

证据可信度

高要求至少 6 类独立证据、80% 完整度且分数标准误不超过 5;中要求至少 4 类独立证据、40% 完整度且标准误不超过 8;其余为低。它只描述证据是否充分,不代表模型能力高低。首页的可能名次范围由分数误差条重叠得到,用于提示相近模型,不能解读为精确的名次概率区间。

计算流程

七步得到最终排名

01

统一模型身份

先把来源别名归到中央型号目录;日期、Preview、Beta 等版本标记保留,推理档位、Harness、Scaffold 等评测配置必须分离。身份证据冲突或配置仍混入型号主键时,整张快照拒绝入榜,不猜测合并。

02

固定代表配置

同一来源、指标和基础模型只选一条代表配置,选择规则在读取成绩前确定。Agent/脚手架明细保留,但成绩归到基础模型。

03

只比较共同参评

同一指标里,只有同属入榜圈或冻结锚点、并且共同出现的两款模型才形成结果;原始成绩高低决定胜负,相同成绩记平局。原榜误差区间重叠不等于打平;误差宽度单独进入比较模型。

04

固定证据预算

当前 7 家运营方提供 9 张计分榜。预算按问题写死,不按运营方均分;同一问题的多张榜单只拆该问份额,长榜也不会因为榜单多或对手多而放大影响。

05

区分综合实力和评测特长

每个模型有一个综合能力和各类评测下的能力偏差。同类评测共享这项偏差,某一类的优势不会被直接当成所有方面都强;弱先验在证据不足时抑制极端估计。

06

锚定分数

共识分由综合能力相对固定锚点单调换算,能力越高分数越高。使用近似后验的中心估计,不额外减去不确定性惩罚。

07

按综合分统一排名

正式名次按未舍入的综合能力排序,与未舍入共识分的顺序一致。页面保留一位小数,显示同分时仍按未舍入值区分先后;精确同分用稳定的型号标识排序。首页展示前 30 名。

缺失数据

空白不是 0 分,也不是隐藏的平均分

不会发生

  • 不补 0、50、末位或机器预测分。
  • 不把缺测写成一场输局或平局。
  • 不把空缺的来源组或榜单预算转给仍有成绩的来源。
  • 不因为完整度较低再额外扣一次综合分。

实际影响

  • 该来源没有对应的比较项,模型的总证据量减少。
  • 弱先验相对更有影响,极端能力估计会更保守。
  • 分数标准误通常增大,证据可信度可能下降。
  • 如果已有的跨类证据足够强,模型仍然可以排在前列;少测本身不是优势,也不另设缺测扣分。

完整覆盖模型的有效比较预算是 84。当前正式计分合计 100%;取得全部现役问题后的有效比较是 84 × 100%84.00

数学定义

从一张原榜到 0—100 共识分

成对结果

yᵢⱼ ∈ {0,0.5,1}

分别表示模型 i 负、平、胜。只有共同参评才会产生 yᵢⱼ。

单场权重

w=84 × 来源预算 × 指标份额 ÷(入榜圈参评数 − 1)

参评数是该榜上的入榜圈加锚点人数,不是源榜全量。除以人数减一,使一张长榜和一张短榜对单个模型拥有相同的总来源预算。

评测完整度

Coverageᵢ=100% × Σₘ I(i 有 m 成绩)× 来源预算 × 指标份额

I 只取 0 或 1。它按实际观测的子项目累计证据预算,不进入能力估计的得分项。

能力胜率

P(i 胜 j | f)=sigmoid((φᵢf − φⱼf)/Tᵢⱼ)

φᵢf=gᵢ+δᵢf:g 是综合能力,δ 是该类评测下的偏差。同一家族共享 δ。T=√(1+eᵢ²+eⱼ²),e 是原榜误差按锚点分数尺度换算后的测量噪声;未报告误差时该项为 0,比较本身仍有基础噪声。

最终分数

Scoreᵢ=100/|A| × Σₐ∈A sigmoid(gᵢ − gₐ)

A 是当前连通分量里的固定锚点集合;锚点只定义尺子,不增加额外胜场或来源权重。

优化目标是加权 Bradley–Terry 对数损失加分层高斯先验:g ~ N(0, 3²),δf ~ N(0, 0.7² × 0.142857 / 家族固定预算)。通过 MAP 求解和 Laplace 近似得到后验中心与条件误差。误差单位使用该来源可用锚点分数的 IQR / 1.349,与 0.3 倍标准差取较大值;95% 半区间除以 1.96,未注明置信水平的 ± 误差按一个标准差处理。相同快照、目录和版本输入会得到相同排序;参数为版本固定的建模选择,并非已经过独立样本校准的真实胜率保证。

进入总榜

证据门槛、完整度与不确定性

模型进入正式排名

  • 必须连接到主锚点比较网络。
  • 至少具备 3 个独立证据家族,不强制指定 AA、Arena 或 LiveBench;同一家族里的多张来源只算一类。
  • 至少直接共同参评 2 个锚点;锚点模型自身豁免这一条。
  • 已知发布日期时,只展示近 18 个月的当前模型。

一轮计算可以发布

  • 18 个冻结锚点中至少有 8 个可用。
  • 正式来源必须有真实可用快照,且数据没有超过各来源自己的时效上限。
  • 原始分必须符合该指标方向与合法取值范围。
  • 身份冲突、重复配置和过期信号在计算前排除。

分数不确定度

使用完整目标函数 Hessian 的 Laplace 近似,并通过 delta method 把能力方差传播到 0—100 分尺:SE=√(∇ScoreᵀH⁻¹∇Score)。它同时考虑目标模型与全部锚点的相关不确定性,不是简单的来源标准差。

当前权重

7 个独立来源组如何由 9 张榜单共享

AA Index单项指标30%
AA 中文/多语言单项指标12%
LiveBench单项指标14%
Arena Text单项指标9%
Arena WebDev单项指标5%
APEX-Agents2 项指标共享7%
Vals Finance Agent单项指标7%
DeepSWE v1.1单项指标8%
TapTap Maker单项指标8%
综合能力指数30%1 张榜单中文/多语言12%1 张榜单滚动客观题库14%1 张榜单用户偏好14%2 张榜单真实办公14%2 张榜单仓库级软件工程8%1 张榜单引擎执行的游戏开发8%1 张榜单

现役问题预算合计 100%。原留给 ARC-AGI-2 的 8% 已分配给 TapTap Maker;以后接入 ARC 须重新挤预算。Arena Text 占 9%、WebDev 占 5%;APEX 与 Vals Finance Agent 各占 7%。同一证据家族当前总占比不超过 30%,避免相关榜单以不同名称重复控制结果。

身份与配置

Agent 成绩为什么仍然记到基础模型

基础模型是排名主体

Agent、工具调用、脚手架和推理档位是评测配置,不是新的基础模型。来源选择出的代表配置成绩统一归到对应裸模,配置名称和原始分继续保留在详情页供审计。

配置不能按最高分临时挑选

配置优先级由第一方身份、推理档位和来源控制方式预先确定。同一来源和指标中只允许一条配置进入正式比较,其他配置不会重复增加模型的胜场。

正确解读

严格名次不等于显著能力差距

共识分和正式名次来自同一个综合能力估计。相邻模型的分差可能远小于各自不确定度,这时只能说中心估计略高,不能据此断言前一名显著强于后一名。

缺失也可能不是随机的:如果一个模型只参加擅长的评测,任何拒绝虚构分数的算法都无法完全消除选择性参赛风险。AIHOT 选择公开完整度与不确定度,而不是用不可验证的矩阵补全偷偷猜分。

模型详情里的来源换算位置只帮助核对原榜,不参与算术平均复算;正式总分始终来自同一套分层评级模型。

榜单来源与计算方法