AIHOT 共识分
先用分层 Bradley–Terry 模型估计综合能力,再计算该能力相对 18 个模型组成的固定锚点池中当期可用成员的平均预测胜率,映射到 0—100 分。它不是来源分数的算术平均,也不是当期模型百分位。
综合分汇总各类评测中的真实表现,区分模型的综合实力和它在某类评测上的优势。每个模型只有一个综合分,正式名次按综合分从高到低排列。
成对比赛只在本轮入榜圈(至少具备 3 个独立证据家族的型号)和冻结锚点之间进行。源榜长尾不投票,也不能帮圈内不足最低可比人数的指标凑门槛。一张榜没有收录某个入榜圈模型时,这张榜对这一对不产生任何胜、负或平局。空缺预算不转给其他来源;证据减少后,综合实力估计更依赖已有证据和先验。全部来源在同一个模型中联合计算,评分之后不再额外改序。
先用分层 Bradley–Terry 模型估计综合能力,再计算该能力相对 18 个模型组成的固定锚点池中当期可用成员的平均预测胜率,映射到 0—100 分。它不是来源分数的算术平均,也不是当期模型百分位。
首页百分比是模型实际拿到的证据预算:逐项计算“来源组固定权重 × 榜单组内份额 × 已评子项目份额”后求和。一张榜单只测到部分子项目,只计对应份额,不会再被显示为整张跑满;完整度本身不作为扣分项。
高要求至少 6 类独立证据、80% 完整度且分数标准误不超过 5;中要求至少 4 类独立证据、40% 完整度且标准误不超过 8;其余为低。它只描述证据是否充分,不代表模型能力高低。首页的可能名次范围由分数误差条重叠得到,用于提示相近模型,不能解读为精确的名次概率区间。
先把来源别名归到中央型号目录;日期、Preview、Beta 等版本标记保留,推理档位、Harness、Scaffold 等评测配置必须分离。身份证据冲突或配置仍混入型号主键时,整张快照拒绝入榜,不猜测合并。
同一来源、指标和基础模型只选一条代表配置,选择规则在读取成绩前确定。Agent/脚手架明细保留,但成绩归到基础模型。
同一指标里,只有同属入榜圈或冻结锚点、并且共同出现的两款模型才形成结果;原始成绩高低决定胜负,相同成绩记平局。原榜误差区间重叠不等于打平;误差宽度单独进入比较模型。
当前 7 家运营方提供 9 张计分榜。预算按问题写死,不按运营方均分;同一问题的多张榜单只拆该问份额,长榜也不会因为榜单多或对手多而放大影响。
每个模型有一个综合能力和各类评测下的能力偏差。同类评测共享这项偏差,某一类的优势不会被直接当成所有方面都强;弱先验在证据不足时抑制极端估计。
共识分由综合能力相对固定锚点单调换算,能力越高分数越高。使用近似后验的中心估计,不额外减去不确定性惩罚。
正式名次按未舍入的综合能力排序,与未舍入共识分的顺序一致。页面保留一位小数,显示同分时仍按未舍入值区分先后;精确同分用稳定的型号标识排序。首页展示前 30 名。
完整覆盖模型的有效比较预算是 84。当前正式计分合计 100%;取得全部现役问题后的有效比较是 84 × 100%=84.00。
yᵢⱼ ∈ {0,0.5,1}分别表示模型 i 负、平、胜。只有共同参评才会产生 yᵢⱼ。
w=84 × 来源预算 × 指标份额 ÷(入榜圈参评数 − 1)参评数是该榜上的入榜圈加锚点人数,不是源榜全量。除以人数减一,使一张长榜和一张短榜对单个模型拥有相同的总来源预算。
Coverageᵢ=100% × Σₘ I(i 有 m 成绩)× 来源预算 × 指标份额I 只取 0 或 1。它按实际观测的子项目累计证据预算,不进入能力估计的得分项。
P(i 胜 j | f)=sigmoid((φᵢf − φⱼf)/Tᵢⱼ)φᵢf=gᵢ+δᵢf:g 是综合能力,δ 是该类评测下的偏差。同一家族共享 δ。T=√(1+eᵢ²+eⱼ²),e 是原榜误差按锚点分数尺度换算后的测量噪声;未报告误差时该项为 0,比较本身仍有基础噪声。
Scoreᵢ=100/|A| × Σₐ∈A sigmoid(gᵢ − gₐ)A 是当前连通分量里的固定锚点集合;锚点只定义尺子,不增加额外胜场或来源权重。
优化目标是加权 Bradley–Terry 对数损失加分层高斯先验:g ~ N(0, 3²),δf ~ N(0, 0.7² × 0.142857 / 家族固定预算)。通过 MAP 求解和 Laplace 近似得到后验中心与条件误差。误差单位使用该来源可用锚点分数的 IQR / 1.349,与 0.3 倍标准差取较大值;95% 半区间除以 1.96,未注明置信水平的 ± 误差按一个标准差处理。相同快照、目录和版本输入会得到相同排序;参数为版本固定的建模选择,并非已经过独立样本校准的真实胜率保证。
使用完整目标函数 Hessian 的 Laplace 近似,并通过 delta method 把能力方差传播到 0—100 分尺:SE=√(∇ScoreᵀH⁻¹∇Score)。它同时考虑目标模型与全部锚点的相关不确定性,不是简单的来源标准差。
现役问题预算合计 100%。原留给 ARC-AGI-2 的 8% 已分配给 TapTap Maker;以后接入 ARC 须重新挤预算。Arena Text 占 9%、WebDev 占 5%;APEX 与 Vals Finance Agent 各占 7%。同一证据家族当前总占比不超过 30%,避免相关榜单以不同名称重复控制结果。
Agent、工具调用、脚手架和推理档位是评测配置,不是新的基础模型。来源选择出的代表配置成绩统一归到对应裸模,配置名称和原始分继续保留在详情页供审计。
配置优先级由第一方身份、推理档位和来源控制方式预先确定。同一来源和指标中只允许一条配置进入正式比较,其他配置不会重复增加模型的胜场。
共识分和正式名次来自同一个综合能力估计。相邻模型的分差可能远小于各自不确定度,这时只能说中心估计略高,不能据此断言前一名显著强于后一名。
缺失也可能不是随机的:如果一个模型只参加擅长的评测,任何拒绝虚构分数的算法都无法完全消除选择性参赛风险。AIHOT 选择公开完整度与不确定度,而不是用不可验证的矩阵补全偷偷猜分。
模型详情里的来源换算位置只帮助核对原榜,不参与算术平均复算;正式总分始终来自同一套分层评级模型。