跳到正文
热点事件观察中

研究者提出在策略幂蒸馏OPPD方法

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

研究者提出在策略幂蒸馏(OPPD),让模型在单次生成中直接产出原本需幂分布采样才能得到的答案。训练时由被训练模型生成候选,冻结教师模型按幂分布对其加权,同一概率用于最大似然更新。 在 MATH500 和 GSM8K 上,单次生成准确率较未训练模型分别提升最高 23.0 和 27.3 分,比已发表的 64 候选幂采样高 2.4 和 3.5 分;仅用数学数据训练,HumanEval 准确率最高提升 5.3 分。

AI 根据报道生成 · 53 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. HuggingFace Daily Papers
    无需搜索的锐化:序列级幂分布的在策略蒸馏(OPPD)

    研究者提出在策略幂蒸馏(OPPD),让模型在单次生成中直接产出幂分布采样才能得到的答案:训练时由模型生成候选、冻结教师模型按幂分布加权,同一概率用于最大似然更新。在 MATH500 和 GSM8K 上,单次生成准确率较未训练模型分别提升最高 23.0 和 27.3 分,比已发表的 64 候选幂采样高 2.4 和 3.5 分。仅用数学数据训练,HumanEval 准确率最高提升 5.3 分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。