研究者提出在策略幂蒸馏OPPD方法
热点事件观察中
研究者提出在策略幂蒸馏OPPD方法
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
研究者提出在策略幂蒸馏(OPPD),让模型在单次生成中直接产出原本需幂分布采样才能得到的答案。训练时由被训练模型生成候选,冻结教师模型按幂分布对其加权,同一概率用于最大似然更新。 在 MATH500 和 GSM8K 上,单次生成准确率较未训练模型分别提升最高 23.0 和 27.3 分,比已发表的 64 候选幂采样高 2.4 和 3.5 分;仅用数学数据训练,HumanEval 准确率最高提升 5.3 分。
AI 根据报道生成 · 53 分钟前更新
最新进展10月5日 08:00
无需搜索的锐化:序列级幂分布的在策略蒸馏(OPPD)报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- HuggingFace Daily Papers无需搜索的锐化:序列级幂分布的在策略蒸馏(OPPD)
研究者提出在策略幂蒸馏(OPPD),让模型在单次生成中直接产出幂分布采样才能得到的答案:训练时由模型生成候选、冻结教师模型按幂分布加权,同一概率用于最大似然更新。在 MATH500 和 GSM8K 上,单次生成准确率较未训练模型分别提升最高 23.0 和 27.3 分,比已发表的 64 候选幂采样高 2.4 和 3.5 分。仅用数学数据训练,HumanEval 准确率最高提升 5.3 分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。