HuggingFace Daily Papers·· 2 天前AI 评分49
无需搜索的锐化:序列级幂分布的在策略蒸馏(OPPD)
Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution
AI 导读
研究者提出在策略幂蒸馏(OPPD),让模型在单次生成中直接产出幂分布采样才能得到的答案:训练时由模型生成候选、冻结教师模型按幂分布加权,同一概率用于最大似然更新。在 MATH500 和 GSM8K 上,单次生成准确率较未训练模型分别提升最高 23.0 和 27.3 分,比已发表的 64 候选幂采样高 2.4 和 3.5 分。仅用数学数据训练,HumanEval 准确率最高提升 5.3 分。
来源:HuggingFace Daily Papers · arxiv.org