跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分33

SCOUT:面向在线策略蒸馏的教师模型学生条件化更新框架

On the Off-Policy Teacher in On-Policy Distillation

AI 导读

针对在线策略蒸馏(OPD)中教师模型需监督学生生成前缀、但自身仅按自有策略前缀优化导致续写性能随前缀变长而下降的问题,研究者提出协同训练框架 SCOUT,通过带可验证奖励的强化学习定期优化教师对学生前缀的条件续写能力。在多种教师—学生配置、模型规模和推理领域上,SCOUT 均持续提升在线策略蒸馏效果。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org