跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分40

超越教师分配:领域归一化多教师同策略蒸馏(DN-MOPD)

Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

AI 导读

针对多教师同策略蒸馏(MOPD)中指令跟随反馈的离散度是数学反馈的数倍、从而主导学生更新的问题,研究者提出领域归一化 MOPD(DN-MOPD),按各领域实测离散度重新缩放反馈。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org