HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分40
超越教师分配:领域归一化多教师同策略蒸馏(DN-MOPD)
Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation
AI 导读
针对多教师同策略蒸馏(MOPD)中指令跟随反馈的离散度是数学反馈的数倍、从而主导学生更新的问题,研究者提出领域归一化 MOPD(DN-MOPD),按各领域实测离散度重新缩放反馈。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org