跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 3 天前AI 评分32

PMOPD:多教师在线策略蒸馏中的任务排序、循环与参数更新子空间保护

PMOPD: Task Ordering, Cycling, and Parameter-Update Subspace Protection in Multi-Teacher On-Policy Distillation

AI 导读

针对多教师在线策略蒸馏(MOPD)中的能力跷跷板问题,研究者提出 PMOPD,通过从各任务累积参数位移构建子空间记忆,对梯度和优化器更新做投影以消除跨任务干扰,并配合轻量冲突探针指导任务排序与循环策略。在 Code、Reason、Math 任务上,PMOPD 全面优于 MOPD,Qwen2.5-7B 平均分提升 2.54 分,Llama-3.1-8B 提升 2.09 分。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org