HuggingFace Daily Papers·· 5 天前AI 评分44
蒸馏学习该用 On-Policy 还是 Off-Policy?一项系统性研究
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
AI 导读
研究在 Llama3 与 Qwen2.5 系列上做强弱蒸馏实验,独立改变 rollout 策略、token 级 KL 方向和学习率,发现 rollout 策略并非核心因素:前向 KL 对 rollout 策略极不敏感且表现稳定,反向 KL 则明显更敏感、偏好学生模型自生成的 rollout,而学习率主导遗忘与更新稀疏性。
来源:HuggingFace Daily Papers · arxiv.org