跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 6 天前AI 评分42

LastOPD:解决潜在在线策略蒸馏中的性能崩溃

LastOPD: Taming Collapse in Latent On-Policy Distillation

AI 导读

研究者在将 Qwen3-4B 和 Qwen3-8B 蒸馏到 Qwen3-1.7B-Base 时发现,潜在监督会让 MATH-500 准确率在 10 步内从 25 升到 46,随后却崩到 11 且无法恢复,而对齐指标仍在持续改善。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org