HuggingFace Daily Papers·· 8 天前AI 评分33
研究发现 on-policy 参数更新方向是 LLM 后训练泛化关键,提出 OPSFT 方法
On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training
AI 导读
研究提出 On-Policy 方向约束监督微调(OPSFT),将 SFT 的参数更新约束到 on-policy 范式识别出的更新方向上,从而把 on-policy 的泛化优势迁移到 SFT。分析显示 SFT 沿一致方向更新参数,而 on-policy 范式在训练中持续调整方向。OPSFT 兼具 on-policy 的强泛化与 SFT 的高训练效率和利用高质量轨迹的能力。
来源:HuggingFace Daily Papers · arxiv.org