HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分38
从强化学习视角看 OPD:面向样本高效 LLM 推理的最小二乘策略蒸馏
An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning
AI 导读
研究者从强化学习视角重新审视 on-policy distillation(OPD),提出 Least-Square Policy Distillation(LSPD)框架,将价值型 RL 中的乐观探索与 off-policy 数据复用引入策略蒸馏。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org