跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分42

Where the Model Changes Its Mind:用后见分歧定位实现高效可验证奖励强化学习

Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards

AI 导读

研究者提出 Hindsight-Divergence Localization(HDL),利用后见诱导的 token 对数似然变化来选取分支点,只从关键位置生成续写并仅用新生成的后缀更新策略。在数学、代码和智能体任务上,相比同等组规模与训练步数的 GRPO,HDL 生成 token 最多减少 2.5 倍、rollout 墙钟时间提速 1.8 倍,智能体任务性能最高提升 12.5 分。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org