HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分46
EasyPPO:稳定 critic 是 PPO 训练 LLM 的关键
EasyPPO: Stabilizing the Critic Is Key
AI 导读
EasyPPO 通过仅对 actor 做超长过滤、按采样回报标准差倒数加权 critic 回归、并适度缩小 critic mini-batch,解决了 PPO 中 critic 的两类失稳问题。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org