跳到正文
HuggingFace Daily Papers·· 6 天前AI 评分33

iADD:改进扩散策略优化中的对齐与多样性

iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

AI 导读

针对 DDPO 等扩散模型强化学习后训练方法在奖励优化中牺牲多样性与质量的问题,研究者提出 iADD,通过理论分析证明仅对扩散模型后段 timestep 更新可能损害多样性,并基于增量 Feynman-Kac 训练实现更优的对齐-多样性权衡。在三个任务上的实验与消融显示,该方法在对齐和多样性两方面均取得显著提升。

来源:HuggingFace Daily Papers · arxiv.org