跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分41

MEND:通过近端速度匹配为流模型做强化学习

MEND: RL For Flow Models via Proximal Velocity Matching

AI 导读

MEND 是一种基于近端速度匹配的流模型强化学习方法,在 prompt 组内对奖励设上限,仅当奖励增益超过二次位移代价时才接受沿奖励梯度的移动,无需 KL 项、冻结参考模型或优势权重。

来源:HuggingFace Daily Papers · arxiv.org