HuggingFace Daily Papers·· 2 天前AI 评分41
MEND:通过近端速度匹配为流模型做强化学习
MEND: RL For Flow Models via Proximal Velocity Matching
AI 导读
MEND 是一种基于近端速度匹配的流模型强化学习方法,在 prompt 组内对奖励设上限,仅当奖励增益超过二次位移代价时才接受沿奖励梯度的移动,无需 KL 项、冻结参考模型或优势权重。
来源:HuggingFace Daily Papers · arxiv.org