跳到正文
HuggingFace Daily Papers·· 7 天前AI 评分35

RWTD:用奖励加权传输蒸馏对齐一步生成模型

Aligning One-Step Generative Models with Reward-Weighted Transport Distillation

AI 导读

研究者提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过特征空间最优传输与不动点回归,构建混合当前与参考分布的自适应目标。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,并在偏好对齐实验中展现出较强的跨奖励泛化能力。

来源:HuggingFace Daily Papers · arxiv.org