HuggingFace Daily Papers·· 7 天前AI 评分35
RWTD:用奖励加权传输蒸馏对齐一步生成模型
Aligning One-Step Generative Models with Reward-Weighted Transport Distillation
AI 导读
研究者提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过特征空间最优传输与不动点回归,构建混合当前与参考分布的自适应目标。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,并在偏好对齐实验中展现出较强的跨奖励泛化能力。
来源:HuggingFace Daily Papers · arxiv.org