HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分38
Diffusion Reward Models:用扩散模型做奖励建模的 DRM 方法
Diffusion Reward Models
AI 导读
研究者提出 DRM(Diffusion Reward Model),把奖励建模重构为对 p(r|x,y) 的条件密度估计:以冻结的 LLM 编码器为条件,用轻量 Diffusion Transformer 将高斯噪声去噪为奖励向量,从而不预设输出分布并自然刻画人类偏好的多模态结构。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org