跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分38

Diffusion Reward Models:用扩散模型做奖励建模的 DRM 方法

Diffusion Reward Models

AI 导读

研究者提出 DRM(Diffusion Reward Model),把奖励建模重构为对 p(r|x,y) 的条件密度估计:以冻结的 LLM 编码器为条件,用轻量 Diffusion Transformer 将高斯噪声去噪为奖励向量,从而不预设输出分布并自然刻画人类偏好的多模态结构。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org