跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分41

Think Before You Score:面向视觉生成的思想奖励模型 TRM

Think Before You Score: Thinking Reward Model for Visual Generation

AI 导读

研究者提出 Thinking Reward Model(TRM),先为每个样本生成自适应评分标准再做评估,输出细粒度 pointwise 奖励,并引入 PD-GRPO 缓解成对偏好优化导致的分数极化。在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到 SOTA,并可与闭源方案竞争;作为强化学习奖励信号还能稳定提升多种视觉生成模型。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org