HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分41
Think Before You Score:面向视觉生成的思想奖励模型 TRM
Think Before You Score: Thinking Reward Model for Visual Generation
AI 导读
研究者提出 Thinking Reward Model(TRM),先为每个样本生成自适应评分标准再做评估,输出细粒度 pointwise 奖励,并引入 PD-GRPO 缓解成对偏好优化导致的分数极化。在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到 SOTA,并可与闭源方案竞争;作为强化学习奖励信号还能稳定提升多种视觉生成模型。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org