热点事件观察中
TRM:视觉生成的思想奖励模型
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月29日,HuggingFace Daily Papers 收录论文《Think Before You Score》,研究者提出 Thinking Reward Model(TRM),用于视觉生成的奖励建模。该范式主张先明确每个样本中真正重要的评判维度,再评估候选结果表现;TRM 据此为每个样本生成自适应评分标准(case-adaptive rubrics),在评分标准引导下进行评估,并输出细粒度的 pointwise 奖励。论文同时引入 PD-GRPO,用于缓解成对偏好优化导致的分数极化问题。据该报道,在图像生成与编辑的奖励建模基准上,TRM 在开源奖励模型中达到 SOTA,并可与闭源方案竞争;作为强化学习的奖励信号,它还能稳定提升多种视觉生成模型的表现。上述结果均为论文作者在报道中的陈述。
AI 根据报道生成 · 2 小时前更新
最新进展9月29日 08:00
Think Before You Score:面向视觉生成的思想奖励模型 TRM报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- HuggingFace Daily Papers(社区热门论文)Think Before You Score:面向视觉生成的思想奖励模型 TRM
研究者提出 Thinking Reward Model(TRM),先为每个样本生成自适应评分标准再做评估,输出细粒度 pointwise 奖励,并引入 PD-GRPO 缓解成对偏好优化导致的分数极化。在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到 SOTA,并可与闭源方案竞争;作为强化学习奖励信号还能稳定提升多种视觉生成模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。