热点事件观察中
离散扩散模型中确定性PRM引导表现不佳
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月28日,HuggingFace Daily Papers 收录一篇社区热门论文,研究确定性 PRM(过程奖励模型)引导在离散扩散语言模型推理中的效果。研究显示,在同等前向计算预算下,确定性 PRM 引导的推理不如独立采样加 ORM(结果奖励模型)重排:在 Dream-v0-Instruct-7B 上,GSM8K 每题 8 个候选时前者准确率为 65.18%,后者达 75.13%;候选数增至 32 个时,差距扩大到 12.69 个百分点。作者将这一现象归因于引导阶段信号弱,以及 PRM 作为最终评判者能力不足,并随论文发布了去噪状态语料与评测工具包。
AI 根据报道生成 · 2 小时前更新
最新进展9月28日 08:00
新论文显示确定性PRM引导在离散扩散推理中不及独立采样加ORM重排,并发布相关语料与工具包。报道时间线
沿着报道,了解事件的不同侧面。
9月28日
- HuggingFace Daily Papers(社区热门论文)为何确定性 PRM 引导在离散扩散推理中表现不佳
研究显示,在同等前向计算预算下,确定性 PRM 引导的离散扩散语言模型推理不如独立采样加 ORM 重排。在 Dream-v0-Instruct-7B 上,GSM8K 每题 8 个候选时前者准确率 65.18%,后者达 75.13%,32 个候选时差距扩大到 12.69 个百分点。作者将其归因于引导阶段信号弱和 PRM 作为最终评判者能力不足,并发布了去噪状态语料与评测工具包。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。