HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分48
为何确定性 PRM 引导在离散扩散推理中表现不佳
Why Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning
AI 导读
研究显示,在同等前向计算预算下,确定性 PRM 引导的离散扩散语言模型推理不如独立采样加 ORM 重排。在 Dream-v0-Instruct-7B 上,GSM8K 每题 8 个候选时前者准确率 65.18%,后者达 75.13%,32 个候选时差距扩大到 12.69 个百分点。作者将其归因于引导阶段信号弱和 PRM 作为最终评判者能力不足,并发布了去噪状态语料与评测工具包。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org