跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分38

EAPO:面向 LLM 推理探索的熵引导信用分配方法

Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning

AI 导读

针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org