HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分38
EAPO:面向 LLM 推理探索的熵引导信用分配方法
Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
AI 导读
针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org