HuggingFace Daily Papers(社区热门论文)·· 3 天前AI 评分36
重新审视 LLM 强化学习中的训练-推理不匹配:来源与校正方法
Rethinking Training-Inference Mismatch in LLM Reinforcement Learning: Where It Arises and How to Correct It
AI 导读
研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org