HuggingFace Daily Papers(社区热门论文)·· 3 天前AI 评分41
TGRL:用温度分组强化学习提升 LLM 探索效率
TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs
AI 导读
研究者提出 Temperature-Grouped Reinforcement Learning(TGRL),将温度带来的 rollout 多样性转化为显式训练信号:把同一 prompt 的 rollout 组分为低温和高温子集,用两组奖励差异估计探索增益,并借助 JS 散度将组级信号分配为 token 级信用。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org