跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 3 天前AI 评分41

TGRL:用温度分组强化学习提升 LLM 探索效率

TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

AI 导读

研究者提出 Temperature-Grouped Reinforcement Learning(TGRL),将温度带来的 rollout 多样性转化为显式训练信号:把同一 prompt 的 rollout 组分为低温和高温子集,用两组奖励差异估计探索增益,并借助 JS 散度将组级信号分配为 token 级信用。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org