HuggingFace Daily Papers·· 2 天前AI 评分32
DARA:面向多奖励强化学习的密度感知奖励聚合方法
Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
AI 导读
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重,且不改变底层策略优化目标。在工具调用任务上,DARA 达到高格式合规所需训练步数比 GDPO 最多减少 26%;在数学推理任务上,接近饱和的长度合规所需步数最多减少 65%,最终性能保持竞争力。
来源:HuggingFace Daily Papers · arxiv.org