HuggingFace Daily Papers·· 4 天前AI 评分35
CorrGRPO:面向多奖励学习的相关性归一化 GRPO
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
AI 导读
针对 GRPO 在多奖励场景下归一化易被大尺度相关奖励主导的问题,研究者提出 CorrGRPO,将成对协方差归一化为 Pearson 相关系数,在保持中心化总奖励不变的同时平衡不同尺度奖励的影响。在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数模型与 GRPO 及其他变体对比,三个领域均取得提升,代码已开源。
来源:HuggingFace Daily Papers · arxiv.org