HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分37
GRAFT:用跨模型轨迹交换提升 RLVR 训练效率
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
AI 导读
针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org