跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分37

GRAFT:用跨模型轨迹交换提升 RLVR 训练效率

Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

AI 导读

针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org