热点事件观察中
GRAFT:跨模型轨迹交换用于RLVR
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月29日,HuggingFace Daily Papers(社区热门论文)收录一篇论文,提出GRAFT框架,用于提升RLVR(可验证奖励强化学习)的训练效率。 该工作针对GRPO等RLVR方法的问题:在有限的rollout预算下,训练中会出现“全失败组”(all-fail groups),导致缺失策略梯度信号。为此,研究者提出GRAFT(Gated Replacement of Answer-Failed groups with peer Trajectories),这是一个具备离策略(off-policy)感知能力的框架,用同伴模型(peer)的轨迹替换全失败组,从而获得有信息量的同伴组。为控制跨模型不匹配,GRAFT还采用序列级兼容性加权与token级重要性比率裁剪。 目前该报道仅介绍方法本身,未给出实验数据、适用模型范围或开源发布等后续进展。
AI 根据报道生成 · 2 小时前更新
最新进展9月29日 08:00
GRAFT:用跨模型轨迹交换提升 RLVR 训练效率报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- HuggingFace Daily Papers(社区热门论文)GRAFT:用跨模型轨迹交换提升 RLVR 训练效率
针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。