跳到正文
热点事件观察中

GRAFT:跨模型轨迹交换用于RLVR

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年9月29日,HuggingFace Daily Papers(社区热门论文)收录一篇论文,提出GRAFT框架,用于提升RLVR(可验证奖励强化学习)的训练效率。 该工作针对GRPO等RLVR方法的问题:在有限的rollout预算下,训练中会出现“全失败组”(all-fail groups),导致缺失策略梯度信号。为此,研究者提出GRAFT(Gated Replacement of Answer-Failed groups with peer Trajectories),这是一个具备离策略(off-policy)感知能力的框架,用同伴模型(peer)的轨迹替换全失败组,从而获得有信息量的同伴组。为控制跨模型不匹配,GRAFT还采用序列级兼容性加权与token级重要性比率裁剪。 目前该报道仅介绍方法本身,未给出实验数据、适用模型范围或开源发布等后续进展。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. HuggingFace Daily Papers(社区热门论文)
    GRAFT:用跨模型轨迹交换提升 RLVR 训练效率

    针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。