跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分44

ROSS:通过选择性监督从自生成 rollout 中再学习

ROSS: Relearning from Self-Generated Rollouts through Selective Supervision

AI 导读

ROSS 提出一种选择性监督方法,将历史轨迹完整保留为上下文,仅对选定的模型生成续写计算损失,从而复用自生成 rollout 中的行为经验。在 Qwen3.6-35B-A3B 上,ROSS 将六项基准的 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org