跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分39

StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

AI 导读

StructRL 是一个在线强化学习框架,通过将任务分解为可验证子任务、仅在前置子任务完成后给予中间奖励并按完成速度缩放奖励,为长时程 VLA 任务构建结构化中间监督。在 RoboCasa365 和 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于所评估的在线 RL 基线。结果表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已开源。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org