跳到正文
原文
HuggingFace Daily Papers·· 4 天前AI 评分47

VLA 强化学习的低秩结构:RL 如何重塑 π_{0.5} 与 GR00T N1.5/N1.6

The Low-Rank Structure of VLA Reinforcement Learning

AI 导读

研究发现,在 LIBERO、ManiSkill、MetaWorld 和 CALVIN 上对 π_{0.5}、GR00T N1.5/N1.6 等 flow-based VLA 模型做强化学习后训练,参数更新呈现显著低秩,且高度集中在动作专家的 Timestep Modules 中。

来源:HuggingFace Daily Papers · arxiv.org