HuggingFace Daily Papers·· 3 天前AI 评分34
PerturBot:用扰动训练打破视觉-语言-动作模型中的捷径先验
PerturBot: Breaking Shortcut Priors in Vision-Language-Action Models with Perturbative Training
AI 导读
针对视觉-语言-动作(VLA)模型依赖模态捷径(视觉、词汇或动作线索即可预测专家动作)的问题,研究者提出 PerturBot,通过任务保持的手腕视角扰动、加入决策相关描述丰富指令、并混入随机与失败轨迹片段重新标注来训练,且不改变推理过程。同时提出离线评分 GroundingFscore,用于诊断策略对模态捷径的依赖程度,与任务成功率互补,判断模型是否健康扩展。
来源:HuggingFace Daily Papers · arxiv.org