跳到正文
HuggingFace Daily Papers·· 3 天前AI 评分33

DiVeR:面向 VLA 测试时扩展的决策关键验证器学习

DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling

AI 导读

DiVeR 通过采样动作表示的离散度估计决策关键性,将验证器学习重新加权到动作选择最影响结果的状态,无需步级标注或额外环境交互。在 LIBERO、RoboCasa 及 Franka Research 3 真机实验中,DiVeR 借助更有效的验证器引导动作选择持续提升任务成功率,验证器推理开销可忽略。

来源:HuggingFace Daily Papers · arxiv.org