跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分40

PanoVLN:面向全景视觉语言导航的有效方案

PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation

AI 导读

PanoVLN 通过让模型从单张全景图预测更长动作序列,并引入置信度引导执行(CGE)策略动态决定执行步数,在 R2R-CE 和 RxR-CE Val-Unseen 上成功率分别超越此前 SOTA 11.9% 和 8.7%。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org