跳到正文
HuggingFace Daily Papers·· 7 天前AI 评分35

Dream4ACT:面向多形态视频-动作建模的共享视觉动作接口

Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling

AI 导读

Dream4ACT 是一个面向多形态机器人的视频-动作世界模型,通过将目标关节配置从四个预设虚拟相机渲染为共享的 action views,让观测与动作序列共用同一视频自编码器和扩散 Transformer。

来源:HuggingFace Daily Papers · arxiv.org