HuggingFace Daily Papers·· 7 天前AI 评分35
Dream4ACT:面向多形态视频-动作建模的共享视觉动作接口
Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling
AI 导读
Dream4ACT 是一个面向多形态机器人的视频-动作世界模型,通过将目标关节配置从四个预设虚拟相机渲染为共享的 action views,让观测与动作序列共用同一视频自编码器和扩散 Transformer。
来源:HuggingFace Daily Papers · arxiv.org