跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分48

Multimodal Flow:在嵌入空间统一语言与视觉的流建模

Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

AI 导读

Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunk,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场,并用联合注意力实现跨模态交互。

来源:HuggingFace Daily Papers · arxiv.org