跳到正文
HuggingFace Daily Papers·· 3 天前AI 评分37

PixelUMM:无需编码器的统一图像与视频理解生成模型

PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation

AI 导读

PixelUMM 是一个无需视觉编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成。它将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干,并采用 Mixture-of-Transformers 架构结合共享注意力与任务专属参数,同时支持自回归文本预测和像素空间流匹配。

来源:HuggingFace Daily Papers · arxiv.org