按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)MOVA 开源:可扩展的同步视频-音频联合生成模型
AI 导读
OpenMOSS 团队发布并全栈开源音视频联合生成模型 MOVA,支持文本或图像到同步音视频生成,覆盖口型同步语音、环境音效和内容匹配音乐。模型采用 MoE 架构总参数 32B、推理激活 18B,视频塔基于 14B 的 Wan 2.2 I2V、音频塔来自 1.3B 文本到音频扩散模型,单段生成 720p、8 秒视听片段,通过 Aligned ROPE 缓解音视频时间轴漂移。
OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)
精选
61
AI 编辑部评分,满分 100MOVA 开源:可扩展的同步视频-音频联合生成模型
OpenMOSS 团队发布并全栈开源音视频联合生成模型 MOVA,支持文本或图像到同步音视频生成,覆盖口型同步语音、环境音效和内容匹配音乐。模型采用 MoE 架构总参数 32B、推理激活 18B,视频塔基于 14B 的 Wan 2.2 I2V、音频塔来自 1.3B 文本到音频扩散模型,单段生成 720p、8 秒视听片段,通过 Aligned ROPE 缓解音视频时间轴漂移。
推荐理由
原文给出双塔架构、参数规模和开源范围等具体细节,读者可以据此评估端到端音视频生成的可用性。
来源:OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)· openmoss.ai