返回
精选AI 评分 61/100

MOVA 开源:可扩展的同步视频-音频联合生成模型

OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)·2026-02-01 00:00·224天前
AI 导读

OpenMOSS 团队发布并全栈开源音视频联合生成模型 MOVA,支持文本或图像到同步音视频生成,覆盖口型同步语音、环境音效和内容匹配音乐。模型采用 MoE 架构总参数 32B、推理激活 18B,视频塔基于 14B 的 Wan 2.2 I2V、音频塔来自 1.3B 文本到音频扩散模型,单段生成 720p、8 秒视听片段,通过 Aligned ROPE 缓解音视频时间轴漂移。

OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)
精选
61AI 编辑部评分,满分 100

MOVA 开源:可扩展的同步视频-音频联合生成模型

2026-02-01 00:00· 224天前
AI 导读

OpenMOSS 团队发布并全栈开源音视频联合生成模型 MOVA,支持文本或图像到同步音视频生成,覆盖口型同步语音、环境音效和内容匹配音乐。模型采用 MoE 架构总参数 32B、推理激活 18B,视频塔基于 14B 的 Wan 2.2 I2V、音频塔来自 1.3B 文本到音频扩散模型,单段生成 720p、8 秒视听片段,通过 Aligned ROPE 缓解音视频时间轴漂移。

推荐理由

原文给出双塔架构、参数规模和开源范围等具体细节,读者可以据此评估端到端音视频生成的可用性。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)· openmoss.ai