# MOVA 开源：可扩展的同步视频-音频联合生成模型

- 来源：OpenMOSS / 复旦NLP / 上海创智 / MOSI（网页）
- 发布时间：2026-02-01 00:00
- AIHOT 分数：61
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmtym5ry70006rou1uyjr6ods
- 原文链接：https://openmoss.ai/blog/cn/mova

## 精选理由

原文给出双塔架构、参数规模和开源范围等具体细节，读者可以据此评估端到端音视频生成的可用性。

## AI 摘要

OpenMOSS 团队发布并全栈开源音视频联合生成模型 MOVA，支持文本或图像到同步音视频生成，覆盖口型同步语音、环境音效和内容匹配音乐。模型采用 MoE 架构总参数 32B、推理激活 18B，视频塔基于 14B 的 Wan 2.2 I2V、音频塔来自 1.3B 文本到音频扩散模型，单段生成 720p、8 秒视听片段，通过 Aligned ROPE 缓解音视频时间轴漂移。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
