跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分54

Kandinsky 6.0 Video 发布:同步音视频生成的开源基础模型

Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation

AI 导读

Kandinsky 6.0 Video 发布,包含 3B 的 Lite 和 29B 的 Pro 两个基础扩散模型,支持文生音视频(T2AV)和图生音视频(I2AV),可生成 5 秒带 44 kHz 同步音频(含唇同步)的视频,经内置超分模型提升至 Full-HD(1920×1080)。

来源:HuggingFace Daily Papers · arxiv.org