HuggingFace Daily Papers·· 2 天前AI 评分54
Kandinsky 6.0 Video 发布:同步音视频生成的开源基础模型
Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation
AI 导读
Kandinsky 6.0 Video 发布,包含 3B 的 Lite 和 29B 的 Pro 两个基础扩散模型,支持文生音视频(T2AV)和图生音视频(I2AV),可生成 5 秒带 44 kHz 同步音频(含唇同步)的视频,经内置超分模型提升至 Full-HD(1920×1080)。
来源:HuggingFace Daily Papers · arxiv.org