跳到正文
HuggingFace Daily Papers·· 5 天前AI 评分37

DEFINE:用示例音频解耦说话人身份与口音的零样本 TTS 框架

DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS

AI 导读

DEFINE 是一个端到端零样本 TTS 框架,通过分别以说话人身份和口音示例音频作为条件,将两者解耦,并可在推理时用单一引导权重连续控制口音强度而无需重训练。它基于 F5-TTS 与 LoRA 适配,在已见口音上把口音探测准确率从 6.5% 提升到 19.6%,单个模型在已见和域外口音上可媲美双模型 TTS-语音转换级联,同时说话人相似度更高。

来源:HuggingFace Daily Papers · arxiv.org