HuggingFace Daily Papers·· 5 天前AI 评分37
DEFINE:用示例音频解耦说话人身份与口音的零样本 TTS 框架
DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS
AI 导读
DEFINE 是一个端到端零样本 TTS 框架,通过分别以说话人身份和口音示例音频作为条件,将两者解耦,并可在推理时用单一引导权重连续控制口音强度而无需重训练。它基于 F5-TTS 与 LoRA 适配,在已见口音上把口音探测准确率从 6.5% 提升到 19.6%,单个模型在已见和域外口音上可媲美双模型 TTS-语音转换级联,同时说话人相似度更高。
来源:HuggingFace Daily Papers · arxiv.org