HuggingFace Daily Papers(社区热门论文)·· 5 天前AI 评分33
NVAlign:面向连续自回归流匹配 TTS 非语言发声控制的直接梯度优化框架
NVAlign: Direct-Gradient Optimization for Non-Verbal Control in Continuous Autoregressive Flow Matching Text-to-Speech
AI 导读
NVAlign 是一个针对连续自回归流匹配 TTS 的直接梯度后训练框架,用于提升非语言发声(NVV)标签的跟随准确率。该方法先对 TTS 模型和 NVV 感知 ASR 模型做 SFT,再冻结 NV-ASR 作为奖励模型,通过两步梯度代理将奖励回传至流匹配采样器,联合更新自回归主干与声学流头。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org