跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分46

重新思考自动语音相似度:从 EER 转向嵌入向量几何

Rethinking Automated Voice Similarity by Shifting from EER to Embedding Geometry

AI 导读

研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org