跳到正文
原文
Mistral AI:News(网页)·· 2026-03-23精选AI 评分70

Mistral AI 发布首个文本转语音模型 Voxtral TTS

Voxtral TTS

AI 导读

Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。

推荐理由

官方公布了模型架构、延迟数据和与 ElevenLabs 的人类评测对比,可据此评估其在语音智能体场景的适用性。

正文 · AI 翻译

思考

摘要

Mistral AI 推出了 Voxtral TTS,这是一款 4B 参数的文本转语音模型,能够以 9 种语言提供最先进的多语言语音生成,语音逼真且富有情感表现力,延迟低,并易于进行声音适配。该模型在上下文理解、说话人建模以及零样本跨语言声音适配方面表现出色,非常适合企业语音工作流和可扩展的 AI 智能体。它可通过 API 和 Mistral Studio 使用,提供高性价比、高质量的语音生成,起价为每 1k 字符 $0.016。

今天我们发布 Voxtral TTS,这是我们首个文本转语音模型,在多语言语音生成方面达到最先进的性能。该模型轻量,仅有 4B 参数,使由 Voxtral 驱动的智能体能够自然、可靠且大规模地保持成本效益。

亮点。

  1. 以 9 种常用语言提供逼真、富有情感表现力的语音,并支持多种方言。

  2. 首音频延迟极低。

  3. 易于适配新声音。

  4. 可在 Mistral Studio 中测试。

  5. 企业级文本转语音,为关键语音智能体工作流提供支持。

自然的语音生成不仅取决于模型朗读文本的能力,还取决于它能否准确诠释文本。上下文理解——例如中性、开心、讽刺等——决定了听者认为生成结果是准确还是机械。我们的模型在上下文理解和说话人建模方面都表现出色:能够捕捉特定人物自然的说话方式。我们的声音适配超越了传统的朗读语音,能够捕捉说话人的个性,包括其自然的停顿、节奏、语调和情感灵活性。凭借其紧凑的规模、低成本与低延迟以及易于适配性,Voxtral TTS 为希望掌控自身语音 AI 技术栈的企业提供了完全的控制与定制能力。

音频是新的用户体验。创造仅存在于语音中的协作与理解的新交互。现在就在 AI Studio 中使用我们的 Mistral Voices,体验美式、英式和法式口音。

听一听再判断:你能分辨出区别吗?

我们的团队使用数十种语言和多种方言,我们理解文化细微差别的重要性,并构建了一个能够反映我们自身的模型。语音生成通过类自然的节奏、情感,甚至幽默的使用来建立信任。这就是为什么在声音模拟中,我们专注于真实性和情感表现力。

声音模拟

最先进的性能。

词错误率和音频质量分数等自动化指标,对于多语言文本转语音系统而言,无法衡量语音的自然度。语音之所以自然,其因素极其细微,需要深入理解文化差异和典型说话模式。因此,由母语者进行的比较性人工评估至关重要。

对于语音智能体而言,延迟和质量始终相互制约。人工评估显示,与 ElevenLabs Flash v2.5 相比,Voxtral TTS 实现了更出色的自然度,同时保持相近的首音频时间(TTFA)。Voxtral 的质量也与 ElevenLabs v3 相当,成功支持情感引导,从而实现更逼真的交互。

Voxtral TTS Winrate (1)

我们在零样本自定义语音场景下,对 Voxtral TTS 和 ElevenLabs v2.5 Flash 进行了对比性人工评估。针对所支持的 9 种语言,每种语言使用两个可辨识的母语方言声音,3 位标注员对每一对声音在自然度、口音贴合度和与原始参考的声学相似度方面进行并排偏好测试。在这一零样本多语言自定义语音场景下,Voxtral TTS 拉大了与 v2.5 Flash 的质量差距,凸显了 Voxtral TTS 对任意声音的即时可定制性。

母语般自然表达。

Voxtral TTS 基于大规模语音数据集训练,专为全球应用而打造。它在 9 种语言中均达到最先进的性能:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语。

该模型经过训练,能够仅凭短至 3 秒的参考音频适配自定义声音,并且不仅捕捉声音本身,还能捕捉细微口音、语调变化、语气,甚至类似参考音频中表现出的不流畅现象等细节。我们在 API 中提供了一些预设声音选项,但也可以轻松扩展到你的内部声音库,根据用例进行定制,本地化到特定语言和口音,保持中性或更具情感,随意或正式,更自然对话化或更机械。

该模型还展现出零样本跨语言声音适配能力,尽管它并未为此进行显式训练。例如,模型可以用法语声音提示和英语文本生成英语语音。生成的语音听起来自然,同时采用所提供声音提示的口音(在此示例中,生成的语音是自然的法式口音英语)。这使该模型可用于构建级联语音到语音翻译系统。

级联语音到语音翻译

点击说话人以运行级联语音到语音翻译。

提示

在我们开始之前,我需要核实一些细节。你能确认你的全名和出生日期吗?

生成的音频

Voxtral TTS

为低延迟流式传输而打造。

延迟对语音代理应用至关重要。对于典型的 10 秒输入语音样本和 500 个字符,Voxtral TTS 实现了 70ms 的模型延迟,实时因子(RTF)约为 9.7 倍。该模型原生可生成最长两分钟的音频,我们的 API 通过智能交错处理支持任意长度的生成。

Voxtral TTS 架构。

该模型是一个基于 transformer 的自回归流匹配模型,构建于 Ministral 3B 之上。它由以下组件构成:

  • 3.4B 参数的 transformer 解码器主干

  • 390M 的流匹配声学 transformer

  • 300M 的神经音频编解码器(对称编码器-解码器)

该模型接收声音提示(5 至 25 秒)和 9 种受支持语言之一的文本提示。对于每个音频帧,transformer 主干预测一个语义 token,然后流匹配 transformer 运行 16 次函数评估(NFE)以生成声学潜变量。

我们开发了一个内部编解码器,它使用语义 VQ(8192 词汇量)和声学 FSQ(36 维、21 级)潜变量以因果方式处理音频,并以 12.5Hz 的帧率生成它们。

Audio Infographic

赋能企业语音工作流。


Voxtral TTS 补全了音频智能的闭环,为企业语音流水线提供了通过人类测试的输出层。它与 Voxtral Transcribe 协同工作,实现完整的语音到语音,或集成到任何现有的语音转文本和 LLM 技术栈中,并支持跨语言。

工作流

客户支持

语音代理可跨渠道路由并解决查询,使用自然、符合品牌调性的语音。 将 Voxtral TTS 接入现有的联系支持呼叫系统,实现自动语音响应,其输出可集成到现有工作流中。

在 Mistral Studio 中试运行该模型。

直接在 Mistral Studio playground 中试用 Voxtral TTS。选择一种 Mistral 语音或录制你自己的语音。

开始使用 Voxtral TTS。

Voxtral TTS 现已通过 API 提供,价格为每 1k 字符 $0.016。

立即在 Mistral Studio 或 Le Chat 中试用。 

一个包含多个参考语音的模型已作为开放权重在 Hugging Face 上发布,采用 CC BY NC 4.0 许可。

查看该模型的文档或阅读我们的研究论文。

报名参加我们即将举办的网络研讨会以了解更多! 

我们正在招聘!

我们正在构建 AI 的语音层,如果这正是你想研究的问题,我们期待你的来信。

来源:Mistral AI:News(网页) · mistral.ai