Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

Google DeepMind:Blog(RSS)·2026-09-23 23:25·1小时前·Leland Rechis
AI 导读

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。

Google DeepMind:Blog(RSS)
精选
73AI 编辑部评分,满分 100

Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

2026-09-23 23:25· 1小时前· Leland Rechis
AI 导读

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。

推荐理由

官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。

正文 · AI 翻译

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 是我们迄今最具表现力的音频生成模型。可在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中生成自定义角色语音并指导场景对话。


Leland Rechis

产品组经理

Alan Cowen

研究科学总监,代表 Gemini Audio 团队


a text card image reading "Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS"

今天,我们为 Gemini 家族推出两款全新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。这些模型让创作者、开发者和企业能够打造更丰富、更具表现力的音频体验,同时为 Gemini Notebook Google Vids 等产品带来更出色的用户体验。

  • Gemini 3.8 Flash TTS:专为深度创意指导和角色设计而打造。使用自然语言提示词从零开始创造全新语音,让角色在游戏、沉浸式有声书、播客和互动媒体中栩栩如生。逐行指导每一段表演,对表演提示、节奏、方言转换和应和语进行精细控制。
  • Gemini 3.8 Flash-Lite TTS: 专为高吞吐量、高性价比的规模化场景打造。针对大批量配音、音频内容创作以及富有表现力的语音智能体进行了优化,可对语调、节奏和表达细节进行精细控制。

这些模型补充了我们快速壮大的 Gemini Audio 家族,此前已推出 3.5 Live Translate3.5 Transcribe3.8 Live 和 3.8 Live Extended Thinking

创建并自定义你自己的声音

从 30 种原创声音扩展到无限的声音库。无论你需要一个完全原创的角色声音,还是一个保持一致的品牌代言人声音,我们的 3.8 Flash TTS 模型都能驱动一整套声音工作室。这让你能够为每一个时刻创建并使用富有表现力、听起来自然的声音,同时赋能开发者和企业轻松构建自定义音频体验。

  • 生成式声音设计: 借助 Gemini 3.8 Flash TTS,通过自然语言提示词,在 100 多种语言和方言中自定义角色、口音和声音特征,从零开始打造定制声音——无论你是要让一条戏剧性的喷火龙活灵活现,还是打造一位带有独特地域韵律的魅力旁白者。

听听 Gemini 3.8 Flash TTS 如何生成一位来自墨尔本、充满活力的 DJ 声音。

听听 Gemini 3.8 Flash TTS 如何生成一个极其单薄、单调的机器人声音。

听听 Gemini 3.8 Flash TTS 如何让一条日本龙栩栩如生。

  • 海量语音库:可访问 2,000 多种可直接用于生产的语音,语言覆盖广泛——包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
  • 语音复刻:只需一段 30 秒的音频样本,即可用你自己的声音或你拥有使用权的他人声音,重建一致的语音特征,并以内置的同意验证、SynthID 水印和 C2PA 凭证作为支撑,从而同时保护开发者及其配音人才。
  • 保存与扩展:保存并管理你设计的自定义语音,以确保在持续进行的项目中保持一致的性能并最大限度减少漂移。
  • 语音混音:即将推出,从我们的语音库中挑选一个声音,并微调音色、音高、语速和口音。使用提示词来调整特征(例如“加入微妙的美国南部口音”或“让表达更柔和”)。

逐行指导表演

选定语音后,两个 TTS 模型都能让你精确控制每一行的表达方式。

  • 逐行指导表演:你可以自己撰写舞台指示,也可以让 Gemini 借助自然的脚本提示来引导表达——从冷静的客服智能体到低声细语的悬疑场景,皆可实现。

聆听 Gemini 3.8 Flash TTS 如何为交互式语音智能体实现自然、极具表现力的对话。

观看并聆听 Gemini 3.8 Flash TTS 如何利用精细的脚本控制,打造深度沉浸、引人入胜的音频体验。

  • 长音频生成:在长达数小时的连续音频中保持高音质、自然的节奏和角色音色,说话人漂移极小——非常适合播客和有声书。
  • 原生双说话人场景编排:从单一脚本无缝指导多轮对话——无论是播客还是戏剧化叙事——同时让两个声音清晰分离,并具备自然的对话轮替。
  • 脚本化的人声爆发与附和应答:使用非语言提示(如 <laughs>、<sigh>、<gasp>)和积极倾听的插入语(如 |mhm| 或 |yeah|)添加逼真的对话质感,以实现精准的喜剧节奏和反应节拍。

了解 Gemini 3.8 Flash TTS 如何从零开始将自然语言提示词转化为定制的语音人设。

观看 Gemini 3.8 Flash TTS 如何让创作者设计自定义场景,将动画对话生动呈现。

看看 Gemini 3.8 Flash TTS 如何将脚本转化为完整演绎的对话场景,让创作者能够指导语音表达,并实现自然的轮流对话。

获取专为全球规模打造的表现力丰富的高质量语音生成能力

Gemini 3.8 Flash TTS 提供领先的语音定制能力,在 Hume AI 的语音设计基准测试中夺得总分第一(71.4),并在口音建模方面同样领先(60.8)。

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 能够实现真正富有表现力的演绎,同时不牺牲可靠性,并分别在 Hume AI 的总体质量指数中夺得第一和第二名。与 Gemini 3.1 Flash TTS 相比,该模型在长篇内容和双人剧本控制等广泛用例上展现出重大改进。

Voice Arena 的盲测人类偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语(MSA)、墨西哥西班牙语和印地语等关键全球语言中,于竞争对手之间占据领先位置。这些模型支持超过 100 种语言,赋能创作者、开发者和企业,在全球范围内构建高质量的多语言语音体验。

An evaluation showing text-to-speech quality benchmark Hume AI an evaluation chart showing text to speech voice design leaderboard Hume AI an evaluation chart showing text to speech leaderboard for Voice Arena

以信任、同意和透明为基础进行构建

我们在构建语音创建与复刻能力时,配备了严格的防护措施,以帮助保护配音人才、尊重身份,并确保内容透明度。对于语音复刻,我们的系统采用同意验证机制:用户必须提供一段来自声音所有者的口头同意录音,且该录音需与参考说话人匹配,之后才能创建语音。

更广泛地说,我们的 Gemini Audio 模型生成的每一段音频片段都带有 SynthID 水印。这种不可感知的水印被直接织入音频输出之中,确保 AI 生成的语音始终可被检测,从而帮助防止虚假信息。如需进一步了解我们在安全与责任方面的做法,请查阅 模型卡

试用我们全新的 Google AI Studio 音频演练场

从今天起,开发者可以体验这些全新的语音生成能力,在Google AI Studio中。它被打造为一个语音设计工作区,你可以从零开始通过提示词创造全新的声音身份,或复刻你自己的声音1,然后将它们直接带入双说话人剧本编辑器,逐行指导语音的表达方式。

在 Google AI Studio 中试用语音复刻。

轻松部署高性能语音交互界面

通过使用 Gemini API,AgoraLiveKitPipecatVercel 等开发者平台让开发者能够轻松构建和部署高性能的语音生成体验。

我们正与 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作,它们正在集成我们最新的 TTS 模型,以帮助加速全球配音、以细腻的地区口音本地化媒体内容,并大规模驱动对话式语音智能体。

a quote from Darius Cheung, CEO and Co-Founder of 99 Group a quote from Mason Adams, Developer Evangelist, Agora a quote from Jonathan Gur-Zeev, Director of Product, Figma Weave a quote from Bin Liu, VP of Engineering for Hygen a quote card from Luke Pane, Developer, katsuyo quote from Ritwik Baranwal, Associate Director AI/ML of kuku. a quote from Oded Shafran, Co-Founder & CTO of linguana Aziz Ulak, CTO & Co-founder, Ollang a quote from Phil Marshall, Founder and CEO of Spoken quote from Zina Rahman, Co-Founder and CEO, Transforms.AI quote from Mei Ki Yiu, CTO of Wondercraft

开始使用我们最新的 Gemini Audio 模型:

Gemini 3.8 Flash TTS 从今天起开始推送:

Gemini 3.8 Flash-Lite TTS 从今天起开始推送: