# Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

- 来源：Google DeepMind：Blog（RSS）
- 作者：Leland Rechis
- 发布时间：2026-09-23 23:25
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmuea8xrm0t1nroghhxj2y3eg
- 原文链接：https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech

## 精选理由

官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口，开发者可以据此评估语音生成工作流的选型。

## AI 摘要

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型，支持用自然语言提示词从零设计声音、30 秒样本复刻声音，并提供逐行表演指导、长时音频生成和双说话人场景编排，覆盖 100 多种语言。

## 正文

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 是我们迄今最具表现力的音频生成模型。可在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中生成自定义角色语音并指导场景对话。

Leland Rechis

产品组经理

Alan Cowen

研究科学总监，代表 Gemini Audio 团队

今天，我们为 Gemini 家族推出两款全新的文本转语音模型，将语音生成从静态预设转变为动态创意工作室。这些模型让创作者、开发者和企业能够打造更丰富、更具表现力的音频体验，同时为 Gemini Notebook 和 Google Vids 等产品带来更出色的用户体验。

Gemini 3.8 Flash TTS：专为深度创意指导和角色设计而打造。使用自然语言提示词从零开始创造全新语音，让角色在游戏、沉浸式有声书、播客和互动媒体中栩栩如生。逐行指导每一段表演，对表演提示、节奏、方言转换和应和语进行精细控制。

Gemini 3.8 Flash-Lite TTS： 专为高吞吐量、高性价比的规模化场景打造。针对大批量配音、音频内容创作以及富有表现力的语音智能体进行了优化，可对语调、节奏和表达细节进行精细控制。

这些模型补充了我们快速壮大的 Gemini Audio 家族，此前已推出 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。

创建并自定义你自己的声音

从 30 种原创声音扩展到无限的声音库。无论你需要一个完全原创的角色声音，还是一个保持一致的品牌代言人声音，我们的 3.8 Flash TTS 模型都能驱动一整套声音工作室。这让你能够为每一个时刻创建并使用富有表现力、听起来自然的声音，同时赋能开发者和企业轻松构建自定义音频体验。

生成式声音设计： 借助 Gemini 3.8 Flash TTS，通过自然语言提示词，在 100 多种语言和方言中自定义角色、口音和声音特征，从零开始打造定制声音——无论你是要让一条戏剧性的喷火龙活灵活现，还是打造一位带有独特地域韵律的魅力旁白者。

听听 Gemini 3.8 Flash TTS 如何生成一位来自墨尔本、充满活力的 DJ 声音。

听听 Gemini 3.8 Flash TTS 如何生成一个极其单薄、单调的机器人声音。

听听 Gemini 3.8 Flash TTS 如何让一条日本龙栩栩如生。

海量语音库：可访问 2,000 多种可直接用于生产的语音，语言覆盖广泛——包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。

语音复刻：只需一段 30 秒的音频样本，即可用你自己的声音或你拥有使用权的他人声音，重建一致的语音特征，并以内置的同意验证、SynthID 水印和 C2PA 凭证作为支撑，从而同时保护开发者及其配音人才。

保存与扩展：保存并管理你设计的自定义语音，以确保在持续进行的项目中保持一致的性能并最大限度减少漂移。

语音混音：即将推出，从我们的语音库中挑选一个声音，并微调音色、音高、语速和口音。使用提示词来调整特征（例如“加入微妙的美国南部口音”或“让表达更柔和”）。

逐行指导表演

选定语音后，两个 TTS 模型都能让你精确控制每一行的表达方式。

逐行指导表演：你可以自己撰写舞台指示，也可以让 Gemini 借助自然的脚本提示来引导表达——从冷静的客服智能体到低声细语的悬疑场景，皆可实现。

聆听 Gemini 3.8 Flash TTS 如何为交互式语音智能体实现自然、极具表现力的对话。

观看并聆听 Gemini 3.8 Flash TTS 如何利用精细的脚本控制，打造深度沉浸、引人入胜的音频体验。

长音频生成：在长达数小时的连续音频中保持高音质、自然的节奏和角色音色，说话人漂移极小——非常适合播客和有声书。

原生双说话人场景编排：从单一脚本无缝指导多轮对话——无论是播客还是戏剧化叙事——同时让两个声音清晰分离，并具备自然的对话轮替。

脚本化的人声爆发与附和应答：使用非语言提示（如 <laughs>、<sigh>、<gasp>）和积极倾听的插入语（如 |mhm| 或 |yeah|）添加逼真的对话质感，以实现精准的喜剧节奏和反应节拍。

了解 Gemini 3.8 Flash TTS 如何从零开始将自然语言提示词转化为定制的语音人设。

观看 Gemini 3.8 Flash TTS 如何让创作者设计自定义场景，将动画对话生动呈现。

看看 Gemini 3.8 Flash TTS 如何将脚本转化为完整演绎的对话场景，让创作者能够指导语音表达，并实现自然的轮流对话。

获取专为全球规模打造的表现力丰富的高质量语音生成能力

Gemini 3.8 Flash TTS 提供领先的语音定制能力，在 Hume AI 的语音设计基准测试中夺得总分第一（71.4），并在口音建模方面同样领先（60.8）。

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 能够实现真正富有表现力的演绎，同时不牺牲可靠性，并分别在 Hume AI 的总体质量指数中夺得第一和第二名。与 Gemini 3.1 Flash TTS 相比，该模型在长篇内容和双人剧本控制等广泛用例上展现出重大改进。

在 Voice Arena 的盲测人类偏好评估中，Gemini 3.8 Flash 和 Flash-Lite TTS 在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语（MSA）、墨西哥西班牙语和印地语等关键全球语言中，于竞争对手之间占据领先位置。这些模型支持超过 100 种语言，赋能创作者、开发者和企业，在全球范围内构建高质量的多语言语音体验。

以信任、同意和透明为基础进行构建

我们在构建语音创建与复刻能力时，配备了严格的防护措施，以帮助保护配音人才、尊重身份，并确保内容透明度。对于语音复刻，我们的系统采用同意验证机制：用户必须提供一段来自声音所有者的口头同意录音，且该录音需与参考说话人匹配，之后才能创建语音。

更广泛地说，我们的 Gemini Audio 模型生成的每一段音频片段都带有 SynthID 水印。这种不可感知的水印被直接织入音频输出之中，确保 AI 生成的语音始终可被检测，从而帮助防止虚假信息。如需进一步了解我们在安全与责任方面的做法，请查阅 模型卡。

试用我们全新的 Google AI Studio 音频演练场

从今天起，开发者可以体验这些全新的语音生成能力，在Google AI Studio中。它被打造为一个语音设计工作区，你可以从零开始通过提示词创造全新的声音身份，或复刻你自己的声音1，然后将它们直接带入双说话人剧本编辑器，逐行指导语音的表达方式。

在 Google AI Studio 中试用语音复刻。

轻松部署高性能语音交互界面

通过使用 Gemini API，Agora、LiveKit、Pipecat、Vercel 等开发者平台让开发者能够轻松构建和部署高性能的语音生成体验。

我们正与 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作，它们正在集成我们最新的 TTS 模型，以帮助加速全球配音、以细腻的地区口音本地化媒体内容，并大规模驱动对话式语音智能体。

开始使用我们最新的 Gemini Audio 模型：

Gemini 3.8 Flash TTS 从今天起开始推送：

面向开发者：在 Gemini API 和 Google AI Studio 中

面向企业：即将通过 Gemini Enterprise 中的 API 提供

面向所有人：在 Gemini Notebook 中。

Gemini 3.8 Flash-Lite TTS 从今天起开始推送：

面向开发者：在 Gemini API 和 Google AI Studio 中

面向企业：即将通过 Gemini Enterprise 中的 API 提供

面向所有人：在 Google Vids 中
