Google发布Gemini 3.8 Flash TTS语音合成模型
先了解这件事
事实说明Google发布了Gemini 3.8 Flash TTS,支持通过文本描述从头设计声音,提供超过2000种预设声音库及区域变体,支持100多种语言、逐行舞台指示、双角色对话和非语言声音;声音克隆需30秒样本并录制同意声明,生成音频带SynthID水印。定位用于播客、有声书、游戏角色等创意场景,通过Gemini API和Google AI Studio推出,另在Gemini Notebook可用,企业API访问即将跟进。
报道时间线
沿着报道,了解事件的不同侧面。
- Gemini 3.8 Flash TTS与Flash-Lite TTS在AI Studio和Gemini API上线,支持100+语言自定义声音
Gemini 3.8 Flash TTS和Flash-Lite TTS已在AI Studio和Gemini API上线,支持100多种语言的自定义声音或从2000多种预设声音中选择;Flash进入Gemini Notebook,Flash-Lite进入Google Vids。
- Google DeepMind 发布 Gemini 3.8 Flash 与 Flash-Lite 文本转语音模型
Google DeepMind 新发布 Gemini 3.8 Flash 与 Flash-Lite TTS:前者支持自然语言设计声音、逐行指导表演,后者面向大批量生成。原文还说明声音复刻需授权验证,并为生成音频加入水印。
- Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 文本转语音模型,支持自然语言创建声音、逐行表演控制、双说话者场景与约30秒样本声音复刻
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS:前者侧重声音创作与角色设计,后者面向大规模、注重成本的语音生成,与面向实时语音对话的 Gemini Live 系列不同。Flash TTS 可用自然语言指定角色、口音和声音特征从头创建声音,Google 还提供2,000多个预备声音;两个模型都支持在脚本中逐行指定语速、语气、口音变化与短促回应。Google 展示了单份脚本中的双说话者场景控制并描述长篇生成能力,也说明可从约30秒样本重建有权使用的声音,但创建前需提供与参考说话者匹配的口头授权录音,生成音频带 SynthID 水印和内容凭证。Google 在公告中引用声音设计与质量评测的领先成绩及跨语言盲测表现,这些排名由 Google 转述评测。开发者目前可在 Gemini API 与 Google AI Studio 中接触这两款模型,Google 对企业平台的接入说明了不同推出节奏。
- Google发布Gemini 3.8 Flash TTS文本转语音模型,今日起在Gemini API和Google AI Studio推出
Google推出Gemini 3.8 Flash TTS,面向深度创意指导和角色设计,可用自然语言提示从头创建全新声音,并对表演线索、节奏、方言转换和反馈语进行逐行控制。该模型支持超过100种语言和方言,提供2000+现成声音,并可从30秒音频样本复刻声音(需同意验证、SynthID水印和C2PA凭证)。它在Hume AI语音设计基准上以71.4分排名第一,口音建模得分60.8,并在Voice Arena盲测中于日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言中位居前列。开发者今日可在Gemini API和Google AI Studio使用,企业版API即将在Gemini Enterprise推出,普通用户可在Gemini Notebook使用。
- Google发布Gemini 3.8 Flash TTS语音合成模型
Google发布了Gemini 3.8 Flash TTS,支持通过文本描述从头设计声音,提供超过2000种预设声音库及区域变体,支持100多种语言、逐行舞台指示、双角色对话和非语言声音;声音克隆需30秒样本并录制同意声明,生成音频带SynthID水印。定位用于播客、有声书、游戏角色等创意场景,通过Gemini API和Google AI Studio推出,另在Gemini Notebook可用,企业API访问即将跟进。
- Google发布gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts两款新文本转语音模型
Google发布两款新的Gemini文本转语音模型:gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts,附带超过2000种声音的语音库,并支持用一段30秒的本人声音或有权使用的声音样本创建自定义声音。
- 发布 Gemini 3.8 Flash TTS:自称新的 SOTA 文本转语音模型
发布公告宣布推出 Gemini 3.8 Flash TTS,定位为新的 SOTA 文本转语音模型:提供全新声音设计体验、2000+ 生产就绪声音、声音复制功能,支持 100 种语言;voice remixing 功能即将推出(soon)。据公告,该模型在 Hume AI 的声音基准测试中排名第一。
- Google发布Gemini 3.8 Flash TTS语音合成模型,发音鲁棒性基准登顶第一
Google发布Gemini 3.8 Flash TTS文本转语音模型,支持预设声音和声音复制。该模型在发布方评测的发音鲁棒性基准以89.5%排名第一,Provider Voice Arena以1,263 Elo排第二,处理速度为每秒44.1个字符(约2.7倍实时),定价每百万字符32.98美元,高于上一代Gemini 3.1 Flash TTS但远低于Eleven v3。
- 作者宣布其最新文本转语音和声音设计模型上线,现已在 AI Studio 可用
作者宣布其最新文本转语音和声音设计模型已上线 AI Studio。功能包括提供数千种新音色供选择、支持在30秒内复刻用户自己的声音、可通过提示词设计声音,以及提供表达性标签以实现完全控制。
- 谷歌发布 Gemini 3.8 Flash TTS 文本转语音模型,面向深度创意方向,即日起可在 Google AI Studio 体验
谷歌宣布推出 Gemini 3.8 Flash TTS 文本转语音模型,面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,支持逐行指导表演、长篇生成、原生双声音场景编排等功能,并提供语音复制(含同意验证与 SynthID 水印)。该模型在 Hume AI 语音设计基准(71.4 分)位居总体第一,并已向开发者推送,可在 Gemini API 和 Google AI Studio 使用,Gemini Notebook 也可使用;通过 AI Studio 进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。
- Google Gemini 3.8 Flash TTS在Google AI Studio和API上线
原文报道Gemini 3.8 Flash TTS已在Google AI Studio和API上线,被称为支持语音设计(Voice Design)和双说话人剧本控制的旗舰TTS模型,可提示自定义声音人格、逐行指导台词演绎并添加语音爆发效果。
- Google推出Gemini 3.8 Flash TTS语音生成模型,今日起在Gemini API和Google AI Studio开放
Google宣布推出Gemini 3.8 Flash TTS,定位为面向深度创意指导与角色设计的语音生成模型,可通过自然语言提示从零创建全新声音,并对表演、节奏、方言转换等逐行控制。该模型支持长音频生成、双说话人场景编排及脚本化非语言提示,在Hume AI语音设计基准中以71.4分排名第一、口音建模60.8分领先,并在Voice Arena盲测中于日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言中位居前列。开发者今日起可通过Gemini API和Google AI Studio使用,企业版API即将在Gemini Enterprise开放,普通用户可在Gemini Notebook使用。
- 推出 Gemini 3.8 Flash TTS 语音合成模型,定位高保真创意生产,支持从零设计定制语音角色并提供逐行级控制
原文宣布推出 Gemini 3.8 Flash TTS,定位用于游戏、沉浸式有声书和播客等高保真创意生产,支持从零设计定制语音角色并提供逐行级控制。该发布整体称模型可在100多种语言创建自定义声音、选用2000多种现成声音,并支持 <laughs>、|mhm| 等自然提示。发布主体在原文中未具名。
- 发布 Gemini 3.8 Flash TTS 文本转语音模型,支持设计具有独特口音和特征的自定义声音
原文宣布发布新的 Gemini 3.8 Flash TTS 文本转语音模型,可用于创建和部署自定义音频,支持设计具有独特口音和特征的自定义声音。
- Google推出Gemini 3.8 Flash TTS,面向开发者开放Gemini API和AI Studio,企业版与Gemini Notebook渠道另有安排
Google宣布推出Gemini 3.8 Flash TTS,面向深度创意指导与角色设计,支持用自然语言提示从头创建定制声音、逐行指导表演,覆盖100多种语言,并提供带同意验证、SynthID水印和C2PA凭证的声音复刻。该模型在Hume AI Voice Design Benchmark获总榜第一(71.4),在Voice Arena盲测多语种中居前列。发布即面向开发者开放Gemini API和Google AI Studio;通过API进入Gemini Enterprise的企业渠道为即将推出,同时面向所有用户登陆Gemini Notebook;声音重混音功能亦为即将推出。
本事件热度走势
暂无可比热度趋势,待连续观测积累后展示。