Google 发布 Gemini 3.5 Transcribe
先了解这件事
报道摘要Google 推出专用于语音转文字的 Gemini 3.5 Transcribe 模型,主打快速、准确且低成本的转录,原生支持说话人分离和词级毫秒时间戳。该模型支持 85+ 种语言自动识别与代码切换,可通过 custom_vocabulary 传入最多 1,000 个领域术语避免专有名词拼写错误,并提供 Smart Transcription 与 Verbatim 两种模式。
报道时间线
沿着报道,了解事件的不同侧面。
- Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题
Google 推出专用于语音转文字的 Gemini 3.5 Transcribe 模型,主打快速、准确且低成本的转录,原生支持说话人分离和词级毫秒时间戳。该模型支持 85+ 种语言自动识别与代码切换,可通过 custom_vocabulary 传入最多 1,000 个领域术语避免专有名词拼写错误,并提供 Smart Transcription 与 Verbatim 两种模式。
- Google 发布 Gemini 3.5 Transcribe:85+ 语言平均 WER 2.6% 的语音转文本模型
Google 发布 Gemini 3.5 Transcribe 语音转文本模型,通过 Interactions API 和 Live API 分别提供预录文件与双向流式处理。
- Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型
Google 推出 Gemini 3.5 Transcribe,其最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions API 调用。
- Google 发布 Gemini 3.5 Transcribe,支持 85 种语言实时语音转文字
Google 推出 Gemini 3.5 Transcribe 语音转文字模型,支持 85 种以上语言,可自动去除“um”等填充词、纠正口误并自动排版。流式转录词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。
- 谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,能自动删除口头禅
谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,可自动删除“嗯”“呃”等口头禅及说错后自行纠正的内容,生成更通顺的文本。相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%,支持 85 种语言及最多 3 名说话者的预录音频。该模型已为 Pixel 11 上 Gboard 的“Rambler”功能提供支持,后续将进入更多谷歌产品。
- Gemini 3.5 Transcribe 发布,智能转写 API 上线
Google 发布 Gemini 3.5 Transcribe,智能转写语音为“实际意图文本”,可消除口误、过滤语气词、格式化数字日期并适配自定义词汇。
- Google 推出 Gemini 3.5 Transcribe 语音转文本 AI 模型
Google 发布 Gemini 3.5 Transcribe,用于语音输入的 AI 模型,可去除“嗯”等语气词并润色文本。相比上一代 Chirp 3,语音到最终文本速度提升约 70%,实时语音错误率降至 5.5%。
- Google 发布 Gemini 3.5 Transcribe 转录模型,可自动去除“um”“ah”等填充词
Google 推出 Gemini Audio 家族新成员 Gemini 3.5 Transcribe,可自动识别专业术语和超过 85 种语言,并自动格式化文本、去除“um”“uh”等填充词。该模型支持自定义词汇表、为最多三位说话人区分语音,并提供词级时间戳。今日起向 macOS Gemini 应用用户开放英语版本,开发者可通过 Gemini API 公开预览使用。
- Gemini 3.5 Transcribe 发布,精准语音转写
Google 推出 Gemini 3.5 Transcribe 语音转写模型,支持 85+ 语言,可自动过滤语气词、格式化非结构化语音,并结合屏幕上下文执行语音指令。该模型还能利用多模态能力将杂乱语音输入和本地文件直接转为邮件草稿。
- Gemini 3.5 Transcribe 发布,支持实时流式转写
推出 Gemini 3.5 Transcribe,我们全新的语音转文本模型,具备智能转写、函数调用、更精准的转写(更低 WER)、自定义词汇支持、多说话人识别,并支持超过 85 种语言! 同时支持实时流式传输!
- Gemini 3.5 Transcribe 发布,支持多语言转录
向 Gemini 3.5 Transcribe 问好! - 构建能理解用户语音/意图的应用,即使有多位说话人也行! - 开箱即用,自动检测 85+ 种语言 - 针对专业术语的自定义词汇适配……SGTM:) API 现已在 @GoogleAIStudio 和 Gemini Enterprise 中提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用! 更多详情:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/