谷歌上月发布 Gemini 3.5 Transcribe 语音转文字模型,支持85+语言,流式WER 4.0%、非流式2.6%
事件全貌
AI 综述谷歌发布语音转文字模型 Gemini 3.5 Transcribe,称其为迄今最精确的语音转文字模型,可将原始音频转为经过润色和格式化的文本,在嘈杂环境或面对复杂术语时也能工作。该模型还驱动 Android Gboard 上的 Rambler 功能,可去除填充词、修正语法与标点,并支持通过语音指令编辑或改写、在语言间无缝切换。
谷歌开发者内容进一步说明,Gemini 3.5 Transcribe 支持 85 种以上语言,流式平均词错误率为 4.0%、非流式为 2.6%,并具备自动语码转换、自定义词汇偏置(最多 1,000 个词条)和智能转写模式(结构化格式、自我纠正、去除不流畅表达)等功能;可通过 Interactions API 转写最长 1 小时的音频文件,并输出结构化时间戳与说话人标注。
同一批谷歌内容还提到 Gemini 3.5 Live Translate 支持 70 种语言、2,000 多个语言对,以及旨在支持全球 1,000 种最常用语言的 1,000 Languages Initiative,其 Universal Speech Model 基于 1,200 万小时音频训练。
AI 汇总报道生成 · 1天前更新。单篇报道保留其发布时的原貌。
谷歌开发者内容称,上月发布的 Gemini 3.5 Transcribe 支持 85 种以上语言,流式平均词错误率 4.0%、非流式 2.6%,并可通过 Interactions API 转写最长 1 小时音频。
报道时间线
沿着报道,了解事件的不同侧面。
- Google 发布 Gemini 3.8 Live 与 3.5 Transcribe 实时语音模型
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。