热点事件 持续更新

谷歌上月发布 Gemini 3.5 Transcribe 语音转文字模型,支持85+语言,流式WER 4.0%、非流式2.6%

1 篇报道1 个精选信源

事件全貌

AI 综述

谷歌发布语音转文字模型 Gemini 3.5 Transcribe,称其为迄今最精确的语音转文字模型,可将原始音频转为经过润色和格式化的文本,在嘈杂环境或面对复杂术语时也能工作。该模型还驱动 Android Gboard 上的 Rambler 功能,可去除填充词、修正语法与标点,并支持通过语音指令编辑或改写、在语言间无缝切换。

谷歌开发者内容进一步说明,Gemini 3.5 Transcribe 支持 85 种以上语言,流式平均词错误率为 4.0%、非流式为 2.6%,并具备自动语码转换、自定义词汇偏置(最多 1,000 个词条)和智能转写模式(结构化格式、自我纠正、去除不流畅表达)等功能;可通过 Interactions API 转写最长 1 小时的音频文件,并输出结构化时间戳与说话人标注。

同一批谷歌内容还提到 Gemini 3.5 Live Translate 支持 70 种语言、2,000 多个语言对,以及旨在支持全球 1,000 种最常用语言的 1,000 Languages Initiative,其 Universal Speech Model 基于 1,200 万小时音频训练。

AI 汇总报道生成 · 1天前更新。单篇报道保留其发布时的原貌。

最新进展

谷歌开发者内容称,上月发布的 Gemini 3.5 Transcribe 支持 85 种以上语言,流式平均词错误率 4.0%、非流式 2.6%,并可通过 Interactions API 转写最长 1 小时音频。

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Google AI:DEV 作者专属官方一手精选
    Google 发布 Gemini 3.8 Live 与 3.5 Transcribe 实时语音模型

    Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。

24 HOURS

本事件热度走势

当前热度 5峰值 109月17日 00:00近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。