热点事件 历史事件

Google 发布 Gemini 3.8 Live 与 3.5 Transcribe 实时语音模型

19 篇报道15 个报道来源

事件全貌

AI 综述

Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音到语音模型。Google 称这是其迄今最先进的实时对话模型,在智能与并行推理方面有重大升级。Gemini 3.8 Live 面向规模部署与成本效率,兼顾对话智能、流畅交流与视觉理解;Extended Thinking 面向高复杂度任务,强化多步推理,可边推理边说话,并以「让我确认一下…」等早期语言提示回应,同时实时讲解后台任务进度。两款模型均支持近实时视觉输入、对话中自动检测并切换 97 种语言、后台执行工具与 API 调用而不中断对话。

Google 公布多项基准成绩:Extended Thinking 以 82.6 分居 Artificial Analysis 语音到语音质量指数第一,在 τ-Voice 得 68.6%、Sierra τ-Voice-banking 得 35.1%、Big Bench Audio 得 97.7%;Gemini 3.8 Live 在 Speech Agent Arena 排名第二。Artificial Analysis 确认 Extended Thinking (High) 以 82.6 首次登顶其 Speech to Speech Index,并在其 τ-Voice 实现中以 68.6% 居首。Rohan Paul 称 Extended Thinking 在 τ-Voice 的 68.6% 高于 GPT-Live-1 Astra medium 的 67.9%,并称 Gemini 3.8 Live 以 $0.84/小时实现前沿级语音代理性能。The Decoder 则称 OpenAI 的 GPT-Live-1 因全双工与演示听感仍可能提供更自然的对话,认为 Google 再次以价格换质量。

定价方面,Google 称两款模型音频输入 $0.005/分钟、输出 $0.018/分钟,基于 $3/百万输入 token 与 $12/百万输出 token 估算;The Decoder 对比称 OpenAI GPT-Live-1 为 $0.05/分钟,Google 一小时语音对话约 $1.38,OpenAI 至少 $3.00。MarkTechPost 指出两款为托管模型、不开放权重,无自托管选项,所有生成音频带 Google DeepMind 的 SynthID 隐形水印。

上线渠道:开发者可在 Gemini API 与 Google AI Studio 使用;企业端在 Gemini Enterprise 私密预览,并将登陆 Gemini Enterprise for Customer Experience 及 Google Workspace 企业客户;普通用户可在 Search Live(Live)与 Gemini Live(Extended Thinking)体验,Google AI Pro/Ultra 订阅者可在 Workspace 的 Docs 使用,所有 Google AI 订阅者可在 Gmail 和 Keep 体验。Google 还宣布与 Salesforce、Genspark、Lumeris 合作,并列出 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等 Live API 集成伙伴。

更早的线索来自 Testing Catalog:Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 的名称先出现在 GCP Console 配额页面,被视为对 GPT Live 1 的回应,该发现由 Bedros Pamboukian 记录。

AI 汇总报道生成 · 4天前更新。单篇报道保留其发布时的原貌。

最新进展

历史报道归档。当前热点以新版榜单为准。

报道时间线

沿着报道,了解事件的不同侧面。

显示 19全部报道最新在前
  1. X:Google AI (@GoogleAI)官方一手
    Google 发布 Gemini 3.8 Live 等多项更新

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为目前最先进的实时对话音频模型。Google Labs 的 Dreambeans 正式 GA,CC 从个人效率工具扩展为帮助家庭协调日程与日常事务的共享智能体。

  2. Google AI:DEV 作者专属官方一手精选
    Google 发布 Gemini 3.8 Live 与 3.5 Transcribe 实时语音模型

    Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。

  3. X:Testing Catalog (@testingcatalog)
    每日AI简报:Gemini 3.8 Live发布,GPT-5.5将下线

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking,支持 97 种语言自动检测、近实时视觉与后台工具调用,Live 已进入 Search Live 和 Gemini API 公开预览。

  4. X:Rohan Paul (@rohanpaul_ai)
    Google 发布 Gemini 3.8 Live 及扩展思考版

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,面向生产级语音智能体。微软 AI 发布未来 MAI 模型行为准则,要求人类控制不可谈判。Nvidia、Palantir 和 Booz Allen 因 Anthropic 30 天保留政策限制 Claude Fable 使用。

  5. X:洪明 (@hongming731)
    BestBlogs 早报:Gemini 3.8 Live 与黄仁勋谈 AI 安全

    BestBlogs 09-16 早报汇总十项 AI 动态,头条为 Google DeepMind 发布 Gemini 3.8 Live,将实时视觉理解、跨语言对话与后台工具调用整合进同一语音链路,并设 Extended Thinking 版本处理多步骤任务。

  6. Simon Willison 博客
    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音对话模型,Simon Willison 自制网页 UI 实测

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音到语音模型,形态类似 OpenAI 的 GPT-Live 模型。

  7. IT之家
    谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型,支持 97 种语言切换

    谷歌于 9 月 15 日推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化部署与成本优化,后者面向高复杂度任务、强化多步推理。

  8. X:Artificial Analysis (@ArtificialAnlys)官方一手精选
    Gemini 3.8 Live 语音模型评测:Extended Thinking 版登顶 Speech to Speech Index

    Artificial Analysis 评测 Google 发布的语音到语音模型 Gemini 3.8 Live,其 Extended Thinking (High) 版以 82.6 分登顶 Speech to Speech Index,并在 Tau Voice 以 68.6% 居首。

  9. MarkTechPost精选
    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音智能体模型

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款原生语音到语音对话模型,已在 Gemini Live API 和 Google AI Studio 上线,托管形式不提供开放权重。

  10. Hacker News 热门(buzzing.cc 中文翻译)
    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 语音对话模型

    Google 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款近实时语音对话模型,主打语音智能体和复杂任务执行。

  11. Hacker News:AI 热帖
    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音对话模型

    Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款近实时语音对话模型,分别面向规模化成本效率和高复杂度多步推理任务。

  12. X:Rohan Paul (@rohanpaul_ai)
    Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,登顶语音对语音榜

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,据 Artificial Analysis 榜单取得语音对语音综合第一,Extended Thinking 以 82.6% 领先 GPT-Live-1 Astra(Medium)的 81.5%。

  13. The Decoder:AI News
    Google 发布 Gemini 3.8 Live 语音模型,以低价对标 OpenAI GPT-Live-1

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款开发者语音模型,可通过 Gemini API 和 Google AI Studio 使用。

  14. X:Logan Kilpatrick (@OfficialLoganK)
    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时语音模型

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款实时语音模型,称其达到 SOTA 并提供前沿的价格与性能。3.8 Live 支持 97 种语言并可无缝切换,支持异步工具调用;附图显示 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech to Speech Index 达 82.6%。

  15. X:Testing Catalog (@testingcatalog)
    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 音频模型

    Google 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款音频模型,已在 API、Google AI Studio、Gemini Live 等应用上线。

  16. X:Google DeepMind (@GoogleDeepMind)官方一手
    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking
  17. Google DeepMind:Blog官方一手精选
    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。

  18. X:Google AI (@GoogleAI)官方一手
    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 音频模型

    Google AI 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 与 3.8 Live Extended Thinking。

  19. X:Testing Catalog (@testingcatalog)
    Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 模型名现身 GCP Console 配额页

    Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个模型名已出现在 GCP Console 配额页面。新模型基于最新的 Gemini 3.8 Flash,预计是 Gemini Live 的一次大跃升;目前 API 可用的最新 Gemini Live 模型仍是 Gemini 3.1 Live Preview。