# Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking

- 来源：Google DeepMind：Blog（RSS）
- 作者：Tom Ouyang
- 发布时间：2026-09-16 01:05
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmu2xqfxz02zhroc1hxuzi6jm
- 原文链接：https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking

## 精选理由

原文给出两个语音对话模型的定位分工和多项基准数字，读者可以据此评估其推理、成本与工具调用能力。

## AI 摘要

Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型，主打语音智能体和复杂任务执行。

## 正文

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是我们迄今最先进的实时对话模型。智能与并行推理能力的重大升级，使它们在与用户协作以及通过语音执行复杂任务时更加直观。

Tom Ouyang

首席工程师

Malini Jaganathan

技术团队成员，代表 Gemini Audio 团队

今天，我们推出两款新模型，在近实时推理方面带来进步，从而更有效地赋能语音智能体，并让与 AI 的对话感觉更直观、更智能。

Gemini 3.8 Live：为规模化和成本效率而打造，将对话智能与流畅对话和视觉接地相结合。

Gemini 3.8 Live Extended Thinking：为高复杂度任务而打造，具备更强的智能和多步推理能力。

对于开发者和企业而言，这些模型提供了构建可靠、可投入生产的语音智能体的基础模块。它们还让用户在 Gemini 应用、Google Workspace 和 Search 中与 Gemini 对话更加流畅、更具协作性——帮助你仅用语音就能应对复杂任务。

体验更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 提供企业级的任务完成能力与智能水平，在 Artificial Analysis 的语音到语音质量指数（Speech to Speech Quality Index）上以 82.6 分拿下总榜第一，并在智能体任务完成方面领先，在 τ-Voice 上达到 68.6%，在 Sierra 的 τ-Voice-banking 基准上达到 35.1%。它还具备强大的推理能力，在 Big Bench Audio 上得分 97.7%，同时相较于其他前沿模型保持了极具竞争力的价格。

Gemini 3.8 Live 在用户中表现出很高的偏好度，在 Speech Agent Arena 中位列第二。除这一表现外，它依然极具成本效益——为开发者和企业提供了一个能力强、效率高、专为规模化而打造的模型。

在 ServiceNow 的 EVA-Bench（一个用于评估语音智能体的基准）上，我们的模型通过成功平衡准确性与对话质量，推动了复杂工作流的帕累托前沿。

注：该测试运行于 Gemini Enterprise Agent Platform 上的 Live API。

Gemini 3.8 Live 以近乎实时的速度处理视觉输入，为对话补充上下文，从而给出更有帮助的回复。它能在对话过程中自动检测并在 97 种支持语言之间切换。它会在后台执行工具调用和 API 调用，同时继续对话，因此模型可以在确认请求后继续聊天，而任务则在后台完成。

Gemini 3.8 Live 实时指导员工入职，利用视觉上下文回答现场提问。

观看 Gemini 3.8 Live 借助视觉上下文、推理和自然的对话流，近乎实时地下棋。

对于需要更深层推理的任务，3.8 Live Extended Thinking 能够边推理边说话。它为复杂工作流带来更强的智能，同时保持不间断的对话流——使用诸如“让我查一下……”这样的早期口头提示来自然地回应提示词，并通过实时进度叙述，让用户随时了解多步骤后台任务的进展。

观看 Gemini 3.8 Live Extended Thinking 将原始草图和近乎实时的语音反馈转化为可用的 React 组件。

看看 Gemini 3.8 Live Extended Thinking 如何协调多步骤预订和异步函数调用——全程不打断自然的实时对话。

观看 Gemini 3.8 Live 通过自然语音即时构建完整的商业计划和定制营销工具包。

在 Google Workspace 和 Search 中，我们的 Live 模型带来更直观、更具协作性的体验——尤其是在处理你最复杂的任务时。

在 Google Workspace 中通过 Docs Live、Gmail Live 和 Keep Live 试用 Gemini 3.8 Live Extended Thinking。

在 Search Live 中直接获取由 Gemini 3.8 Live 驱动的分步实时故障排查帮助。

赋能开发者与企业语音生态

通过使用 Gemini Live API，Agora、Fishjam、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台，开发者可以轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施，让开发者能够完全专注于打造用户体验。

我们还与 Salesforce、Genspark 和 Lumeris 等公司合作，它们对 3.8 Live 和 3.8 Live Extended Thinking 充满期待，并强调了其令人印象深刻的延迟、流畅性和工具调用能力。

通过 SynthID 水印确保透明度

我们的 AI 产品生成的所有音频都使用 SynthID 添加水印。这种不可感知的水印直接编织进音频输出中，确保 AI 生成的内容可被检测，从而帮助防止错误信息传播。有关我们安全与责任方法的详细信息，请查阅模型卡。

开始使用我们最新的 Gemini Audio 模型：

3.8 Live 从今天开始逐步推出：

面向开发者：在 Gemini API 和 Google AI Studio 中

面向企业：在 Gemini Enterprise 中开启私密预览，并即将登陆 Gemini Enterprise for Customer Experience

面向所有人：在 Search Live 中

3.8 Live Extended Thinking 从今天开始逐步推出：

面向开发者：在 Gemini API 和 Google AI Studio 中

面向企业：在 Gemini Enterprise 中开启私密预览，并即将登陆 Gemini Enterprise for Customer Experience 以及 Google Workspace 企业客户

面向所有人：在 Gemini Live 中，以及面向 Workspace 中 Docs 的 Google AI Pro 和 Ultra 订阅用户，还有 Gmail 和 Keep 中的所有 Google AI 订阅用户
