发布 Gemini 3.8 Live 音频模型:主打规模、速度与成本效率,支持句中打断、97 种语言实时切换与视觉上下文
事件全貌
AI 综述Google 在 GCP Console 配额页面出现 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个模型名称,Testing Catalog 的报道称这被视为对 GPT Live 1 的回应,并称新 Gemini Live 模型基于最新的 Gemini 3.8 Flash,由 Bedros Pamboukian 发现。
随后 Google AI 与 Google DeepMind 正式发布这两款实时对话模型。Google 称 Gemini 3.8 Live 面向规模、速度与成本效率,支持句中打断、97 种语言实时切换与视觉上下文,可在 Search Live 中通过摄像头指向问题区域获取分步音频指引;Gemini 3.8 Live Extended Thinking 面向高复杂度多步任务,推理与说话并行并可叙述进度。Google 称 Gemini 3.8 Live 在 Speech Agent Arena 排名第二,Extended Thinking 在 Artificial Analysis 语音到语音质量指数以 82.6 居首,在 τ-Voice 得 68.6%、Sierra τ-Voice-banking 得 35.1%、Big Bench Audio 得 97.7%,并称两款模型在 ServiceNow EVA-Bench 上推进了帕累托前沿。
上线范围方面,Google 称 Gemini 3.8 Live 即日起在 Gemini API、Google AI Studio、Search Live 上线,并在 Gemini Enterprise 私密预览;Extended Thinking 即日起在 Gemini API、Google AI Studio、Gemini Live 上线,企业版私密预览,并将面向 Google Workspace 商业客户、Docs、Gmail 与 Keep 的订阅用户推出。Testing Catalog 后续报道称两款模型正在 API、Google AI Studio、Gemini Live 及其他应用上线,并称 Gemini 3.8 Live Extended Thinking (High) 在多数基准测试中超越 GPT Live 1 排名第一。
AI 汇总报道生成 · 42分钟前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时语音模型
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款实时语音模型,称其达到 SOTA 并提供前沿的价格与性能。3.8 Live 支持 97 种语言并可无缝切换,支持异步工具调用;附图显示 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech to Speech Index 达 82.6%。
- Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
- Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 音频模型
Google AI 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 与 3.8 Live Extended Thinking。