热点事件 持续更新

Google与Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents等实时媒体流基础设施伙伴合作支持Live API集成

1 篇报道1 个精选信源

事件全貌

AI 综述

Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型。据 Google DeepMind 博客,Gemini 3.8 Live 主打规模与成本效率,支持近实时视觉输入、对话中自动检测并切换 97 种语言、在后台执行工具与 API 调用;Extended Thinking 面向高复杂度任务,边推理边说话,可用「Let me check that…」等早期语音提示确认请求并实时叙述多步后台任务进度。Google 称 Gemini 3.8 Live 在 Speech Agent Arena 用户偏好评估中排名第二,Extended Thinking 以 82.6 分居 Artificial Analysis 语音到语音质量指数第一,τ-Voice 68.6%、Sierra τ-Voice-banking 35.1%、Big Bench Audio 97.7%。Artificial Analysis 亦确认 Extended Thinking (High) 以 82.6 首次登顶其 Speech to Speech Index、以 68.6% 登顶其 Tau Voice 基准。

上线范围方面,Google 称即日起开发者可在 Gemini API 与 Google AI Studio 使用,企业端在 Gemini Enterprise 私密预览,普通用户可在 Search Live 使用;Extended Thinking 另在 Gemini Live 及 Workspace、Gmail、Keep 等面向订阅用户推出。MarkTechPost 报道称两者均为托管模型、不开放权重,无自托管选项,定价为音频输入每分钟 0.005 美元、输出每分钟 0.018 美元,生成的音频带 Google DeepMind 的 SynthID 水印。The Decoder 报道称该定价远低于 OpenAI GPT-Live-1 的每分钟 0.05 美元,并称 GPT-Live-1 因全双工可同时听说,对话应更自然、演示听感更好,暗示 Google 再次以价格优先于质量。

第三方评价存在分歧:Testing Catalog 称 Extended Thinking (High) 在多数基准测试中超越 GPT Live 1 排名第一;Rohan Paul 称 Gemini 3.8 Live 以约 0.84 美元/小时实现前沿级语音代理性能,综合分高于 GPT-Realtime-2 High 且实测成本低约 80%,并称 Extended Thinking 在 τ-Voice 得 68.6%、高于 GPT-Live-1 Astra medium 的 67.9%。Google 还宣布与 Salesforce、Genspark、Lumeris 合作,合作方称许其延迟、流畅度与工具调用能力;开发者可通过 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等 Live API 集成伙伴构建。

更早,Testing Catalog 称 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 的名称开始出现在 GCP Console 配额页面,并称新 Gemini Live 模型基于最新 Gemini 3.8 Flash、预期是一次大跃升。

AI 汇总报道生成 · 8分钟前更新。单篇报道保留其发布时的原貌。

最新进展

最新情况详见事件全貌。

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. MarkTechPost精选
    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音智能体模型

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款原生语音到语音对话模型,已在 Gemini Live API 和 Google AI Studio 上线,托管形式不提供开放权重。