OpenAI 在 API 中推出全双工语音模型 GPT-Live-1

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-09-10 08:00·17小时前
AI 导读

OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。

OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
70AI 编辑部评分,满分 100

OpenAI 在 API 中推出全双工语音模型 GPT-Live-1

2026-09-10 08:00· 17小时前
AI 导读

OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。

推荐理由

原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。

正文 · AI 翻译

GPT‑Live‑1 将 ChatGPT 自然、全双工的对话能力带入 API,让开发者能更好地控制语音智能体的说话与行动方式。

我们正式在 API 中推出 GPT‑Live‑1,为开发者提供一个强大、自然的语音模型,用于构建支持语音的应用和业务工作流。GPT‑Live‑1 最初在 ChatGPT 中亮相,它能够同时听和说,并且正如在 Codex 和 ChatGPT Work 中所见,它可以将更深层的推理和操作委派给它所搭配的模型和工具。

针对 GPT‑Live‑1 的 API 版本,我们重点打造了多项新能力,让开发者能够围绕自己的用户、工作流和目标来引导和定制语音体验。GPT‑Live‑1 的一项核心优势——流畅的中断处理——已经带来了实际业务影响:在早期评估中,Speak 发现 GPT‑Live‑1 让学习者在语言辅导老师回应之前有更多时间思考,与以往基于轮次的系统相比,中断减少了近 80%。

GPT‑Live‑1 在 API 中的关键优势:

  • **中断处理:**通过单一模型同时对传入和传出音频进行推理,改进了中断处理,避免了链式 STT–LLM–TTS 架构的延迟和脆弱的交接。
  • **推理与工具调用委派:**GPT‑Live‑1 可以将推理和工具调用委派给后端文本模型,例如 GPT‑6 Astra 或第三方模型。
  • 语气、节奏和风格: 让开发者通过系统提示词来塑造智能体的语气、节奏和对话风格。
  • 静默上下文管理与背景噪声: 更好地处理背景噪声和静默,不会打断对话,也不会把每一步都大声叙述出来。
  • 长会话可靠性: 提升长时间交互中的上下文保持能力和对话质量。
  • 电话支持: 支持部署用于电话通话的全双工语音智能体,从餐厅预订到客户支持均可覆盖。

Image 1: GPT-Live-1 API | Yelp source demo still

Yelp Host 借助 GPT‑Live‑1 处理背景噪声、旁支对话和打断,顺畅地完成预订。

简化你的语音智能体架构,降低语音延迟

传统语音智能体将语音转文字、推理模型和文字转语音拼接在一起。每一次交接都会增加延迟,也带来更多丢失时机、上下文或对话自然节奏的可能。开发者往往要负责协调这些环节,包括当有人打断、停顿或改变话题时该如何处理。

GPT‑Live‑1 在单一模型中同时处理听与说,简化了语音层。它能在打断和确认应答发生时即时响应,同时将更深层的推理交给后端处理。这让对话在工作于后台进行的同时得以持续。

“与我们此前的级联式构建相比,GPT‑Live‑1 将我们的代码库简化了 80%,并移除了 23K 行代码。这实现了自然、实时的患者对话,并让我们的团队得以腾出手来改进从预约挂号到就医导航的体验。”

——Tony Stoyanov,联合创始人兼 CTO

开发者可选择对话背后的模型、工具和智能体框架。例如,他们可以将 GPT‑Live‑1 与 Luna 这样的模型搭配,用于排程或订单更新等高并发任务,并使用 Astra 这样的模型处理需要推理的复杂客户问题。这种灵活性让开发者能够为每项任务匹配相应的推理深度、速度和成本。

GPT‑Live‑1 原生提供 ASR 转写文本和响应文本。它还具备出色的字母数字理解能力,并支持关键词偏置。尽管 GPT‑Live‑1 并非基于轮次的模型,但它原生支持轮次检测,因此开发者仍可围绕明确的轮次边界进行构建。

衡量全双工优势

在我们的各项评估中,GPT‑Live‑1 相比 GPT‑Realtime‑2.1 将 Full Duplex Bench 的表现提升了 30 个百分点,在轮次转换延迟和交互行为方面均有大幅提升。搭配以中等推理强度运行的 GPT‑6 Astra,它还在 Tau3 上排名第一,该基准衡量的是前沿语音智能体在端到端任务上的智能水平。

评估航空、零售和电信领域的语音客服任务。Pass@1 衡量任务成功率;主指标对每个领域赋予相同权重。

  • GPT Live 后端:Astra(medium)。

评估带有知识检索和账户工具的语音银行支持。Pass@1 是 97 项 banking_knowledge 任务中成功完成的比例。

  • GPT Live 后端:Astra(medium)。

评估停顿处理、对话轮次转换、打断和反馈应答。

测试对背景语音、对他人说话、听者反馈应答以及打断的反应。

衡量智能体在用户结束一轮发言后多快开始回复。

测试从包含自然停顿、犹豫和自我纠正的语音请求中进行工具使用。Pass@1 对工具调用序列进行评分。

  • GPT Live 后端:Terra(low)。

评估对使用工具请求的口头回答,其中包含停顿、犹豫和自我纠正。评分回答与参考意图的匹配程度。

  • GPT Live 后端:Terra(low)。

客户评价

“将 GPT‑Live‑1 集成到 Yelp Host 和 Hatch 中,相比我们传统的语音架构,改善了轮次切换和准确性。当 Yelp Host 使用 GPT‑Live‑1 接听电话(如预订和订餐)时,我们看到通话处理率有了显著提升。来电者也在说出更完整、更自然的句子,这告诉我们电话另一端的体验确实有了本质的不同。”

—Alex Levy,首席技术官

“一位优秀的语言导师知道何时给学习者空间、何时介入,而 GPT‑Live‑1 将这种自然感带到了 Speak 的 Live Tutor Lessons 中——在我们的早期评估中,相比之前基于轮次的系统,它将思考停顿期间的中断减少了近 80%。”

—Andrew Hsu,联合创始人兼首席技术官

“GPT‑Live-1 展示了全双工模型能够释放的潜力:它将 AI 语音支持从走走停停的节奏推向电话通话般的自然流畅。客户可以自然地停顿、打断和改变方向;语音表现是明显的进步;Fin 可以将这种自然对话与其专有的支持系统相结合,完成解决问题所需的更深层工作。对我们来说,这是迄今为止关于语音支持走向的最清晰信号。”

——Jordan Neil,首席运营官

“有了 Devin 和 GPT‑Live‑1,与 AI 工程师共事开始更像是在和一位队友协作。你可以把想法聊透、对某个方案做压力测试,或者干脆在离开键盘时把工作交出去。”

——Walden Yan,联合创始人兼首席产品官

全新语音选项

开发者需要契合自身产品、并且对使用者来说听起来自然的语音。借助 GPT‑Live‑1,我们从小规模的实时语音集扩展到了覆盖不同口音、方言和语言的更广泛选择,让开发者在助手声音的呈现方式上拥有更多选择。

未来几个月,我们将继续扩展语音选项和语言可用范围。

定价与可用性

GPT‑Live‑1 即日起 在 API 中可用⁠ ,前端语音层定价为每分钟 $0.05。将其与契合你产品的后端模型和智能体框架搭配,即可构建出能够随所需处理的工作量而扩展的语音体验。

将 GPT-Live-1 连接到 Codex

1import { Codex } from "@openai/codex-sdk";23const thread = new Codex().startThread({4 workingDirectory: "./repo",5 sandboxMode: "read-only",6 approvalPolicy: "never",7});89async function answer(live, delegationId, context) {10 const { finalResponse } = await thread.run(11 使用这个 repo 回答最新问题。12 用两句简短的口语作答。\n${context}13 );1415 live.send({16 type: "session.commentary.append",17 delegation_id: delegationId,18 content: finalResponse,19 });20}

将 GPT-Live-1 连接到 Codex。本摘录展示了应用程序如何将对话上下文传递给 Codex,并将其回答返回给 GPT-Live-1。连接设置与委派处理已省略。

如需自定义语音访问权限,请联系销售团队,了解有关资格条件和申请流程的更多信息。

在 GPT‑Live‑1 之上构建语音工作流的另一种方式是使用 OpenAI Presence,它利用该模型驱动实时语音交互。Presence 帮助企业在部署可信 AI 智能体时,使其能够回答问题、解决问题、使用公司系统、执行已批准的操作,并在需要时升级转交人工处理。如需了解更多信息,请联系您的 OpenAI 客户总监。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例)· openai.com