OpenAI 在 API 中开放 GPT-Live-1 语音模型
事件全貌
AI 综述OpenAI 宣布将全双工语音模型 GPT-Live-1 引入 API。该模型此前已应用于 ChatGPT,能同时听与说,在打断、停顿和背景噪声中保持自然对话,并把语音理解与输出整合在同一模型中,减少传统“语音转文字—大模型—文字转语音”链路的延迟;复杂推理和工具调用可交由后端文本模型(如 GPT-6 Astra 或第三方模型)处理。公司宣称,GPT-Live-1 在 Full Duplex Bench 上比 GPT-Realtime-2.1 高 30 个百分点(The Decoder 引述数字为 80.1% 对 45.4%),轮次切换延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%,搭配 GPT-6 Astra 中等推理强度时在 Tau3 端到端语音智能体测试中排名第一。
定价方面,前端语音层为每分钟 0.05 美元(按每小时约 3 美元,IT之家注约合 20.2 元人民币),后端模型与智能体工具费用另计;定制语音需联系销售申请。模型自带 ASR 转写与回复文本,并随附跨口音、方言和语言的十二种新语音,OpenAI 表示未来数月将继续扩展语音与语言选项。
客户反馈均为公司或相关方宣称:语言学习平台 Speak 称误打断次数较此前基于轮次的系统减少近 80%;一家医疗服务平台的 CTO Tony Stoyanov 称代码量减少 80%、删除约 2.3 万行代码;The Decoder 引述 Yelp CTO Alex Levy 称该模型用于电话订位并改善了通话处理。OpenAI 员工 Tibo 称该语音系统此前已服务 ChatGPT 的 10 亿用户。作为起点,Agora 在其开源 AI 会议助手 Copilot 中集成了 GPT-Live-1,助手可作为参与者加入视频通话,听到“Copilot”时发言,实时转写会议、中途答疑、总结讨论并向看板添加任务。
AI 汇总报道生成 · 8天前更新。单篇报道保留其发布时的原貌。
历史报道归档。当前热点以新版榜单为准。
报道时间线
沿着报道,了解事件的不同侧面。
- BestBlogs 早报:AI 采用提升是选择效应,Evernote 团队缩至 50-60 人提速三倍,Claude Code 逆向挖出 Antspace
一篇用 4 万账户模拟演示 AI 助手「留存 +15.4 个百分点」几乎全是选择效应,断点回归估出真实效应约 +4.9 个百分点。Bending Spoons 联创称 Evernote 收购后团队从约 350 人缩到 50-60 人、迭代速度反快至少三倍。另有工程师逆向 Claude Code 网页版会话,挖出 Anthropic 未公开的托管平台 Antspace。
- BestBlogs 早报:Claude Code 运行时逆向与 GPT-Live 1 上线
BestBlogs 09-14 早报收录 10 条内容,其中作者 strace Claude Code Web 会话的 PID 1,发现运行环境为 Firecracker MicroVM,并挖出 Anthropic 未公开的应用托管平台 Antspace,http://claude.ai 的 Baku 构建器默认部署目标即为它。
- Astra 本周发布多项功能
Astra 驱动的发布本周上线 - Images 2.5 - GPT-Live-1 - Agents API - Data Agent - ChatGPT for Financial Services 而这还不是 DevDay。下周也有繁忙的计划。
- Agora 开源会议 Copilot 接入 GPT-Live-1
Agora 在其开源 AI 会议 Copilot 中实现了 GPT-Live-1,该 Copilot 可作为参会者加入视频通话,听到"Copilot"即发言。它能实时转录整场通话、在会中回答问题、总结讨论,并把任务添加到 Kanban 看板。该功能由 Agora RTC、Conversational AI 和 OpenAI GPT-Live-1 API 驱动。
- Daily AI Brief:OpenAI 上线 GPT-Live-1 全双工语音智能体
OpenAI 在 API 上线 GPT-Live-1 全双工语音智能体,可边说边听并将任务交接给其他模型,Agents API 同步进入公开测试。ChatGPT 金融服务版面向合格机构推出,含工作模式与 GPT-6 Astra;因 Astra 需求挤压容量,200 美元 Pro 新注册暂停。
- OpenAI 在 API 中开放 GPT-Live-1 语音模型
OpenAI 宣布 GPT-Live-1 已在 API 中可用,开发者可用与新版 ChatGPT 语音相同的双工技术构建自己的语音应用。语音智能体可在说话的同时监听,并支持开发者自选模型和 harness。
- OpenAI 将 GPT-Live-1 引入 API,支持全双工语音、打断处理与工具调用
OpenAI 宣布 GPT-Live-1 上线 API,支持全双工对话、处理打断与背景噪声,可用于电话语音智能体,并将语音理解与输出整合在同一模型中以降低延迟。
- GPT-Live-1 语音模型上线 OpenAI API
GPT-Live-1 现已登陆 OpenAI API。开发者可将 ChatGPT 式自然对话带入应用,构建能边说边听的语音智能体,并自选所用的模型与 harness。
- OpenAI GPT-Live-1 上线 API 与 OpenAI Platform
OpenAI 将 GPT-Live-1 开放到 API 和 OpenAI Platform,把 ChatGPT 式的自然全双工语音对话带给开发者。语音智能体可以边说边听,并能将任务委托给用户选择的其他模型。
- OpenAI 在 API 中开放 GPT-Live-1 语音模型
OpenAI 在 API 中开放 GPT-Live-1,把 ChatGPT 已面向 10 亿用户提供的语音系统带给开发者,支持边说边听、可搭配自选模型与 harness。作者称全双工加工具调用带来很多应用可能,回到纯文本体验会感觉变难。
- OpenAI 开放 GPT-Live-1 语音模型 API,支持全双工边听边说
OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,支持全双工同时听和说,价格为每分钟 $0.05。相比 GPT-Realtime-2.1,其全双工交互测试得分 80.1% 对 45.4%,轮次延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%,银行语音支持基准通过率从 12.4% 升至 32%。
- OpenAI 在 API 中开放 GPT-Live-1 语音模型
OpenAI 宣布 GPT-Live-1 现已在 API 中可用。开发者可在应用中引入 ChatGPT 式自然对话体验,语音智能体可在说话的同时聆听,并支持搭配用户自选的模型和 harness。
- OpenAI 在 API 中推出全双工语音模型 GPT-Live-1
OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。