OpenAI在API中发布全双工语音模型GPT-Live-1,前端语音层定价每分钟0.05美元,并将扩展语音与语言选项
事件全貌
AI 综述OpenAI宣布在API中发布全双工语音模型GPT-Live-1。该模型能实现边听边说的自然对话,并允许开发者将推理和工具调用委托给后端模型。OpenAI宣称,GPT-Live-1在全双工交互基准测试中得分80.1%,相比前代模型GPT-Realtime-2.1的45.4%有显著提升;轮次切换延迟从1.4秒降至0.8秒;工具调用准确率从60%提高到87%。
该模型的前端语音层定价为每分钟0.05美元。OpenAI表示,GPT-Live-1已随附12种新语音,涵盖不同口音、方言和语言,并计划在未来几个月继续扩展语音选项和语言支持。开发者可通过联系销售申请自定义语音访问。
在早期评估中,语言学习应用Speak发现,GPT-Live-1为学习者提供了更多思考时间,将中断次数减少了近80%。第三方报道指出,Yelp正在使用该模型处理基于电话的预订,并报告了更好的通话处理效果。OpenAI官方账号及多位第三方用户确认了该模型已在API和OpenAI平台上可用。
AI 汇总报道生成 · 35分钟前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- OpenAI GPT-Live-1 上线 API 与 OpenAI Platform
OpenAI 将 GPT-Live-1 开放到 API 和 OpenAI Platform,把 ChatGPT 式的自然全双工语音对话带给开发者。语音智能体可以边说边听,并能将任务委托给用户选择的其他模型。
- OpenAI 在 API 中开放 GPT-Live-1 语音模型
OpenAI 在 API 中开放 GPT-Live-1,把 ChatGPT 已面向 10 亿用户提供的语音系统带给开发者,支持边说边听、可搭配自选模型与 harness。作者称全双工加工具调用带来很多应用可能,回到纯文本体验会感觉变难。
- OpenAI 开放 GPT-Live-1 语音模型 API,支持全双工边听边说
OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,支持全双工同时听和说,价格为每分钟 $0.05。相比 GPT-Realtime-2.1,其全双工交互测试得分 80.1% 对 45.4%,轮次延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%,银行语音支持基准通过率从 12.4% 升至 32%。
- OpenAI 在 API 中开放 GPT-Live-1 语音模型
OpenAI 宣布 GPT-Live-1 现已在 API 中可用。开发者可在应用中引入 ChatGPT 式自然对话体验,语音智能体可在说话的同时聆听,并支持搭配用户自选的模型和 harness。
- OpenAI 在 API 中推出全双工语音模型 GPT-Live-1
OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。