OpenAI 的 GPT-Live-1 在 Artificial Analysis Speech to Speech Index 首次亮相即以 81.5 分(Astra 后端)登顶,领先 Grok Voice Think Fast 2.0;Sol 后端配置得 80.1 分列第 3
事件全貌
AI 综述OpenAI Developers 发布 GPT-Live-1 在生产级语音代理关键基准上的实测,聚焦任务完成、往返对话与轮次衔接、响应速度以及工具使用,并给出结果。
Artificial Analysis 称,GPT-Live-1 是其 Speech to Speech Index 上的首次亮相:以 Astra 为委派后端模型、中等推理强度时得 81.5 分排名第 1,领先 Grok Voice Think Fast 2.0;Sol 后端、低推理强度配置得 80.1 分排名第 3,Grok Voice Think Fast 2.0 High 以 81.3 分位于两者之间。该机构描述 GPT-Live-1 为 OpenAI 新的全双工语音到语音模型,可将推理和工具使用委派给后端文本模型,同时继续对话;开发者通过 API 流式输入音频并接收语音返回,后端文本模型单独配置。
Artificial Analysis 还给出其他基准结果:Speech Agent Arena 中,GPT-Live-1(Sol,低)以 1,053 Elo、90.9% 任务成功率排名偏好第 3,GPT-Live-1(Astra,中)以 1,048 Elo、87.4% 任务成功率排名第 4;Gemini 3.1 Flash Live Minimal 以 1,096 Elo 领先偏好榜,Grok Voice Think Fast 2.0 High 以 94.6% 领先任务成功率。Tau Voice 上,GPT-Live-1(Astra,中)和(Sol,低)以 67.9% 和 59.3% 占据前两名,高于 Grok Voice Think Fast 2.0 High 的 56.5%。Big Bench Audio 音频推理上,GPT-Live-1(Astra,中)得 90.1%、(Sol,低)得 89.0%,落后于 Grok Voice Think Fast 2.0 High 的 97.2% 和 Qwen Audio 3.0 Realtime Plus 的 99.2%。速度方面,Big Bench Audio 上平均首音频时间为 GPT-Live-1(Astra,中)1.34 秒、(Sol,低)1.24 秒,Grok Voice Think Fast 2.0 High 为 0.70 秒。成本方面,按固定 Big Bench Audio 定价子集,GPT-Live-1(Astra,中)每小时输入音频 5.83 美元,(Sol,低)4.47 美元(含委派后端模型用量),Grok Voice Think Fast 2.0 High 为 4.80 美元。
AI 汇总报道生成 · 59分钟前更新。单篇报道保留其发布时的原貌。
Artificial Analysis 称 GPT-Live-1 首次亮相其 Speech to Speech Index 即以 81.5 分(Astra 后端)登顶,Sol 后端配置得 80.1 分列第 3。
报道时间线
沿着报道,了解事件的不同侧面。
- Artificial Analysis 评测:GPT-Live-1 以 81.5 分登顶 Speech to Speech Index
Artificial Analysis 发布 Speech to Speech Index,OpenAI 的 GPT-Live-1 以 81.5 分(Astra 后端,medium 推理强度)排名第一,超过 Grok Voice Think Fast 2.0 High 的 81.3;Sol 后端配置得 80.1 排第三。