OpenAI 的 GPT-Live-1 首次亮相便以 81.5 分登顶 Artificial Analysis 语音到语音指数,其委托后端模型为 Astra,领先于 Grok Voice Think Fast 2.0
GPT-Live-1 是 @OpenAI 推出的全新全双工语音到语音模型,它可以将推理和工具调用委托给后端文本模型,同时继续对话。开发者通过 API 流式输入音频并接收语音返回,后端文本模型可单独配置。我们评估了两种后端配置:Astra 在中等推理强度下,以及 Sol 在低推理强度下。
关键要点: ➤ 语音到语音指数:GPT-Live-1(Astra,medium)达到 81.5,排名第 1,而 GPT-Live-1(Sol,low)得分为 80.1,排名第 3。Grok Voice Think Fast 2.0 High 以 81.3 位居两者之间 ➤ 语音智能体竞技场:GPT-Live-1(Sol,low)以 1,053 Elo 在偏好度上排名第 3,任务成功率为 90.9%,而 GPT-Live-1(Astra,medium)以 1,048 Elo 排名第 4,任务成功率为 87.4%。Gemini 3.1 Flash Live Minimal 以 1,096 Elo 在偏好度上领先,而 Grok Voice Think Fast 2.0 High 以 94.6% 在任务成功率上领先 ➤ Tau Voice:GPT-Live-1(Astra,medium)和 GPT-Live-1(Sol,low)在我们的智能体性能基准上占据前两名,分别为 67.9% 和 59.3%,领先于 Grok Voice Think Fast 2.0 High 的 56.5%。 ➤ Big Bench Audio:GPT-Live-1(Astra,medium)得分为 90.1%,GPT-Live-1(Sol,low)得分为 89.0%,在音频推理上落后于 Grok Voice Think Fast 2.0 High 的 97.2% 和 Qwen Audio 3.0 Realtime Plus 的 99.2% ➤ 速度:在 Big Bench Audio 上,GPT-Live-1(Astra,medium)的平均首次音频时间为 1.34 秒,GPT-Live-1(Sol,low)为 1.24 秒,而 Grok Voice Think Fast 2.0 High 为 0.70 秒 ➤ 成本:GPT-Live-1(Astra,medium)每小时输入音频成本为 $5.83,而 GPT-Live-1(Sol,low)为 $4.47,包含委托后端模型使用量,相比之下,在我们固定的 Big Bench Audio 定价子集上,Grok Voice Think Fast 2.0 High 为 $4.80
详见下方了解更多 ⬇️