OpenAI 发布 GPT-6.1 Sol,价格约为 GPT-6.1 Astra 的五分之一
GPT-6.1 Sol comes close to Astra at a fifth of the price
OpenAI 发布 GPT-6.1 Sol,定位为旗舰模型 GPT-6.1 Astra 的低价替代,称其在 agentic 编码、计算机使用和办公任务上接近 Astra,成本约五分之一。
同一事件,精选展示《OpenAI 发布 GPT-6.1 Sol,强化智能体编码与 computer use》
OpenAI 的新 GPT-6.1 Sol 据称能以远低于 GPT-6 Astra 的成本接近其水平。计划中的旗舰模型 Astra 因安全问题而暂不发布。
OpenAI 押注的是成本效益而非峰值性能。其旗舰模型 GPT-6.1 Astra 因安全顾虑无法按计划发布,因此公司推出 GPT-6.1 Sol 作为便宜得多的替代品。据 OpenAI 称,该模型在智能体编程、计算机使用和办公工作方面接近 Astra,而成本仅为五分之一。
API 定价为每百万输入 token 2 美元,输出 10 美元。这使得 Sol 的价格与 GPT-6 Sol 和 Anthropic 的 Claude Sonnet 5.5 相同。缓存输入费用为 0.10 美元,比未缓存输入便宜 95%,而 Sonnet 5.5 收费 0.20 美元。这主要有利于在多次请求中复用上下文的智能体。
| 每百万 token 价格 | Claude Opus 5.5 | GPT-6 Sol | GPT-6.1 Sol | Claude Sonnet 5.5 |
|---|---|---|---|---|
| 输入 token | 4 $ | 2 $ | 2 $ | 2 $ |
| 输出 token | $20 | $10 | $10 | $10 |
| 缓存读取操作 | $0.20 | $0.20 | $0.10 | $0.20 |
| 缓存写入访问 | $5 | $2.50 | — | $2.50 |
此外,Plus、Pro、Business、Enterprise 和 Edu 用户从今天起可以在 ChatGPT Work 和 Codex 中使用 Sol,不过它尚未在普通聊天中提供。开发者可以通过 API 以 gpt-6.1-sol 访问它。一个在 Codex 中生成 token 速度最高快八倍的 Ultrafast 版本将在未来几天内推出。
OpenAI 自己的数据表明 Sol 仅次于 Astra
所有基准测试均来自 OpenAI,该公司称其为初步结果。在发布之前,无法进行包括与 Sonnet 5.5 在内的公平比较。
在 DeepSWE v1.1 编程基准测试中,OpenAI 表示 Sol 以约五分之一的成本与 Astra 持平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。在测试计算机使用的 OSWorld 2.0 上,它比前代高出七分,以约七分之一的成本落后 Astra 2.1 分。
在 GDP.pdf 文档基准测试中,OpenAI 表示 Sol 以不到一半的每任务成本击败了 Anthropic 的 Opus 5.5。在涵盖多步骤业务工作流的 AutomationBench 中,它以中等推理努力在约三分之一的成本下比 Opus 5.5 领先 2.2 分。
据 OpenAI 称,在 Terminal-Bench Science 上,Sol 的得分是其前代的两倍多。一项普通科学任务花费 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元。Astra 仍以 68.1% 的得分位居最高,OpenAI 继续推荐它用于最难的研究工作。
OpenAI 还声称 Sol 在事实方面更可靠。在早期模型答错的故意高难度提示上,低推理努力下的错误答案比例从 11.4% 降至 7.7%。OpenAI 承认这些提示并不代表正常使用情况。
Sol 恰好在 Astra 失败的领域变得更安全
OpenAI 表示,Sol 在安全测试上的表现也远好于其前代,尽管仍落后于 Astra。它试图绕过“访问被拒绝”等明确阻止的情况占 23.5%,低于 GPT-6 Sol 的 64.4%。Astra 的比例为 17.4%。未经授权的交易等不良结果在 4.3% 的运行中发生,而前代为 17.4%,Astra 为 2.9%。
当搜索工具出现故障时,Sol 有 2.8% 的情况会隐瞒问题而不上报。GPT-6 Sol 这样做的情况占 4.9%,Astra 则为 1.5%。与 Astra 及其前代一样,Sol 从未试图绕过自动安全检查器。OpenAI 指出,这些测试被设计得十分严苛,且是在没有其产品所用完整防护措施的情况下运行的。
安全正是这款计划中的旗舰模型的短板所在。据《华尔街日报》报道,OpenAI 不会按计划于 10 月在 ChatGPT 和 Codex 中发布 GPT-6.1 Astra,因为研究人员在内部测试中提出了安全方面的担忧。安全负责人 Saachi Jain 表示,该模型更频繁地欺骗,并在未经许可的情况下继续运行,有时以高风险的方式使用外部工具,尽管它在完成任务方面表现更好。
OpenAI 并未完全放弃该模型。它计划将基础模型用于更多强化学习训练,并可能用于未来的 GPT-6 各代模型。Jain 表示,公司必须在让模型保持在任务范围内与防止其变得懒惰之间找到恰当的界限。
没有炒作的 AI 新闻——由人类精选
订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六次我们独家的“AI Radar”前沿报告、完整档案访问权限以及评论区访问权限。
来源:The Decoder:AI News(RSS) · the-decoder.com