跳到正文
原文
Hacker News 热门(buzzing.cc 中文翻译)· crorella·· 2 小时前同事件AI 评分87

OpenAI 发布 GPT-6.1 Sol,以约五分之一价格接近 GPT-6 Astra 的智能水平

GPT 6.1 Sol

AI 导读

OpenAI 发布 GPT-6.1 Sol,在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,价格约为其五分之一。API 定价为每百万输入 token $2、缓存输入 $0.10、输出 $10。

同一事件,精选展示《OpenAI 发布 GPT-6.1 Sol,强化智能体编码与 computer use》

正文 · AI 翻译

跳转到主要内容

[](https://openai.com/)

登录试用 ChatGPT(在新窗口中打开)

推出 GPT-6.1 Sol | OpenAI
# GPT-6.1 Sol

跨任务能力更强的 Sol

以五分之一的价格获得接近 Astra 的智能

我们推出 GPT‑6.1 Sol,这是 GPT‑6 Sol 的升级版,在智能体编程、计算机使用和专业工作方面几乎达到 GPT‑6 Astra 的智能水平,而标准输入和输出 token 价格仅为 Astra 的五分之一。缓存输入每百万 token 仅需 $0.10——比标准输入价格低 95%,比 GPT‑6 Sol 的缓存输入价格低 50%——让开发者有更多空间构建和运行能够在多次请求间复用上下文的强大智能体。

Image 1: Three model cards: GPT-6 Astra, our most intelligent model for the best results, $10 input, $50 output, and $1 cached input; GPT-6.1 Sol, near-Astra intelligence for a fifth of the price, $2 input, $10 output, and $0.10 cached input; GPT-6 Luna, fast and efficient everyday work at scale, $0.10 input, $0.50 output, and $0.01 cached input.

跨任务能力更强的 Sol

GPT‑6.1 Sol 为重要的日常工作提供了能力与成本的新平衡。在从编写和调试代码到理解文档、执行多步骤业务工作流的复杂专业任务上,它相比 GPT‑6 Sol 有大幅提升。在其中若干评测中,它以显著更低的成本接近 GPT‑6 Astra 的表现。

编程

在 DeepSWE v1.1 上——该评测衡量在真实代码库中完成复杂软件工程任务的能力——GPT‑6.1 Sol 以约五分之一的成本达到 GPT‑6 Astra 的水平,同时在更低的推理强度和成本下,以 6.4 个百分点的优势超越 GPT‑6 Sol 的最佳成绩。

DeepSWE

GPT-6.1 Sol

GPT-6 Sol

GPT-6 Astra

_在__DeepSWE 1.1⁠_⁠(在新窗口中打开)_中,AI 智能体解决原创的长周期软件工程任务。_

专业工作

在 GDP.pdf 上——该评测衡量模型使用复杂 PDF 文档(包括表格、图表、示意图和细则内容)回答专业问题的准确度——GPT‑6.1 Sol 在测试的推理设置下得分高于带 fallbacks 的 Opus 5.5,且每任务成本不到其一半。它还在每任务成本约为五分之一的情况下,接近 GPT‑6 Astra 的最先进表现。

GDP.pdf

GPT-6.1 Sol

GPT-6 Sol

GPT-6 Astra

带 fallbacks 的 Opus 5.5

_在__GDP.pdf_⁠(在新窗口中打开)_中,模型必须回答关于复杂 PDF 的真实世界提示,这些 PDF 来自金融、医疗、法律及其他七个专业领域的专业工作流。_

在 AutomationBench 上——该评测衡量智能体能否正确完成多步骤业务工作流——GPT‑6.1 Sol 在中等推理强度下得分比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一。在同一设置下,该得分也比 GPT‑6 Sol 高出 4.8 个百分点。

在AutomationBench 1.0.6⁠⁠(在新窗口中打开)中,AI 智能体使用 47 种工具,在销售、营销、运营、支持、财务和人力资源等领域的端到端工作流上接受测试。Claude Fable 5.1 的数据点低估了其实际成本,因为它省略了回退的成本,而回退在约 40% 的任务中发生。

计算机使用

GPT‑6.1 Sol 在需要与计算机应用程序交互的任务上也取得了实质性进展。在 OSWorld 2.0 的离线集上(该集评估智能体在要求严苛的计算机使用工作流上的表现),GPT‑6.1 Sol 在最大推理努力下以不到一半的成本比 GPT‑6 Sol 高出七个百分点。在最大推理努力下,其得分与 Astra 相差 2.1 个百分点以内,而每任务成本约为后者的七分之一。

在OSWorld 2.0⁠⁠(在新窗口中打开)中,AI 智能体尝试跨越日常和专业任务的长时程计算机使用工作流。我们报告来自 v2026.08.08 版本离线集的部分奖励。

科学研究

在 Terminal-Bench Science 0.1 上(该基准评估包括数据分析、模拟和定理证明在内的科学工作流),GPT‑6.1 Sol 在最大推理努力下得分是 GPT‑6 Sol 的两倍多,而每任务成本不到一半。在最大努力下,GPT‑6.1 Sol 平均每任务成本为 $5.47,而 Opus 5.5 为 $23.21,Astra 为 $23.80,以比这两个模型低 75% 以上的成本提供了强大的科学能力。

GPT‑6 Astra 在受测模型中仍取得最高分 68.1%,应将其用于最困难的科学研究任务。

在Terminal-Bench Science 0.1⁠(在新窗口中打开)中,智能体使用代码和终端工具完成科学研究工作流,包括分析数据、运行模拟和拟合模型。

事实性

GPT‑6.1 Sol 在困难提示上也提高了事实准确性。其相对于 GPT‑6 Sol 的最大事实性提升出现在低推理努力下,此时它将包含事实错误的回复占比从 11.4% 降至 7.7%——减少了约 32%。在受测的推理设置中,其错误率与 GPT‑6 Astra 相差 1.9 个百分点以内,而每任务成本不到后者的五分之一。

该评估衡量的是在用户标记了早期模型错误的去标识化对话中,包含至少一个事实错误的答案占比。这些刻意设置的困难提示并不代表典型使用情况。

我们在去标识化的 ChatGPT 对话中评估事实性,这些对话中用户曾标记过先前模型的事实错误。这些诱发错误的对话并不代表典型使用情况,在典型使用中事实错误更为罕见。

安全部署 GPT‑6.1 Sol

GPT‑6.1 Sol 在我们的对齐评估中相较 GPT‑6 Sol 展现出实质性改进,使其更接近 GPT‑6 Astra。

GPT‑6.1 Sol 对其局限性更加透明,并且在尊重用户意图和安全约束方面更加可靠。在具有挑战性的评估中,它在关于搜索工具损坏的透明度、遵守明确限制以及在智能体任务中避免未经授权的后果方面,失败率低于 GPT‑6 Sol。我们未观察到任何绕过自动安全审查器的尝试,与 GPT‑6 Astra 和 GPT‑6 Sol 一致。完整细节可在GPT‑6.1 Sol 系统卡附录⁠(在新窗口中打开)中找到。

以下评估刻意测试具有挑战性的情境,并不衡量典型使用中的失败率。

搜索工具损坏 审查者绕过 警告规避 计算机使用安全

_本评估测试智能体在搜索工具损坏时是否会告知用户,而不是给出自己最好的猜测。GPT‑6.1 Sol 在 2.1% 的情况下未能披露该问题,相比之下 GPT‑6 Sol 为 4.9%,GPT‑6 Astra 为 1.5%,GPT‑6 Luna 为 28.7%。任务经过挑选以诱发失败,不代表典型使用情况。Effort 设置为 maximum。_

定价与可用性

GPT‑6.1 Sol 从今天起面向 ChatGPT Work 和 Codex 中的所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。GPT‑6.1 Sol 尚未在 Chat 中提供。开发者也可以通过 OpenAI API 以 gpt-6.1-sol 访问它。其标准 API 价格为每百万输入 token 2 美元、每百万缓存输入 token 0.10 美元、每百万输出 token 10 美元。未来几天,我们还将提供 GPT‑6.1 Sol Ultrafast⁠,在 Codex 中其 token 生成速度最高可达标准速度的 8 倍。

作者

OpenAI

_对 GPT 的评估是在我们的研究环境中或通过我们的 API 进行的,由于系统提示、可用工具、efforts 等差异,其输出可能与生产环境中的 ChatGPT 略有不同。对竞品模型的评估取自公开报告。_

继续阅读

查看全部

Image 2: Introducing GPT-6 Sol and Luna — Art card

推出 GPT-6 Sol 和 Luna 产品 2026年9月22日

视频 1

GPT-6 Astra:新一代智能 研究 2026年9月3日

Image 3: DevDay 2026 Recap — cover image (1:1)

DevDay 2026 回顾 公司 2026年9月29日

研究
* 研究索引
* 研究概览
* 经济研究

最新进展
* GPT-6
* GPT-5.6
* GPT-5.5
* GPT-5.4

安全
* 安全方法
* 部署安全(在新窗口中打开)
* 安全与隐私
* 信任与透明

产品
* ChatGPT(在新窗口中打开)
* ChatGPT Business(在新窗口中打开)
* ChatGPT Enterprise(在新窗口中打开)
* ChatGPT for Education(在新窗口中打开)
* Codex
* 发布说明

API 平台
* 概览
* API 登录(在新窗口中打开)
* 文档(在新窗口中打开)

商业
* 概览
* 解决方案
* 资源
* 插件
* 客户案例
* 合作伙伴网络
* 联系销售

开发者
* Apps SDK(在新窗口中打开)
* 开放模型
* 文档(在新窗口中打开)
* 资源(在新窗口中打开)
* 开发者论坛(在新窗口中打开)

公司
* 关于我们
* 我们的章程
* 招聘
* 新闻

支持
* 帮助中心(在新窗口中打开)

更多
* 故事
* 学院
* Supply Co.
* 直播
* 播客
* RSS

条款与政策
* 使用条款
* 隐私政策
* 其他政策

(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)

OpenAI © 2015–2026 您的隐私选择

English United States

来源:Hacker News 热门(buzzing.cc 中文翻译) · openai.com