GPT-5.6 如何融合前沿智能与效率

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-07-29 08:00·47天前
AI 导读

OpenAI 推出 GPT-5.6 模型家族,旗舰版 GPT-5.6 Sol 在开启最大推理时以不到一半的成本超越 Claude Fable 5 的 Artificial Analysis Coding Agent Index 得分。

OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
70AI 编辑部评分,满分 100

GPT-5.6 如何融合前沿智能与效率

2026-07-29 08:00· 47天前
AI 导读

OpenAI 推出 GPT-5.6 模型家族,旗舰版 GPT-5.6 Sol 在开启最大推理时以不到一半的成本超越 Claude Fable 5 的 Artificial Analysis Coding Agent Index 得分。

推荐理由

GPT‑5.6 不光是新模型,它自己参与了推理栈优化,20% 成本降幅是实打实的工程突破,做 AI 应用的该重新算一下每次调用的成本了。

正文 · AI 翻译

我们设计 GPT‑5.6 模型家族,是为了在人们使用我们模型的各种任务范围内,平衡能力与成本。我们的旗舰模型 GPT‑5.6 Sol 在开启最大推理时,以不到一半的成本在 Artificial Analysis Coding Agent Index 上超越了 Claude Fable 5。Terra 在智能基准测试中表现与 GPT‑5.5 相当,价格却只有一半;Luna 是我们最快、最实惠的模型,定价比 Sol 的成本低 80%。为了实现这些效率提升,我们的研究和技术团队在技术栈的每一个主要层面都做了重大优化。这些改进涵盖我们的模型、推理(即我们如何运行模型以生成输出),以及我们的智能体运行框架——Codex 和 ChatGPT Work 都在使用它。

在过去四年里,随着我们将模型扩展到 10 亿活跃用户和超过 200 万家企业,效率一直是把智能带来的益处分配给每个人的核心。我们的使命是确保通用人工智能造福全人类。这些年来,我们持续在技术栈各层面释放更大的优化空间,以便在成本-智能曲线的每一个点上都能提供性能最强的模型。我们通过 GPT‑5.6 实现了迄今为止最高的每 token 智能效率,它经过训练,能够用每个 token 完成更多工作。在训练中,我们同时针对任务成功率和效率进行优化,引导模型以更直接的路径完成任务。

本文超越我们的模型本身,分享我们如何通过技术栈中另外两个主要部分的进步来实现效率设计,包括 1)推理,通过优化负载均衡、投机解码、缓存和内核优化等流程,从相同的硬件中获得更多输出;以及 2)我们的智能体框架,包括更好地管理上下文膨胀、工具使用和重复工作。我们还将分享 GPT‑5.6 Sol 在自主实现其中若干收益方面所发挥的作用。虽然任何孤立的改进看起来可能有限,但这些成果会叠加起来,使我们能够在智能和效率的前沿上持续交付。

Image 1: Diagram showing GPT-5.6 efficiency across the agent harness, API orchestration, and model inference, producing less network data, less CPU work, and more GPU output.

用 GPT‑5.6 Sol 加速推理

在一个算力受限、模型需求增长快于容量的世界里,效率是每个系统设计的核心。在我们的推理栈中尤其如此,它运行已训练好的模型来生成响应。我们的首要目标是用相同的硬件服务更多 token,同时保持用户所期望的智能水平、延迟、可用性和可靠性。

实现这一目标需要优化整个系统。一个模型孤立来看可能非常高效,但如果请求分配不当、硬件闲置,或数据移动拖慢计算,其服务成本仍然可能很高。每一层的改进都会叠加,收益来自路由(请求发送到哪里)、调度(请求何时发送)、内核(在 GPU 上运行的软件)、缓存(保存并复用已完成的工作)以及模型实现(GPU 代码的排序)等方面的优化。Codex 中的 GPT‑5.6 Sol 在所有这些优化中都发挥了关键作用。

第一个重要的例子是负载均衡。在全球范围内,我们根据地理位置、可用容量和加速器类型(运行模型的 GPU 或专用芯片类型)等因素来路由请求。在一个集群内,我们根据负载、上下文长度、缓存可用性以及其他请求属性,将工作分配到各个模型实例上。

而在每个实例内部,工作还必须高效地划分到各个加速器、模型的子网络以及计算核心上。Codex 中的 GPT‑5.6 Sol 帮助我们分析生产流量,识别此前被忽视的失衡来源,测试新的路由策略,并持续调优这些启发式规则。仅这些负载均衡方面的改进,就大幅降低了我们服务模型的成本。

我们还使用 GPT‑5.6 Sol 来优化模型的前向传播:即将输入转化为下一个 token 预测的计算过程。即便单个操作很快,过多的内存搬运、同步以及低效的数据布局也会让 GPU 处于空闲状态。为避免这种情况,GPT‑5.6 Sol 找到了可以预计算、可以避免或可以并行化的工作。借助 Codex,GPT‑5.6 Sol 自主重写并优化了我们的生产 kernel,即执行构成模型的数学运算的核心代码。这之所以可行,部分原因在于我们训练了 GPT‑5.6,使其能够高效地用 Triton⁠ Gluon⁠ 编写和改进 kernel,这两种开源 GPU 编程语言由 OpenAI 维护。这些努力,加上 GPT‑5.6 Sol 在更广泛的 kernel 方面的进展,将端到端服务成本降低了 20%。我们还大力投入了验证工具,例如开源工具 FpSan⁠ (浮点 Sanitizer),以帮助验证 GPT‑5.6 Sol 所编写 kernel 的正确性。

投机解码是提升速度与效率的又一手段。该技术让一个较小的草稿(或称“投机”)模型与主模型并行运行,由草稿模型提出若干 token,交由主模型并行验证。当这些提议被接受时,系统便能通过主模型的一次前向传播产出多个输出 token,从而减少代价高昂的顺序计算量。

GPT‑5.6 Sol 通过在其架构上设计并运行数百次实验,测试规模、结构和特征方面的改动,改进了自身的草稿模型。此外,GPT‑5.6 Sol 还启动并监控了投机模型的训练过程,在出现问题时自主介入,包括硬件故障和训练不稳定。

由此带来的改进将 token 生成效率提升了 15% 以上。

在处理未缓存的输入 token 时,模型通过一次计算密集的前向传播构建键值(KV)缓存;在生成输出时,则反复读取并扩展该缓存。服务的最优配置,例如批处理、分片和 KV 管理,在很大程度上取决于工作负载——提示词与输出长度、批大小、缓存命中率、查询特征等等。

然而,配置空间此前过于庞大,无法系统性地调优,工程师只能依赖宽泛的启发式方法。借助 Codex 中的 GPT‑5.6 Sol,我们得以分析生产工作负载、生成并评估候选配置,并针对每种场景对引擎和模型的配置方式进行超优化。

这使得针对特定工作负载的优化达到了新的实用水平,从相同的硬件中榨取出更多有用的推理。

推理优化是一个持续不断的反馈闭环。我们衡量生产环境中的行为,找出最大的差距,实施改动,并验证这些改动改善的是整个系统,而不是某个孤立的基准测试。GPT‑5.6 Sol 和 Codex 加速了这个闭环的每一个环节。这意味着我们的团队可以探索更多想法,更快地响应不断变化的工作负载,并打造出延迟更低、容量更大、用户成本更低的推理栈。

我们的智能体框架如何精简重复性工作

ChatGPT Work 和 Codex 通过一系列模型请求和工具调用来完成复杂任务。在单个回合中——从用户提出请求到给出最终响应——Codex 可能会检查源代码、搜索部署历史、阅读事故报告、编辑文件并运行测试。每一步都可能需要一次请求。

准备上下文、传输数据、运行推理、调用工具以及启动进程,都要耗费时间和算力。如果一个任务需要 30 次模型请求,那么每次请求多花一秒,累积起来就很可观。提升整体性能意味着减少整个系统中的重复性工作,而不仅仅是让模型变得更快。

Image 2: A user task enters the model, which can call a tool, receive a result, and make another model decision repeatedly before completing the task.

单个用户回合可能包含许多次模型和工具迭代。重复区域内产生的任何成本都可能被反复支付。

这些倍增效应影响了我们设计智能体框架的方式,它是一个 Rust 编排层,连接我们的模型、工具以及用户的环境。接下来,我们将介绍如何通过避免上下文膨胀、加载工具以及复用工作成果,让每一次请求都更加高效。

避免上下文膨胀

随着智能体被授予访问更多工具、技能、插件和对话历史的权限,上下文窗口很容易膨胀。这会增加成本、分散模型注意力,并引发不必要的推理。harness 可以通过延迟发现来减少这种开销,使集成、自定义 MCP 工具、技能和插件仅在需要时才浮现。harness 还能防止单个工具和 MCP 集成意外占用上下文窗口。除非模型请求不同的上限,工具输出默认被限制在 10,000 tokens。

为提示词缓存保留精确前缀

如前所述,智能体循环可能在单轮内多次将相同的指令、对话历史、工具定义和先前结果发送到 GPU。处理这些重复输入代价高昂,因此提示词缓存会复用与先前已处理提示词前缀相关的计算。为保留该前缀,harness 将所有模型可见的历史视为仅追加:新消息、工具结果和环境更新都添加在末尾,而不是插入到更早的上下文中。

工具也以确定性顺序呈现,而运行时设置(如审批策略)在执行期间应用,而不是嵌入到工具定义中。这一设计选择有助于 Codex 和 ChatGPT Work 实现较高的整体提示词缓存命中率。

Image 3: Three requests compare bytes sent over a persistent connection with the growing context seen by the model and the prefix eligible for cache reuse.

增量传输改变的是跨网络传输的内容;提示词缓存改变的是模型可以避免重新计算的内容。宽度为概念性示意,额外的压缩层未显示。

智能曲线上的效率提升

我们在 GPT‑5.6 上实现的效率提升,源于多年来在整个技术栈上持续累积的改进,涵盖研究、推理以及我们的智能体框架。GPT‑5.6 在实现其中许多改进中所发挥的作用,让我们对优化速度将进一步加快感到乐观。我们将继续在 kernel 优化等领域进行更大力度的优化,同时推进技术栈的基础性改进。我们期待将这些持续进行的底层改进,以更广泛可用、更具成本效益的智能形式,回馈给我们的用户和客户。

特别感谢技术团队成员 Matthew Ferrari、Philippe Tillet、Ahmed Ibrahim、Joe Gershenson 和 Steve Coffey 对本文的贡献。

Matthew Ferrari、Phil Tillet、Ahmed Ibrahim、Joe Gershenson、Steve Coffey

来源:OpenAI:官网动态(RSS · 排除企业/客户案例)· openai.com