OpenAI 发布 GPT-6 家族实用指南:选型、提示词与长任务管理
A model guide for the GPT-6 family
OpenAI 发布 GPT-6 家族的实用指南,讲解如何按任务选择 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna 及推理档位与速度模式。
原文系统给出 GPT-6 家族的选型、缓存成本、长任务管理等可操作方法,读者可直接迁移到自己的生产工作流。
GPT‑6 系列模型指南
在管理时间和成本的同时,从 GPT‑6 模型获得最佳效果的实用技巧
分享
GPT‑6 是我们迄今为止最先进的模型套件,为你提供适用于不同类型工作的模型选择。
无论你是将想法转化为可运行的原型、构建和测试某项功能,还是在代码仓库、数据库和外部 API 之间编排多步骤工作流,本指南都会说明如何选择 GPT‑6 模型、给它有效的指令、管理长时间运行的工作,并为生产环境做好准备。

TL;DR
在生产环境中高效运行。使用缓存(在新窗口中打开)和压缩(在新窗口中打开)来管理上下文和成本。衡量任务成功率和延迟,并规划监控和数据控制。
让模型匹配你的工作负载。通过选择适合任务的模型、推理投入(在新窗口中打开)和速度,在能力、成本和延迟之间取得平衡。
调整你的提示词和技能。让提示词、技能和仓库指令在以下方面保持一致:模型应交付什么、它可以独立完成什么,以及什么算作完成。
让长时间运行的工作保持正轨。使用引导(在新窗口中打开)、异步工具(在新窗口中打开)和委派(在新窗口中打开)来处理更新和独立工作。为模型何时应请求输入设定清晰的边界。
1. 在生产环境中高效运行
为生产环境准备工作流
在部署之前,有几项检查和最佳实践需要落实到位。
牢记效率。删减任务不需要的上下文(在新窗口中打开),同时保留它确实需要的证据。在你的应用支持的情况下,并行运行独立任务(在新窗口中打开),这样某个缓慢的步骤就不会拖住不相关的工作。
通过提示词缓存(在新窗口中打开)为重复性工作复用共享上下文。根据模型不同,缓存输入 token 的成本比未缓存输入 token 最多低95%(在新窗口中打开)。将稳定的指令和参考资料放在变化的任务细节之前,并保持工具定义一致。缓存仪表盘(在新窗口中打开)和诊断指南(在新窗口中打开)可帮助你发现这种复用在哪里失效。在估算完整工作流的成本时,要计入缓存写入和任何长上下文费率。
对于较长的对话,压缩(在新窗口中打开)可在保留继续所需状态的同时减小上下文大小。
决定你将如何监控行为(在新窗口中打开),并查看适用于你的应用的数据控制(在新窗口中打开)。
部署前测试:运行具有代表性的任务,并衡量任务成功率、延迟以及每个成功任务的成本。查看我们的API 部署检查清单(在新窗口中打开)。
让模型匹配工作负载
把模型选择和推理水平视为智能与价格之间的权衡。
模型:
GPT‑6 Astra(在新窗口中打开)适用于需要最大智能的最难推理工作。
GPT‑6.1 Sol(在新窗口中打开)适用于复杂的编程、研究和计算机使用。
GPT‑6 Luna(在新窗口中打开)适用于大规模聚焦任务,以及目标明确的日常重复性工作,例如提取发票字段、对请求进行分类或生成结构化摘要。
在评估最适合该任务的模型时,请比较各模型的定价(在新窗口中打开)。
推理级别:在 API 中,选择模型在该任务上投入多少精力。
低:常规任务,例如提取事实或进行小幅编辑。
中:需要判断力的工作,例如规划功能或比较选项。
高:困难的调试、更深入的分析或仔细的审查。
超高 / 最高:在支持的情况下,当“高”仍不够时进行测试,并且只有在改进足以证明额外时间和成本合理时才保留。
在 API 中,你可以在对话中途更改推理投入(在新窗口中打开),而不会破坏缓存。
在 Codex 中,先使用该模型的默认推理级别,然后对较简单的任务降低级别,或对更深入的分析提高级别。
速度:
在 API 中,当响应时间很重要时(例如在聊天应用或编码工具中),请使用快速模式(在新窗口中打开)。与标准处理相比,它以更高的每 token 成本提供更快、更一致的响应时间。
在 Codex 和 API 中,当更快的响应值得付出额外费用时(例如快速编码迭代),请使用超快(在新窗口中打开)。它会独立于推理投入加速 token 生成。适用于 GPT‑6 Astra(在新窗口中打开)。

2. 调整你的提示词和技能
给模型一个明确的任务
_“模型在理解细微差别和模糊性方面已经变得好得多,因此过去有帮助的过于具体的指导现在反而可能妨碍结果。”_(在新窗口中打开)
—Eric Provencher,OpenAI 开发者体验
从明确的任务开始:你想要的结果、它面向谁、相关背景和约束条件,以及什么算作完成。然后回顾以下四个领域,它们总结自_为 GPT‑6 Astra 重新思考技能和提示词_(在新窗口中打开),以深入了解如何更新你的指令:
创建更好的技能:保持描述简短,并明确说明每个技能应在何时运行,仅在需要时加载支持性细节,并用适合你团队所用模型的指导取代僵化的固定流程。
更新你的 AGENTS.md:说明特定文档和测试在何时相关,并明确授权安全的常规工作流,例如使用一次性数据运行本地测试且不访问生产环境。
设定决策边界:说明哪些操作可以独立进行,哪些需要批准,用清晰的边界取代一概而论的“始终询问”规则。
对坚持性做出明确规定:定义“完成”包括什么——实现更改、运行它、检查结果并修复失败——并指出任何需要你审查的决策。
如需更多指导,请参阅推理最佳实践(在新窗口中打开)。
定义你需要的输出
无论你是在 Codex 中工作还是使用 API 构建,都要明确模型可以做出哪些决策、何时应请求输入,以及什么样的响应才算有用。
给模型足够的指示,让工作持续推进,而无需对重要决策进行猜测。告诉它哪些选择可以自行决定,以及何时需要征求你的意见(opens in a new window),例如,它可以自行决定如何组织摘要,但在更改项目范围之前应先与你确认。描述什么样的回复才算有用(opens in a new window),例如使用通俗易懂的语言、符合受众需求的技术细节,以及一份简短的交接说明,涵盖更改了什么、检查了什么,以及还有哪些需要关注。
3. 优化长时间运行的任务
让复杂工作持续推进
借助 GPT‑6 系列模型,你现在可以承担跨越数小时甚至数天的任务。使用以下功能,更好地管理长时间运行任务中的智能体。
API
在 API 中,使用引导、异步工具和并行工作来让长时间运行的任务持续推进。
在运行过程中更新指令:回合中引导(opens in a new window)让你可以在模型工作时通过 Responses WebSocket API(opens in a new window) 发送更正。更新会排队;它们不会取消正在运行的工具,也不会撤销已完成的动作。
在工具运行时继续工作:异步工具调用(opens in a new window)让模型在你的应用运行较慢的任务(例如测试)时继续独立工作。你的应用在结果准备好时返回结果。在开始依赖该结果的工作之前,先等待该结果。
委派独立子任务:GPT‑6.1 Sol 支持Responses API 中的多智能体工作流(opens in a new window)。它可以将独立工作分配给子智能体(例如调查代码库的不同部分),并将它们的发现整合为最终回复。多智能体目前处于测试阶段。
Codex
长时间运行的任务可能会暴露出你在初始提示中未必预料到的决策。使用澄清和引导来让工作保持正轨。
在工作推进过程中回答问题:借助 GPT‑6 Astra,Codex 可以在工作时请求澄清(opens in a new window)。解决影响下一步的问题,并说明在你做决定期间哪些独立工作可以继续。如果你将离开,告诉 Codex 哪些任务可以继续,以及它应在何时暂停等待你的回答。
当需求变化时重定向工作:用新信息引导当前任务(opens in a new window),说明哪些应该改变、哪些应保持不变。这有助于避免在不再满足你需求的方法上花费更多时间。

利用计算机使用来完成更多工作
计算机使用(opens in a new window)让 GPT‑6 Astra、GPT‑6.1 Sol 和 GPT‑6 Luna 直接与网站和桌面应用交互,甚至是那些没有 API 的应用。例如,你可以让模型调查一个 bug、修复代码,并在浏览器中打开你的产品以检查修复是否有效。
为每个步骤选择最简单可靠的方式:
当 API 或已连接的工具可以直接完成工作时,就使用它。
当模型需要读取屏幕、点击按钮或为你填写表单时,使用计算机使用。
如果你要将计算机使用构建到自己的应用中,给模型一个可以运行代码来控制浏览器或桌面的工具。Playwright 适用于浏览器(opens in a new window);PyAutoGUI 适用于桌面应用。

从测试到生产:团队如何基于 GPT‑6 Astra 进行构建
1 / 4
**Harvey:更多上下文,更有用的草稿。**Harvey 结合法院信息、判例法、律所文件和律师的个人偏好来定制其草稿。“我们可以为模型提供更多上下文,从而产出结构越来越好的输出,”联合创始人 Gabe Pereyra 表示。
**Cognition:工程师可审查的测试结果。**Cognition 在 Devin 中使用 GPT‑6 Astra 来测试软件并返回证据。在一个 iPhone 游戏示例中,Devin 生成了一段模拟器录像和一份报告,将通过的检查与未测试的领域区分开来,使剩余工作更易于看清。
**Hex:从业务问题到交互式仪表板。**Hex 使用 GPT‑6 Astra 将关于销售渠道表现的问题转化为书面发现和交互式仪表板,包括地理细分。它还要求模型检查数字是否合理,以及分析是否回答了业务问题。
**Invideo:对最终剪辑拥有更多控制权。**Invideo 使用 GPT‑6 Astra 来规划时间线剪辑并创建可供剪辑师细化的自定义效果。该公司报告称,在调色和校正任务上的成功率大约提高了两倍。几位剪辑师还在一天内创建了约 50 个效果。
作者
OpenAI
来源:OpenAI:官网动态 · openai.com