跳到正文
OpenAI:官网动态·· 2 小时前精选AI 评分71

OpenAI 发布 GPT-6 家族实用指南:选型、提示词与长任务管理

A model guide for the GPT-6 family

AI 导读

OpenAI 发布 GPT-6 家族的实用指南,讲解如何按任务选择 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna 及推理档位与速度模式。

推荐理由

原文系统给出 GPT-6 家族的选型、缓存成本、长任务管理等可操作方法,读者可直接迁移到自己的生产工作流。

正文 · AI 翻译

GPT‑6 系列模型指南

在管理时间和成本的同时,从 GPT‑6 模型获得最佳效果的实用技巧

分享

GPT‑6 是我们迄今为止最先进的模型套件,为你提供适用于不同类型工作的模型选择。

无论你是将想法转化为可运行的原型、构建和测试某项功能,还是在代码仓库、数据库和外部 API 之间编排多步骤工作流,本指南都会说明如何选择 GPT‑6 模型、给它有效的指令、管理长时间运行的工作,并为生产环境做好准备。

Image 1: Three model cards: GPT-6 Astra, our most intelligent model for the best results, $10 input, $50 output, and $1 cached input; GPT-6.1 Sol, near-Astra intelligence for a fifth of the price, $2 input, $10 output, and $0.10 cached input; GPT-6 Luna, fast and efficient everyday work at scale, $0.10 input, $0.50 output, and $0.01 cached input.

TL;DR

1. 在生产环境中高效运行

为生产环境准备工作流

在部署之前,有几项检查和最佳实践需要落实到位。

让模型匹配工作负载

把模型选择和推理水平视为智能与价格之间的权衡。

在评估最适合该任务的模型时,请比较各模型的定价⁠(在新窗口中打开)。

  • 推理级别:在 API 中,选择模型在该任务上投入多少精力。

    • 低:常规任务,例如提取事实或进行小幅编辑。

    • 中:需要判断力的工作,例如规划功能或比较选项。

    • 高:困难的调试、更深入的分析或仔细的审查。

    • 超高 / 最高:在支持的情况下,当“高”仍不够时进行测试,并且只有在改进足以证明额外时间和成本合理时才保留。

在 API 中,你可以在对话中途更改推理投入⁠(在新窗口中打开),而不会破坏缓存。

在 Codex 中,先使用该模型的默认推理级别,然后对较简单的任务降低级别,或对更深入的分析提高级别。

Image 2: Paul Solt describes building apps and fixing iPad compatibility with Ultrafast and live steering.

2. 调整你的提示词和技能

给模型一个明确的任务

_“模型在理解细微差别和模糊性方面已经变得好得多,因此过去有帮助的过于具体的指导现在反而可能妨碍结果。”_⁠(在新窗口中打开)

—Eric Provencher,OpenAI 开发者体验

从明确的任务开始:你想要的结果、它面向谁、相关背景和约束条件,以及什么算作完成。然后回顾以下四个领域,它们总结自_为 GPT‑6 Astra 重新思考技能和提示词_⁠(在新窗口中打开),以深入了解如何更新你的指令:

  • 创建更好的技能:保持描述简短,并明确说明每个技能应在何时运行,仅在需要时加载支持性细节,并用适合你团队所用模型的指导取代僵化的固定流程。

  • 更新你的 AGENTS.md:说明特定文档和测试在何时相关,并明确授权安全的常规工作流,例如使用一次性数据运行本地测试且不访问生产环境。

  • 设定决策边界:说明哪些操作可以独立进行,哪些需要批准,用清晰的边界取代一概而论的“始终询问”规则。

  • 对坚持性做出明确规定:定义“完成”包括什么——实现更改、运行它、检查结果并修复失败——并指出任何需要你审查的决策。

如需更多指导,请参阅推理最佳实践⁠(在新窗口中打开)。

定义你需要的输出

无论你是在 Codex 中工作还是使用 API 构建,都要明确模型可以做出哪些决策、何时应请求输入,以及什么样的响应才算有用。

给模型足够的指示,让工作持续推进,而无需对重要决策进行猜测。告诉它哪些选择可以自行决定,以及何时需要征求你的意见⁠(opens in a new window),例如,它可以自行决定如何组织摘要,但在更改项目范围之前应先与你确认。描述什么样的回复才算有用⁠(opens in a new window),例如使用通俗易懂的语言、符合受众需求的技术细节,以及一份简短的交接说明,涵盖更改了什么、检查了什么,以及还有哪些需要关注。

3. 优化长时间运行的任务

让复杂工作持续推进

借助 GPT‑6 系列模型,你现在可以承担跨越数小时甚至数天的任务。使用以下功能,更好地管理长时间运行任务中的智能体。

API

在 API 中,使用引导、异步工具和并行工作来让长时间运行的任务持续推进。

Codex

长时间运行的任务可能会暴露出你在初始提示中未必预料到的决策。使用澄清和引导来让工作保持正轨。

  • 在工作推进过程中回答问题:借助 GPT‑6 Astra,Codex 可以在工作时请求澄清⁠(opens in a new window)。解决影响下一步的问题,并说明在你做决定期间哪些独立工作可以继续。如果你将离开,告诉 Codex 哪些任务可以继续,以及它应在何时暂停等待你的回答。

  • 当需求变化时重定向工作:用新信息引导当前任务⁠(opens in a new window),说明哪些应该改变、哪些应保持不变。这有助于避免在不再满足你需求的方法上花费更多时间。

Image 3: Peter Steinberger describes using Astra for a long-running refactor to asynchronous workers.

利用计算机使用来完成更多工作

计算机使用⁠(opens in a new window)让 GPT‑6 Astra、GPT‑6.1 Sol 和 GPT‑6 Luna 直接与网站和桌面应用交互,甚至是那些没有 API 的应用。例如,你可以让模型调查一个 bug、修复代码,并在浏览器中打开你的产品以检查修复是否有效。

为每个步骤选择最简单可靠的方式:

  • 当 API 或已连接的工具可以直接完成工作时,就使用它。

  • 当模型需要读取屏幕、点击按钮或为你填写表单时,使用计算机使用。

如果你要将计算机使用构建到自己的应用中,给模型一个可以运行代码来控制浏览器或桌面的工具。Playwright 适用于浏览器⁠(opens in a new window);PyAutoGUI 适用于桌面应用。

Image 4: Higgsfield AI demonstrates GPT-6.1 Sol multitasking and computer use in ChatGPT.

从测试到生产:团队如何基于 GPT‑6 Astra 进行构建

1 / 4

**Harvey:更多上下文,更有用的草稿。**⁠Harvey 结合法院信息、判例法、律所文件和律师的个人偏好来定制其草稿。“我们可以为模型提供更多上下文,从而产出结构越来越好的输出,”联合创始人 Gabe Pereyra 表示。

**Cognition:工程师可审查的测试结果。**⁠Cognition 在 Devin 中使用 GPT‑6 Astra 来测试软件并返回证据。在一个 iPhone 游戏示例中,Devin 生成了一段模拟器录像和一份报告,将通过的检查与未测试的领域区分开来,使剩余工作更易于看清。

**Hex:从业务问题到交互式仪表板。**⁠Hex 使用 GPT‑6 Astra 将关于销售渠道表现的问题转化为书面发现和交互式仪表板,包括地理细分。它还要求模型检查数字是否合理,以及分析是否回答了业务问题。

**Invideo:对最终剪辑拥有更多控制权。**⁠Invideo 使用 GPT‑6 Astra 来规划时间线剪辑并创建可供剪辑师细化的自定义效果。该公司报告称,在调色和校正任务上的成功率大约提高了两倍。几位剪辑师还在一天内创建了约 50 个效果。

作者

OpenAI

来源:OpenAI:官网动态 · openai.com