Claude Opus 5.5 提示词指南:与 Opus 5 的行为差异及迁移模式
Prompting Claude Opus 5.5
Anthropic 官方文档介绍针对 Claude Opus 5.5 的提示词模式,覆盖 effort 校准、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、视觉输入和前端设计等场景。
官方文档梳理了从 Claude Opus 5 迁移到 5.5 时的具体提示词与 harness 调整点,可直接对照排查现有集成的问题。
与 Claude Opus 5 的行为差异,以及应对这些差异的提示词和测试框架模式:努力程度校准、API 集成与聊天中的思考行为、进度更新、无人值守与多智能体任务、安全防护拒绝、前端设计、复杂视觉输入、多应用工作流,以及用户消息中粘贴的文本。
本指南涵盖 Claude Opus 5.5 特有的提示词模式。关于该模型的能力和 API 变更,请参阅 What's new in Claude Opus 5.5。关于适用于所有当前 Claude 模型的技术,请参阅 Prompting best practices。
Claude Opus 5.5 生成输出 token 的速度比 Claude Opus 5 快 30% 以上,并且往往能用更少的 token 完成同一任务。现有的 Claude Opus 5 提示词无需修改即可表现良好,Prompting Claude Opus 5 中的模式仍然是一个合理的起点。请从与你观察到的现象相匹配的章节开始:
- 不确定该使用哪个努力程度,或者轮次运行时间比 Claude Opus 5 更长、成本更高:Calibrate effort
- 你的 Claude Opus 5 集成在禁用思考的情况下运行:Prompts written for thinking disabled
- 无人值守的智能体在报告进度后于长任务中途停止:Unattended agentic runs
- 请求返回
stop_reason: "refusal":Safeguard refusals - 长时间智能体轮次看起来毫无动静,或者你希望在可预测的节点获得更新:User-facing progress updates
- 跨多个已连接应用工作的智能体遗漏了任务未指向的信息:Explore context in multi-app workflows
- 你运行一个智能体团队,希望它更快完成:Time signals for multiagent harnesses
- 聊天应用中的回复启动缓慢,因为模型会先进行长时间思考:Thinking instructions in chat system prompts
- 模型会遵循用户粘贴文本中夹带的指令:Mark pasted text in user messages
- 关于密集图表、示意图或截图的回答会遗漏细节:复杂视觉输入工具
- 前端输出看起来千篇一律:前端设计默认值
与提示相关的能力
对提示而言最重要的能力是:
- 智能体编程与代码审查:该模型在真实代码库中的多步骤工作上表现最强,例如在大型代码库中推进一项改动直至其测试通过。在 Anthropic 的测试中,在其默认的
medium努力程度下,该模型在此类任务上匹配或超过了high努力程度的 Claude Opus 5,且步骤更少、token 更少。它也比 Claude Opus 5 更能维持长时间运行的自主工作,例如多小时的审计和大型代码库迁移,借助并行子智能体端到端运行且几乎无需监督。早期测试者还报告了更强的代码审查能力,相比 Claude Opus 5 捕获更多 bug 且误报更少,并且它用平实的语言解释其改动。 - 知识工作:该模型陈述错误数字或引用错误来源的可能性大大降低。它更擅长财务建模任务,例如为一项交易构建财务模型和一页纸摘要,或发现并修复估值工作簿中的错误,并且它能捕捉大型输入中容易遗漏的细节,例如冗长规划讨论中落在错误工作日的日期,或幻灯片中与底层数字不符的图表。它生成的电子表格、幻灯片和文档在分享前需要更少的编辑。
- 沟通:它关于智能体工作的报告,无论是工作过程中的更新还是完成时的总结,都平实地说明它做了什么、发现了什么以及需要你提供什么。参见面向用户的进度更新。
- 图表、示意图、截图与计算机使用:该模型无需额外工具就能比 Claude Opus 5 更准确地读取视觉材料:在 Anthropic 的测试中,即使在其最低努力程度设置下,它从密集图表中读取数值的准确度也高于处于最高努力程度的 Claude Opus 5,且使用的输出 token 仅为其一小部分。在含义取决于位置而非文字的场景中,它也表现更好:流程图中箭头连接的是哪些方框、示意图两个版本之间有何变化,或日历截图中会议确切何时开始和结束。它在计算机使用方面也更可靠,即通过截图在多个步骤中操作应用程序:在其默认努力程度下,它达到了 Claude Opus 5 仅在更高努力程度设置下才能达到的成功率。参见复杂视觉输入工具。
校准努力程度
Effort 是控制 Claude Opus 5.5 思考量的主要手段,而且由于思考始终开启,它是在智能、延迟和成本之间权衡时首先要调整的设置。从 medium 开始——这是 Claude Opus 5.5 的默认值(Claude Opus 5 默认为 high)——显式设置它,并针对你自己的评估测试多个级别,而不是沿用你在 Claude Opus 5 上使用的设置。Effort 级别名称在不同模型之间并不对应相同的思考量:在 Anthropic 的测试中,Claude Opus 5.5 在 medium 下的编码和知识工作评估中达到或超过 Claude Opus 5 在 high 下的表现,而在若干编码评估中,low 以低得多的成本接近这一水平。参见 Recommended effort levels for Claude Opus 5.5。
在给定级别下,Claude Opus 5.5 每轮思考量往往比 Claude Opus 5 更多,尤其是在 xhigh 和 max 下。如果你保留为 Claude Opus 5 设置的 effort 值,预计轮次会更长、输出 token 会更多。三项调整会有帮助:
- 将
max_tokens设置得足够高,为模型的思考 token 和回复留出空间。即使思考内容不会返回给你,思考也会计入max_tokens,因此按 Claude Opus 5 关闭思考时设定的上限可能会截断回复。对于智能体编码可能产生的长轮次,在 Anthropic 的测试中,max_tokens设为 128,000(该模型的最大值)效果良好。 - 将
xhigh和max保留给那些你已测量到质量提升的工作。 - 要减少思考,先降低 effort 级别。降低 effort 会减少思考,从而降低成本和延迟,这比提示指令更可靠。
在请求之间更改顶层 effort 值会使提示缓存失效。若要以不同级别运行单个轮次,请改用逐消息 effort 更改(beta),这样可以保留缓存。
为关闭思考而编写的提示词
Claude Opus 5 在 high effort 或更低级别下接受 thinking: {"type": "disabled"};Claude Opus 5.5 不接受,迁移指南涵盖了请求变更。如果你的 Claude Opus 5 集成在关闭思考的情况下运行,随之而来有四项变更:
- 从
loweffort 开始并测量。在low下,模型会保持简短思考。它完全跳过思考的频率取决于你的提示词,因此请在你自己的流量上测量延迟和质量,如果质量下降就转到medium。如果此后首 token 时间仍然重要,像 "Answer directly without deliberating." 这样的系统提示词行可以进一步减少思考;添加时请测量质量,因为更少的思考可能会降低质量。 - 移除那些代替思考的指令。如果你的提示词要求模型在回复中写出其推理过程以代替思考,请移除该指令,改为从摘要思考块中读取推理内容(
display: "summarized");促使模型在回复文本中复现其推理过程的提示词,可能会被reasoning_extraction拒绝类别拒绝。 - 重新测试禁用思考时的缓解措施。在禁用思考的情况下运行建议使用一条组合指令(允许在工具调用前发言、没有合适工具时该怎么做、不使用内部标签),并移除任何告诉模型不要思考的规则。这两者针对的都是仅在禁用思考时才会在 Claude Opus 5 上出现的产物。在思考始终开启的情况下,检查你是否仍需要该指令,并且无论如何都要移除那条禁止思考的规则。
- 按块类型读取响应。检查每个块的类型,而不是假定第一个内容块就是文本:响应可能以也可能不以
thinking块开头,在默认的display: "omitted"下,该块的thinking字段为空。
无人值守的智能体运行
在包含多个部分的长时间任务中,Claude Opus 5.5 会在工作时持续向用户更新进展,其中一些更新会以文本而非工具调用来结束回合(stop_reason: "end_turn")。如果无人值守的智能体循环把这样的回合视为任务结束,就会在那里停止运行。一些 harness 和提示词上的改动可以帮助它继续运行。
把仅含文本的回合结束视为一份报告,而不是任务已完成的证明。将任务的各个部分放在模型会更新的清单中,例如待办工具或文件。如果某个回合结束时仍有未完成项且未说明阻塞原因,就发送一条简短的用户消息列出这些项,如下所示。你也可以预先说明完成条件,并让一个独立的、更小的模型在每个回合结束时对照该条件检查对话,当条件未满足时将其理由作为下一条用户消息返回。无论采用哪种方式,对同一任务在自动续跑两到三次后就停止,而不是无限重复,这样真正卡住的一次运行就会结束并可供审查。
如果模型启动的某个东西仍在运行,例如后台命令或子智能体,就不要把任务视为已完成:等待它结束,并将其输出作为下一条用户消息返回给模型。
在系统提示词中追加内容也可以减少这些过早停止的发生。Claude Opus 5.5 对明确指出你希望它避免的具体过早停止类型的指令反应良好,例如以宣布下一步的总结来结束回合,而不是去执行该步骤。明确指出你确实希望出现的停止也有帮助,例如当没有用户输入就无法推进任何工作时。
下面这段文字就是这样一个附加指令的示例,它是为完全无人值守运行的 agent 编写的,在这种场景下你希望模型持续工作,而不是停下来汇报。可以把它当作一个起点:你可能需要根据自己的应用进行调整。请把它添加到会话第一次请求时所用系统提示的末尾:中途添加会改变 system 提示,并使对话中此前的 thinking 块失效(参见 Preserved thinking)。由于它要求模型把状态说明与下一次工具调用放在同一条消息中,这些说明会作为进度更新出现在工具调用之间,而在默认的 thinking.display 下其文本返回为空;设置 display: "updates" 即可收到每条的摘要(参见 User-facing progress updates)。加上这段内容后,模型会在原本会停下来确认的地方继续推进,因此对于有风险或不可逆的操作,请保留你自己的确认步骤,并且不要在有人工介入的应用中加入这段内容,因为那里有人可以回应。预计每个任务的工具调用次数和输出 token 会略有增加。
安全防护拒绝
Claude Opus 5.5 会运行安全分类器,包括针对生物学、网络安全和推理提取的分类器。
- 生物学:生物学安全防护与 Claude Fable 5.1 相同;如果你是从 Claude Opus 5 升级而来,这些是新增的。日常健康和教育类问题不受影响。如果生物学分类器妨碍了你所在组织的生命科学工作,请申请 Life Sciences Verification Program。
- 网络安全:允许在源代码中查找漏洞。不允许高风险的军民两用网络安全活动。
- 推理提取:那些促使模型在响应文本中复现其内部推理的请求,可能会以
reasoning_extraction类别被拒绝;如果你是从 Claude Opus 5 升级而来,这是新增的。如果你的提示要求模型在响应中写出其推理过程,请移除这些指令,设置display: "summarized",改为从 thinking 块中读取摘要后的推理;参见 Prompts written for thinking disabled。
分类器拒绝会以正常响应的形式返回,带有 stop_reason: "refusal" 和一个指明该类别的 stop_details 对象。你可以让请求在回退模型上自动重试,但 reasoning_extraction 拒绝除外,服务端回退会将其直接返回给你,而不是重试;参见 Refusals and fallback。
面向用户的进度更新
在工具调用之间,Claude Opus 5.5 会写出简短的面向用户的进度更新:它刚刚发现了什么,以及接下来要做什么。有四个控制项决定你的用户能看到什么。
首先,确认你的客户端能接收到它们:在 Claude Opus 5.5 上,这些笔记会以 progress-update thinking 块的形式返回,而不是 text 块,并且在默认的 thinking.display 下其文本为空,因此只渲染 text 块的客户端在漫长的 agentic 回合中可能看起来毫无动静。设置 display: "updates"(beta,thinking-display-updates-2026-08-18 请求头)即可接收每条笔记的简短摘要;迁移指南展示了如何渲染它们。
其次,如果模型可能需要在漫长回合的中途逐字交给用户某些内容,例如一段代码片段,就给它一个用于向用户发送消息的简单工具,并告诉它该工具专用于此类内容。在会话的第一次请求中就把该工具声明在 tools 里:之后再将其加入 tools 会修改对话的前缀,并使先前的 thinking 块失效(参见 Preserved thinking)。
第三,如果你想要更频繁或更可预测的更新,例如在第一次工具调用前用一行说明意图、在结尾做简短回顾,就在系统提示中说明;模型对此类指令响应良好。这在 human-in-the-loop 工作中最有帮助。
第四,如果长时间的工具调用回合仍然安静得超出你的期望,就让你的 harness 主动请求更新。在设置了 display: "updates"(第一个杠杆)的情况下,统计连续多少个工具调用步骤没有给用户任何可读内容:既没有 text 块,也没有 progress-update 文本。连续出现若干次(例如五次)后,在最新的工具结果之后追加一条如下所示的提醒,作为 turn-scoped system message(clear_at: "next_user_message";beta,mid-conversation-system-clear-at-2026-08-21 请求头)。如果该回合仍然安静,在发送两到三条提醒后就停止,不要继续发送。由于每条提醒都是追加并保留在原位,而不是为某一次请求插入、在下一次请求时删除,提示缓存会持续匹配,其后的 thinking 块也保持有效。在 Anthropic 针对 agentic 编码任务的测试中,这大约将出现长时间静默的任务占比减半,且成本没有可测量的变化。
在多应用工作流中探索上下文
在跨多个已连接应用(如电子邮件、文档、电子表格和 CRM 记录)的工作流自动化中,任务所依赖的信息往往位于请求未明确提及的某处:例如,旧邮件线程中的一条政策、另一个电子表格标签页上的一条规则,或客户记录上的一条备注。Claude Opus 5.5 倾向于迅速开始工作,而在规格不明确的任务上,告诉模型在行动前先查阅相关来源会有所帮助。如果你的 agent 在这类任务中跨多个应用工作,在系统提示中加一句话就能让它在改动任何内容之前先四处查看:
在 Anthropic 对多应用自动化任务的测试中,Claude Opus 5.5 在 medium 和 max 两种 effort 设置下,凭借这条指令正确完成了明显更多的任务,代价是略微增加了工具调用次数和 token 消耗。因为它让模型根据发现的内容采取行动,所以要将不受信任的内容排除在它检索的记录之外。
多智能体框架的时间信号
Claude Opus 5.5 会密切关注有关已用时间的信息,在多智能体设置中,例如一个主导智能体向子智能体分派任务,你可以利用这一点通过更好的并行化来加快工作。如果你能估算任务应该花费多长时间,就给模型一个时间预算:让你的框架在每条发回给模型的消息末尾添加一行简短说明,给出相对于该预算的已用时间,以秒为单位,例如 elapsed 340s / 1200s。模型会调整自己的工作节奏以在预算内完成,而且通常远早于预算就完成,所以把预算设置得略高于你实际希望花费的时间,并在你自己的任务样本上进行调整。如果你无法预测一个合理的预算,就只显示已用时间,并在系统提示中添加一句话:
在 Anthropic 对小型智能体团队执行研究任务的评估中,这两个信号都让团队比没有这些信号的单个智能体更快完成。获得预算的团队在答案质量上与单个智能体相当,同时完成得快得多。更紧的预算与更低的 effort 设置效果不同:降低 effort 会减少工作本身,而预算主要是让更多智能体并行工作。预算是建议性的,在达到上限时并不会阻止模型,所以如果你需要硬性停止,请保留你自己的超时设置。同时也要在你自己的任务上检查答案质量,因为在时间压力下模型可能会减少一些搜索和验证。
聊天系统提示中的思考指令
在聊天应用中,如果你的系统提示包含告诉 Claude 在回答前仔细思考的指令,考虑为 Claude Opus 5.5 移除它们。模型会自行决定思考多少,而 effort 是主要的控制手段。在 Anthropic 于某聊天产品中的测试中,移除这样一行让回复更快开始,且回复质量没有明显下降。
在多轮聊天中,Claude Opus 5.5 有时会在思考新消息(即使是简短的后续消息)时重新审视先前的回答,这会在后续轮次中增加思考量和延迟。如果你希望模型将先前的回答视为已定论,请在系统提示末尾添加两句话:
在 Anthropic 的测试中,这减少了后续轮次的思考,让回复更快开始,且不影响质量。在你希望模型继续重新审视其先前工作的地方,例如在长分析中,或在后续步骤可能揭示先前步骤错误的智能体任务中,就不要使用它。这条指令还可能让模型更不容易主动指出先前回答中的错误,所以如果这对你的应用很重要,在采用该指令前先进行测试。
在用户消息中标记粘贴的文本
Claude Opus 5.5 对间接提示注入的抵御能力优于以往任何 Opus 模型,所谓间接提示注入,是指通过工具结果、网页以及屏幕或浏览器内容传入的指令。在具备恰当上下文的情况下,它也能稳健抵御用户从别处(如电子邮件或网页)复制到消息中的内容里所包含的指令。要获得这种行为,需要标记哪些文本是用户自己的,哪些是从别处粘贴来的。将每个粘贴的块用一对开标签和闭标签包裹,两个标签携带由你的应用生成的同一个简短随机 ID,且每个标签各占一行:
然后将此说明添加到你的系统提示中:
这有时会让模型略微更加谨慎,因此请在你自己的任务上衡量其影响。这些标签是纯文本,可以被模仿,所以请将其视为与其他 提示注入防御措施 并列的一道护栏。
用于复杂视觉输入的工具
由于 Claude Opus 5.5 在无工具情况下读取图表、示意图和截图的能力比 Claude Opus 5 精确得多(参见 与提示相关的能力改进),请重新测试你是否仍然需要为早期模型上的视觉输入所搭建的脚手架。对于最密集的输入,有两件事仍能提升准确性。更高分辨率的图像有帮助,对于技术图纸这类输入尤其如此。图像处理工具也有帮助:将模型作为智能体运行,使其能够访问一个存放原始图像并安装了 PIL 和 OpenCV 等库的容器,这样它就能裁剪、缩放、测量并验证自己的工作。如果容器开销太大,仅一个裁剪工具也仍有帮助;裁剪工具配方 提供了一个可用的定义。模型在更高的 effort 级别下能更有效地使用这些工具。在没有工具的情况下,提高 effort 能改善它对技术图纸的读取,但对图表几乎没什么帮助。
前端设计默认值
在没有设计方向的情况下被要求做前端工作时,Claude Opus 5.5 会退回到几种默认样式,而诸如“避免通用的 AI 风格”这样笼统的指令,大多只是把一种默认换成另一种。它对明确指出要避免哪些具体模式的指令响应良好,如下例所示。请迭代进行:检查第一个结果实际使用了哪些样式,并在需要时扩展该列表。
来源:Hacker News:AI 热帖 · platform.claude.com