跳到正文
原文
Anthropic:Claude.dev 开发者博客· Addy Osmani·· 6 天前精选AI 评分78

Opus 5.5 上一个任务要花多少钱:Claude Code 成本拆解

What a task costs on Opus 5.5

AI 导读

Anthropic 工程师 Addy Osmani 拆解 Opus 5.5 在 Claude Code 中完成任务的成本构成:turns、缓存读取、输出 token 和模型选择四个因素决定账单。Opus 5.5 输入输出价格比 Opus 5 降 20%,缓存读取降 60%,官方估算典型任务整体运行成本低 40%;文中还给出 effort 分级、缓存命中率维护、/usage 自查等省钱做法。

推荐理由

原文拆解了 Opus 5.5 上一个任务的账单构成,并给出 effort、缓存、压缩等可自查可迁移的成本优化方法。

正文 · AI 翻译

任务的成本,以及重试的成本

你并不是一开始就打算购买数百万个 token。你是为了构建一个功能、完成一次迁移或运行一个任务。token 数量只是模型为达成目标所需的量。

两个每 token 成本相同的模型,在同一个任务上的花费可能相差很大。一个只读一次代码。另一个读了代码,尝试修复,然后又读一遍。每一步都是一轮,而每一轮都会重新发送到目前为止的对话。因此,需要更多轮的模型成本更高,即使单价相同。

读完这篇文章,你应该能够回答关于自己工作的三个问题:

  • 我在 Opus 5.5 上执行典型任务要花多少钱?
  • 哪些设置会改变这个成本,改变多少?
  • 我如何查看自己的会话用量?

我想提前说明的权衡是:每一种减少 token 消耗的方法,都可能让你无法完成任务。降低 effort、使用更小的模型或减少上下文,当然都能节省 token。但一次重试的成本比这些节省更多。本文试图为每一种权衡标上价格。

这里的一些数字是标价,一些是基于标价构建的示例。这些数字是交互式的,你可以在阅读时更改输入。这些是尽力而为的示例,所以请务必查阅我们的文档并自行计算。

一个任务要花多少钱?

Claude Code 中的一个任务是一个循环。模型读取对话,调用工具,读取结果,然后再次循环,直到完成。每一次循环往返就是一次请求。有四件事决定了这个循环的成本。

轮次。每一轮都会重新发送到目前为止的对话。轮次越少,处理的输入就越少。

缓存读取。一轮中重新发送的大部分内容,是模型在上一轮已经看过的文本。它按缓存读取计费,价格只是输入价格的一小部分。

输出 token 类型。最昂贵的 token,价格是输入的五倍。思考按输出计费,因此推理更少的模型成本更低。

模型。每个模型都有自己的价格,列在定价页面上,因此你选择的模型决定了每个 token 的价格。

我们的示例使用 Opus 5.5 API 标价:每百万输入 token 4 美元,每百万输出 token 20 美元,每百万缓存读取 0.20 美元。与下面的计算器一样,示例将缓存输入按读取价格计费,其他所有内容按输入价格计费,并省略缓存写入。token 数量仅为示例。

轮次

假设一个任务开始时上下文为 20K token,随着模型读取文件和工具结果,增长到 120K。在 40 轮时,平均每轮发送约 70K token。这个任务大约处理 2.8M 输入 token,尽管对话从未超过 120K。如果 90% 从缓存读取,输入成本约为 1.62 美元。同样的任务在 25 轮内处理约 1.75M token,输入成本约为 1.02 美元。

一轮的成本高于它新增的 token,因为它会重新发送之前的所有内容。所以最便宜的一轮,就是你不需要的那一轮。

一个可以减少轮次的习惯,是给模型一种检查自己工作的方式。例如,一个可运行的测试、一次构建,或一个调用端点的脚本。能够检查自己工作的模型会更早发现自己的错误。

一个能一次性收集所需内容并批量调用工具的模型,重新发送的次数也更少。

缓存读取

如果没有任何缓存命中,同样的 280 万输入 token 需要花费 11.20 美元。在 90% 的命中率下,它们花费 1.62 美元,而在 96% 时约为 0.99 美元。没有其他设置能如此大幅度地影响输入成本。稳定的会话本身就能保持高命中率。我在本文后面会介绍一些避免破坏缓存的措施。

输出 token

在 Opus 5.5 上,一个输出 token 的成本是缓存读取的 100 倍。一个典型任务的 6 万输出 token 花费 1.20 美元,与从缓存中读取 600 万 token 相同。输出包含思考过程。即使 Claude Code 只向你显示摘要,你也要为全部内容付费。这就是为什么 effort(主要改变模型思考量)对账单影响如此之大。

模型

缓存读取更便宜的模型主要有利于长会话。输出更便宜的模型主要有利于需要大量推理的任务。

OPUS 5.5 的变化

有两处变化:价格,以及模型完成的工作量。

每一行价格都更低了。输入和输出 token 比 Opus 5 便宜 20%。缓存读取便宜 60%。输入价格下降,读取费率也随之下降,从输入价格的十分之一降至二十分之一。图 A 比较了两个模型每百万 token 的价格。这些是 API 标价。在 Pro、Max 或 Team 套餐中,Opus 5.5 更低的价格会传递到你的限额中,包括缓存上下文,因此它们比 Opus 5 多出约 25%。缓存读取的额外折扣是 API 价格变化。

另外,Pro、Max、Team 和基于席位的 Enterprise 套餐的五小时限额提高了,符合条件的订阅者会获得一次限额重置,可自行选择使用时机。你可以在网页版或 Claude Desktop 的“设置 > 用量”下找到它,而不是在终端中的 Claude Code 里。重置适用于你的整个账户,包括 Claude Code。

Bar chart of API list prices per million tokens, Opus 5 against Opus 5.5: input $5.00 and $4.00, output $25.00 and $20.00, cache reads $0.50 and $0.20, which is 20%, 20% and 60% lower.
图 A每百万 token 的 API 标价。

对于 API 密钥,缓存读取降价对 Claude Code 影响最大。长时间的智能体会话将大部分输入花费在缓存读取上。在下文图 B 中定价的会话里,缓存行从 1.00 美元降至 0.40 美元,是账单上降幅最大的一项。

节省多少取决于你的工作形态。一个主要是缓存读取的会话最多可节省 60% 的输入成本。一个没有缓存、答案很长的简短问题最多可节省 20%,因为输出占主导。大多数 Claude Code 任务介于两者之间。下面的计算器显示了你的任务处于什么位置。

你可能已经看到,Opus 5.5 的运行成本比 Opus 5 低 40%。这是我们对按 token 计费的典型工作负载、在默认设置下的估计。它假设 Opus 5.5 在其默认的中等设置下每个任务使用更少的 token,再加上更低的价格,所以这并不是 token 价格降低了 40%。token 价格就是图 A 中的那些,图 B 显示了价格变化本身带来的影响。

Opus 5.5 在回答时可能使用更多 token,因为它总是在回复前进行思考。我们预计人们能在 Opus 5.5 上完成更多工作,但这因任务而异,所以请在你自己的工作上衡量。图 C 比较了两个模型每个任务的成本。这部分更多地取决于你的工作,而不是价格。

在一个范围明确的任务上,两个模型完成的轮数大致相同,你得到的就是价格下降。差距应该在开放式任务上最大,因为模型可能会在错误的想法上花费很多轮。没有一个数字适用于所有代码库,所以要实际衡量(见最后一节)。

长时间运行会以报告收尾。 Opus 5.5 会在长时间运行结束时给出它改动了什么、发现了什么,以及需要你提供什么。这也能省钱,因为当你能看到发生了什么时,你重新运行会话的频率就会降低。

相同任务并排对比

图 B 以相同的 token 数量为两个模型的一次会话定价。因此差异仅来自价格变化,别无其他。切换模型即可对比。token 数量仅为示意。

$3.50按 Opus 5 API 标价

  • 缓存读取 2.0M$1.00
  • 全新输入 200K$1.00
  • 输出 60K$1.50
  • 总计,Opus 5$3.50
图 B示意性会话,两个模型使用相同的 token,因此这仅反映价格变化。

这张账单包含 /usage 为一次会话显示的三行。按 token 计,缓存读取是最大的一行,为 2M。输出按 token 计最小,但按成本计最大。全新输入介于两者之间。它涵盖每个文件的首次读取以及每个新的工具结果。

图 B 为两个模型设定相同的 token 数量,因此它仅反映价格变化。你自己的会话在 Opus 5.5 上可能使用更多或更少的 token。按此定价,该会话成本约降低 31%。

一次有记录的运行还会叠加第二个效应,即模型工作量多少的变化。在带有一次错误起步的任务上,差距应该会拉大。

试试你自己的数字

设定你的某个任务的使用量,或从预设开始。这些预设相当具有示意性,但我仍然建议你自己算一算。缓存输入按缓存读取价格计费,全新输入按输入价格计费,因此缓存滑块显示了差距中有多少来自缓存读取。

要用真实会话填充滑块,请在任务结束时运行 /usage。Session 块会给出输入、输出和缓存数据。最后一个滑块是你对 Opus 5.5 在你的任务上少做多少工作的假设。仅考虑价格变化时,将其保留为 0%。要根据你自己的工作情况来设定,方法如下:在 Opus 5 和 Opus 5.5 上运行同一任务,并比较轮次和输出 token。Measure it yourself 会逐步讲解,Reading a session 则展示在 /usage 中应检查什么。

2.2M

所有轮次中发送给模型的内容,无论是否缓存。

91%

60K

包含思考,思考按输出计费。

10

0%

仅考虑价格时保留为 0%。Opus 5.5 可能比 Opus 5 使用更多或更少的 token,因此请在你自己的任务上测量。

Opus 5,这些 token$3.50每月 $770

Opus 5.5,这些 token$2.40每月 $528

按 API 标价的变化−31%仅因价格,每月少 $242

Opus 5,这些 token:$3.50。Opus 5.5,这些 token:$2.40。按 API 标价的变化:−31%,仅因价格,每月少 $242。

图 C一个月按 22 个工作日计。API 标价。在 Pro、Max 或 Team 套餐上,这不是账单。不含批量或用量折扣,且未计入缓存写入(见 缓存)。

最大化会话价值的技巧

Opus 5.5 更低的价格让每个 token 成本更低。你如何运行会话决定了你使用多少 token,以下步骤会有所帮助。

在更换模型之前先提高 effort

Effort 为模型每轮消耗多少 token 设定了一个总体倾向:包括它的思考、它写出的文本以及它的工具调用。在较低的 effort 下,它进行的工具调用更少,且调用更简短。Opus 5.5 有四个级别(low、medium、high 和 xhigh),外加用于单次会话的 max。在下方选择一个级别,了解何时使用它以及设置它的命令。

Medium:适用于范围明确的日常工作

范围明确的日常工作。它每轮的思考量少于 high,因此每轮成本更低。

当任务范围明确时,从这里开始。

  • /effort medium
  • /effort status
  • /model
  • /usage
图 D级别从每轮最少思考到最多思考排列。

Claude Code 会为每个模型设置一个默认级别,/effort status 会显示你的级别。对于范围明确的日常工作,试试 medium。当 medium 卡住时,试试 high。它每轮的花费比 medium 多,但比换用更大的模型少。对于机械性工作,比如重命名或在多个文件中应用已知模式,使用 low。

在 Opus 5.5 上,默认是 medium,比 Opus 5 的默认级别 high 低一级。级别在每个模型上并不代表相同数量的思考。在给定级别下,Opus 5.5 每轮的思考量多于 Opus 5,在 xhigh 和 max 时最为明显。所以不要沿用你为 Opus 5 选择的级别。从 medium 开始,把 xhigh 和 max 留给那些你已测量到收益的工作。

一个粗略理解 effort 定价的方法:假设 high 在一个任务中增加了 20K 思考 token。在 Opus 5.5 上那是 $0.40。一个十轮的 retry 循环,带有 100K 缓存上下文,总共 10K 输出 token,成本大致相同。所以 high 在一个能省下一次 retry 的任务上就能回本。而在一个 medium 本可以一次完成的任务上,它就是浪费。

当 medium 只修复了一层时

你需要更多 effort 的最明显迹象是:修复只停留在一层。

假设一个字段在 API handler 中被重命名。在 medium 下,模型更新了 handler,handler 的测试通过了,而客户端仍然发送旧字段。它做了被要求做的事。它只是没有读得足够远,去找到第二个调用方。在 high 下,它在写入之前花更多轮阅读调用点,并在一次处理中修改两层。

检查也能捕获同样的 bug。如果模型能运行一个经过客户端的测试,那么在 medium 下,旧字段在它被写入的那一轮就会使该测试失败。所以在提高 effort 之前,先检查模型是否有办法检查自己的工作。一次测试运行花费一轮及其输出。更多 effort 会给每一轮都增加思考。

如果升级 effort 级别和添加检查都不起作用,那就换用更大的模型。

在会话中途更改 effort

在 Claude Code 中,运行 /effort 并带上一个级别,例如 /effort high。/effort status 会打印当前级别。你可以在任务中途更改它,新级别会应用于下一个请求。

在带有 API key 或 Claude 订阅的 Opus 5.5 上,更改 effort 会保留缓存。你可以为一个困难步骤提高它,然后再降低,而无需重写对话。在 Amazon Bedrock、Google Cloud 的 Agent Platform 或 Claude apps gateway 上,更改 effort 仍会清除缓存的对话,下一个请求要为全部内容支付缓存写入价格。Opus 5.5 的思考始终开启,所以没有可更改的思考设置。

为你的工作选择合适的模型

模型选择决定了一次会话中每个 token 的价格,所以它对账单的影响比 effort 更大。它的影响范围也更广。每个继承主模型的子代理也会继承它的价格。大多数日子需要三种模型:一个小的用于查找,Opus 5.5 用于你密切监督的工作,一个更大的用于最难的任务。

Three models in order of cost, with bars that show order of cost only: Haiku or Sonnet for lookups and subagents, Opus 5.5 as the daily driver, and Fable 5.1 for the hardest work, each with the kinds of work it suits.

将 Opus 5.5 作为日常主力

用 Opus 5.5 处理你监督的工作:跨几个文件的功能开发、调试,以及带后续修改的代码审查。你会阅读它的操作,并在它跑偏时介入,所以循环保持得很短。

升级到 Fable 5.1

当结果比 token 价格更重要时,升级到 Fable 5.1。例如你不会监督的长时间运行、代码库中没有现成模式的问题,以及需要协调许多子代理的大型变更。不要等到第三次失败。如果 Opus 5.5 在 xhigh 下两次遇到同一个问题,就切换,问题解决后再切回来。对于交互式工作,Opus 5.5 更合适,因为它延迟更低、成本更少。

Fable 5.1 的标价是每百万输入 token 10 美元、每百万输出 token 50 美元,是 Opus 5.5 价格的 2.5 倍。它的缓存读取费用为每百万 0.25 美元,仅为 Opus 5.5 费率的 1.25 倍,因为其计费为输入价格的 0.025 倍。因此,差距在长时间、缓存密集的运行中最小,在写入量大的任务中最大。

在自然的断点处切换。缓存属于前一个模型,所以预期在新模型上的第一轮要为整个对话支付写入价格。先运行 /compact,或者用一个简短的书面计划开启新会话,让那一轮更小。运行 /model 并带上别名或模型名称来切换。/model 还会把你的选择保存为新会话的默认值,所以困难部分完成后就切回来。

为查找而向下切换

为查找而向下切换到 Sonnet 或 Haiku,而不是用于编写代码:搜索和总结的子代理、读取日志和测试输出,以及“这个定义在哪里”的问题。对于跨多个文件的机械式编辑,保留 Opus 5.5 并将 effort 设为 low。编辑仍由编写你其余代码的模型完成,每轮成本更低。

要把子代理放到更小的模型上,在其定义中设置 model: haiku 或 model: sonnet。要把每个子代理都放到同一个模型上,设置 CLAUDE_CODE_SUBAGENT_MODEL 环境变量。子代理定义中指定的模型会覆盖该变量。没有模型设置的子代理会运行在你的主模型上,除非设置了该变量。

每个子代理在自己的上下文窗口中运行并返回摘要,所以它的文件读取不会进入你的主对话。它仍然要为自己的 token 付费,所以模型设置决定了这笔花费的成本。

Agent teams 是一项实验性功能,会放大这一点。每个队友都是一个独立的 Claude Code 实例,拥有自己的上下文窗口,并且在退出前会持续使用 token。我们的成本文档指出,当队友以 plan 模式运行时,一个团队大约是一个标准会话 token 量的七倍。保持团队规模小,让每个任务自包含,并在队友的部分完成后将其关闭。

权衡之处在于:一个小模型如果误读搜索结果,会让主模型去找错误的文件,而主模型要为这段弯路付出代价。让小模型处理错误容易发现的工作,比如查找文件、运行测试和读取日志。

把判断性工作留给主模型。opusplan 别名以另一种方式拆分工作:Opus 在计划模式下做规划,Sonnet 执行计划。这会把代码编辑交给 Sonnet,与上面的建议相反。在将其设为默认之前,先在你自己的任务上衡量一下。

迁移时检查你的提示词

为旧模型编写的指令可能会让 Opus 5.5 写更多内容并重复调用工具。在 Claude Code 中运行 /claude-api prompt-audit,检查你的 Claude Code 设置(例如你的 skills 和 CLAUDE.md 文件)是否存在这些提示词反模式。它还会检查你在 Claude Platform 上构建的应用的代码。

我们在一次从 Opus 4.8 到 Opus 5.5 的迁移中测试了这一点,使用了一个内部客户支持基准测试,包含 44 个工单,其提示词中存在若干此类模式。迁移到 Opus 5.5 并在低 effort 下运行,将该基准测试的成本降低了约 18%。运行 prompt-audit 又将其进一步降低了 9%,降至比 Opus 4.8 起点低约 25%。该审计移除了那些让模型写更多内容并重复调用工具的仪式性指令:一个强制性的六步流程、一条草稿纸规则、一条验证两次规则,以及相互矛盾的指令。

该结果来自一个基准测试,因此请将其视为示例,而非可预期的数字。运行审计,然后在真实任务上比较运行前后的 /usage(参见自行衡量)。

缓存与压缩

Claude Code 会为你处理缓存和压缩。你如何运行会话决定了它们能节省多少。

缓存如何工作

Claude Code 会缓存请求中重复的部分,例如系统提示词、工具定义以及到目前为止的对话。

在 Opus 5.5 上,一次缓存读取的成本是全新输入 token 的 5%。写入缓存的成本高于全新读取,按当前定价,五分钟缓存为输入价格的 1.25 倍,一小时缓存为输入价格的两倍。每次命中都会免费重置生命周期。

在 Claude Code 中,生命周期取决于你的付费方式。使用 Claude 订阅时为一小时。使用 API 密钥或云提供商时默认五分钟,而订阅一旦开始消耗用量额度,也会降为五分钟。

在 120K token 上下文下,Opus 5.5 上一次五分钟写入的成本约为 $0.60,一次读取约为 $0.02。一次写入的成本相当于 25 次读取。使用 API 密钥时,一次六分钟的咖啡休息会把下一次 $0.02 的读取变成 $0.60 的写入。同样规模下一小时写入的成本约为 $0.96,在 API 上你可以支付这一溢价来覆盖一天中的空档。

会话形态与命中率

缓存存储的是前缀,因此它只能复用请求中与上一次请求从头开始匹配的部分。

稳定的会话会在每一轮向对话末尾追加内容,并保持高命中率。任何改变请求较早部分的操作都会降低命中率。更改工具定义会清空整个缓存,而更改系统提示词会从该点起清空缓存,这几乎就是全部内容。

在实践中,以下情况预计会发生缓存写入:

  • 你暂停的时间超过缓存生命周期;
  • 你在 Amazon Bedrock、Google Cloud 的 Agent Platform 或网关上更改 effort,因为该级别是缓存匹配内容的一部分;
  • 你在一次对话中首次开启快速模式,这会改变缓存匹配的部分内容;
  • 你连接或断开 MCP 服务器,这可能改变每次请求开始时加载的内容;
  • 你切换模型,因为新模型从空缓存开始;以及
  • 对话被压缩,这会重写缓存所匹配的历史记录。

所以在会话开始时设置好这些,然后在它工作期间不要动它们。

为什么长会话每轮成本更高

每一轮都会重新发送整个上下文,所以随着上下文增长,一轮的成本也会增加,即使缓存是热的。在 Opus 5.5 上,上下文为 20K token 时,一轮的缓存读取成本约为 $0.004。达到 150K 时约为 $0.03,而在这个规模下 30 轮仅读取就要花费 $0.90。同样的 30 轮在 20K 时约花费 $0.12。在 Claude 4.6 及之后的模型上,更大的上下文窗口不会改变每 token 的价格,所以成本完全来自重新发送对话。

其中大部分上下文是早期工作遗留下来的:一小时前的堆栈跟踪、你已经处理完的文件、你已经修复的测试运行输出。每一轮仍然会发送所有这些内容。

压缩、/compact 和 /clear

当会话接近其上下文限制时,Claude Code 会总结较早的历史记录,以便后续轮次发送更少内容。运行 /autocompact 并带上一个 token 数,可以更改在此之前上下文达到多满时触发。

有两个命令可以让你自己来做这件事。/clear 会清空对话且不产生费用,所以当你转向无关工作时使用它。/compact 保持连续性,并产生一次请求费用。它会读取它所总结的对话,你可以说明要保留什么,例如 /compact keep the failing test names and the schema change。

在 150K token 时进行压缩的大致价格约为 $0.25。这包括读取、几千个输出 token 的摘要,以及在更短上下文上的一次新的缓存写入。之后每一轮在读取上大约节省 $0.025,所以压缩大约在十轮内就能收回成本。在你即将结束前进行压缩,花费会超过节省。

这个价格假设缓存是热的。当缓存是热的时,摘要请求会从缓存中读取对话,所以要在休息前压缩,而不是休息后。如果休息时间超过缓存生命周期,同样的 /compact 会再次读取整个对话并将其写回缓存。在 150K token、五分钟缓存的情况下,仅输入就约为 $0.75。如果你已经走上了一条想放弃的路径,请改用 /rewind 回到较早的一轮。当缓存是热的时,这会返回到一个已经缓存的前缀。

摘要也会丢失细节。在调试会话中途进行压缩,可能会丢掉那行关键的日志。要在自然的断点处压缩,并且当下一步依赖某些具体内容时,在 /compact 指令中说明。

在你输入之前加载的内容

你的 CLAUDE.md 文件会在每个会话开始时加载到上下文中,所以其中的每一行都是每一轮重新发送内容的一部分。成本文档建议将其保持在 200 行以内。MCP 工具定义是延迟加载的。开始时只加载工具名称和服务器指令,完整定义会在其工具被使用时加载。运行 /mcp 查看哪些服务器已连接,并关闭你不使用的那些。

账单的其余部分

下表列出了影响 Claude Code 会话的其他计费规则,并在有文档的地方附上链接。

快速模式运行 Opus 5.5 最高可快 2.5 倍,价格为标准价格的两倍:每百万输入 token $8,每百万输出 token $40。在 Claude 订阅上,它从使用额度中计费,而不是你的套餐限制。开启它后的第一个请求会按快速模式输入价格对整段对话计费,且不使用缓存。所以要在会话开始时开启它,而不是在会话进行到很深时。

账单计算什么它如何工作
缓存生命周期在 Claude Code 中,订阅版为一小时;API 密钥或云提供商为五分钟,或者订阅版开始消耗使用额度时。每次命中都会重置生命周期。API 提供一小时缓存,写入价格更高。成本文档(Claude Code 生命周期)和提示缓存文档
缓存写入按当前 API 定价,五分钟缓存为输入价格的 1.25 倍,一小时缓存为 2 倍。定价文档
思考按输出 token 计费,包括未返回给你的思考内容。扩展思考文档
努力程度适用于每一个输出 token:文本、工具调用和思考。努力程度文档
自动压缩在上下文窗口接近上限时运行。/autocompact 加上 token 数量可设置阈值。上下文窗口文档
子代理和代理团队子代理在自己的上下文窗口中工作并返回摘要。计划模式下的代理团队使用的 token 约为标准会话的 7 倍。上下文窗口和成本文档
批处理 API通过 Message Batches API 发送的请求,输入和输出 token 半价。批处理文档
当前典型支出平均值:在企业部署中,每位开发者每个活跃日约 13 美元。对于 90% 的用户,成本保持在每个活跃日 30 美元以下。这两个数字均针对当前模型。公开文档,成本页面(企业平均值和 90% 上限)

自己测量

本文中的数字仅为示例。你的代码库、提示和习惯各不相同,因此请在你自己的任务上测量成本。以下是检查方法。

  1. 在会话中,运行 /usage。/cost 的作用相同。Session 块显示 token 使用量和按标价估算的美元成本。提示缓存行显示有多少输入来自缓存。在 Pro、Max、Team 或 Enterprise 计划中,同一屏幕会显示你的计划使用量条。美元数字是在你的机器上按标价计算的,因此在订阅版上,它只是你做了多少工作的参考,而不是账单。
  2. 将同一任务运行两次。Opus 5.5 需要 Claude Code v2.1.280 或更高版本,因此请先运行 claude update。从你的待办事项中选一个,而不是玩具示例。使用 /model 在 Opus 5 和 Opus 5.5 之间切换。记录每次运行的轮次、输出 token 和成本。做三到四个任务后再下结论。
  3. 对于团队,使用使用量和成本报告。Claude Code Analytics API 提供每位用户的估算成本。Usage and Cost API 按模型以及缓存与未缓存 token 细分支出。
  4. 尝试努力程度阶梯。将一个困难任务分别在 medium 和 high 下运行。将一个机械性任务在 low 下运行。

解读会话

在任务结束时,在 /usage 中检查三件事。

  • 缓存占比。对于长会话,它应该很高。如果很低,请查找长时间暂停、模型切换、中途连接的 MCP 服务器,或者在云提供商或网关上,努力程度的变化。提示缓存行通常会指出最近一次未命中的可能原因。
  • 输出与输入之比。小改动却产生大量输出,通常意味着努力程度对该任务来说过高,或者模型在重试。
  • 总输入与对话规模之比。如果总输入是对话规模的许多倍,说明会话经历了很多轮次,值得阅读对话以找出循环重复的地方。

作为基准,Claude Code 的成本文档给出了企业部署的平均值:每位开发者每个活跃日约 13 美元,而 90% 的用户每个活跃日低于 30 美元。如果某次会话的成本远高于你自己的正常水平,那就值得回顾一下。

请记住

  • 对于范围明确的日常工作,使用中等努力程度。
  • 给模型一种检查其工作的方式,并在计划模式下开始跨文件的更改。
  • 当中等努力程度停滞时,将努力程度提高到高。使用 API 密钥或订阅时,这一更改会保留你的缓存。在云服务提供商或网关上,请在休息时更改。
  • 如果 xhigh 两次遇到同一问题,请切换到 Fable 5.1。问题解决后再切换回来。
  • 将搜索和日志读取子代理放在 Sonnet 或 Haiku 上。将代码编辑保留在 Opus 5.5 上。
  • 让长时间会话持续进行,以保持其缓存处于热状态。
  • 在不相关的任务之间使用 /clear,并在休息时使用 /compact,同时注明要保留的内容。
  • 最重要的一点:在每个模型上运行一个真实任务,并比较 /usage 报告的内容。你自己的数据才是值得信赖的。

希望这篇文章对你有帮助。如果你的限制在 Opus 5.5 上并不比在 Opus 5 上更宽松,请通过 /feedback 告诉我们。

延伸阅读:有效管理成本 · 模型配置 · 在 Claude Code 中选择 Claude 模型和努力程度 · 努力程度 · 提示缓存 · 最大化你的 Claude Code 会话价值

感谢 Michael Segner、Kacie Jenkins 和 Molly Vorwerck 的审阅。

来源:Anthropic:Claude.dev 开发者博客 · claude.dev