跳到正文
SemiAnalysis 长文 RSS· Andrew Megalaa·· 2 小时前精选AI 评分71

SemiAnalysis 测算:Anthropic 订阅的 API 等价价值约为 OpenAI 的 5 倍以上

Anthropic Subscriptions Offer 5x+ More Value Than OpenAI

AI 导读

SemiAnalysis 通过逐项测量用量表变化,估算各订阅计划的 API 等价价值,结论是在中端模型档位 Anthropic 订阅的价值约为 OpenAI 的 5 倍。

推荐理由

原文给出了可复现的订阅额度测量方法和 OpenAI 与 Anthropic 各档位的具体价值对比,读者可据此选择更适合自己工作流的订阅方案。

正文 · AI 翻译

订阅计划仍然是消费者和小企业为 AI 付费的主要方式。这些计划获得了高额补贴——正如我们在 6 月所解释的那样——但作为强大的客户获取和营销工具,它们在经济上仍然说得通。例如,OpenAI 慷慨 重置所引发的善意,部分促成了近期 Codex 采用量的激增,并迫使 Anthropic 多次 收回 成命,放弃计划中的订阅削减,以免在舆论法庭上被击垮。

此外,由于订阅计划获得了如此高额的补贴,尽管它们只占总收入的一小部分,却也可能对利润率和每 MW 收入产生重大影响。考虑以下 Anthropic 的大致数字。

来源:SemiAnalysis Tokenomics Model

尽管订阅仅占整体收入的 10%,却可能占用超过 40% 的推理算力,并使混合每 MW 收入降低约 3600 万美元。订阅对 OpenAI 更为重要,因为它们在总收入中占比更大。具体数字请参见我们的 Tokenomics Model。

换句话说,如果你想准确建模 AI 实验室的财务状况,就需要理解它们的订阅限制。

那么限制究竟是如何运作的?可以把订阅理解为:你每月的付款赋予你一定数量的“积分”。每种(模型、token 类型)组合消耗的积分数不同。由于积分成本比可能与 API 价格比存在巨大差异,同一计划的价值会因你运行的模型和工作负载而变化。换句话说,孤立地说某个计划值 X 美元是没有意义的——你需要考虑完整的(计划、模型、工作负载)三元组。

以下是同一个每月 200 美元的 Claude 计划,其 API 等效价值如何随模型和工作负载而变化。

来源:SemiAnalysis Tokenomics Model

仅靠单一静态快照也不够。实验室会通过促销和新模型发布不断公开调整限制。它们还可以随时通过调整积分成本来悄悄改变限制。理想情况下,你应当每天重新检查每种(计划、模型、token 类型)的成本,以便实时发现任何变化。

这正是 SemiAnalysis 通过我们全新的 Subscriptions Dashboard 所做的事情,该仪表盘仅向 Tokenomics Model 订阅者开放。除了所有 OpenAI 和 Anthropic 订阅外,我们还追踪 Meta、SpaceXAI、Cursor、Cognition、Z.ai、MiniMax 和 Moonshot。

我们的仪表盘截图,仅展示可用数据的一小部分。来源:SemiAnalysis Tokenomics Model

新的提供商、计划和模型一经发布就会添加。本文其余部分将概述各家当前的限制。除非另有说明,下文所有 token 和美元金额均假设为智能体使用场景。

方法论

Token 通常按 MTok(百万 token)计价,涵盖以下类型:

  • 输入:添加到 LLM 上下文窗口且未被缓存的新鲜 token

  • 缓存写入:为多轮对话而缓存的输入 token。通常比普通输入 token 略贵。

  • 缓存读取:对话中已缓存的先前轮次 token。与未缓存 token 相比,通常极其便宜。

  • 输出:模型生成的 token。最昂贵的 token 类型。

此外,一些模型对超出特定上下文窗口的 token 收费更高。这些模型通常会在达到那个昂贵的上下文窗口之前进行压缩,因此我们也将测量值保持在其之下。

来源:OpenAI

订阅计划不会公开这种细粒度的定价。相反,它们提供一个简单的 0 到 100% 使用量计量器,覆盖 5 小时和 7 天窗口,有时还会为像 Fable 这样的模型提供单独的计量器。订阅层级则仅根据相对于提供商其他计划的使用量倍数来区分。例如,OpenAI 曾在其 20 美元的 Plus 计划中宣传“扩展的 Codex 使用量”,在 100 美元的 Pro 计划中宣传“比 Plus 多 5 倍使用量”,在 200 美元的 Pro 计划中宣传“多 20 倍使用量”,直到他们将 200 美元计划的使用量削减了一半,并从其定价页面中移除了所有相对使用量。

Claude Code 计量器截图。来源:Claude Code CLI

设置

我们通过运行实验来计算每个(计划、模型、token 类型)三元组的订阅费率,每次隔离一种 token 类型,并观察模型提供商的计量器移动了多少。一个实验是使用特定提示进行一定次数的重复调用,该提示最大化一种 token 类型,同时最小化所有其他类型。

来源:SemiAnalysis Tokenomics Model

输入、缓存写入和缓存读取共享相同的提示模板。我们使用《战争与和平》的一部分,因为一些模型在收到大量乱码时会拒绝响应。对于输入 token 实验,我们在每次调用时使用随机标签以确保没有任何内容被缓存。缓存写入实验以相同方式运行,但提示被标记为缓存,因此每个新标签都会强制生成新的缓存条目。缓存读取实验使用固定标签,因此第一次调用写入缓存,每次重复都读取它。

对于输出 token 实验,我们使用一篇技术文章来强制产生长输出,因为模型会拒绝像“重复 SemiAnalysis 100,000 次”这样的机械提示。

计算结果

对于每次调用,我们记录两件事:提供商计费的每种类型的 token 数量,以及使用量计量器的读数。将其转化为价格需要三个步骤。

1. 测量每种 token 类型的费率

提供商通常以固定增量移动的计量器报告使用量。这可能是一个完整的百分点、一个积分、一分钱等……单个请求通常根本不会移动计量器,因此无法直接测量一个请求的成本。

相反,我们按步测量。随着请求运行,我们持续累计使用的 token 总数。每次计量器上升时,我们存储该总数。两次计量器移动之间使用的 token 构成一步,即计量器移动一个单位的成本。

我们丢弃两个不完整的步骤。当运行开始时,计量器已经处于下一次移动的部分途中,因此第一次移动之前的 token 少于完整的一步,会使费率看起来比实际更高。最后一次移动之后的 token 永远不会完成一步,因此我们也丢弃它们。

为了得到费率,我们将完整步骤中计量器移动的总量相加,并除以这些步骤中使用的 token 数。提供商对输入、输出和缓存 token 的收费不同,因此我们为每种类型分别计算费率。

来源:SemiAnalysis Tokenomics Model

注意事项:

  • 因为我们每次请求只能看到一次计量表,所以单步的误差最多可能达到一次请求的量。这些误差不会随着连续步骤的增多而累积,因此我们追踪的是一个范围而非单一数值,而且我们统计的步骤越多,这个范围就越窄。我们不断累加步骤,直到范围落在 ±5% 以内,然后报告所有这些步骤的平均速率。

  • 没有任何一次请求只包含一种类型的 token。例如,有些套餐要求每次请求都附带一组指令。我们使用为其他类型测得的价格,把这部分额外用量扣除。

  • 在某些套餐中,从缓存读取几乎不产生费用,甚至可能完全不会让计量表走动。如果在 500M 缓存读取 token 之后计量表仍未走动,我们就假定缓存读取是免费的。

2. 将费率转换为每窗口和每月的 token 数

每次请求后,我们都会读取套餐显示的所有计量表。这可能包括一个 5 小时限额、一个每周限额,对于像 Fable 这样的模型,还有它自己的每周限额。因此,每种 token 类型在每个计量表上都有一个价格。这表示一百万 token 会消耗该限额的多少。根据每个价格,我们算出能容纳多少 token,例如,如果一百万 token 消耗了某个限额的 5%,那么整个限额可容纳 2000 万 token。

来源:SemiAnalysis Tokenomics Model

5 小时限额在一周内会重置多次,因此一个月的上限由每周限额决定。

3. 定价

最后,我们通过将每种类型的一百万 token 所消耗的限额百分比转换为美元金额,来计算 API 等效价值。例如,如果你消耗了某个 200 美元套餐月度限额的 1%,那就是 2 美元。

然后,我们假设一种工作负载形态,并根据这一比例计算每个套餐总共能提供多少 token。对于智能体工作负载,我们使用我们自己在 9 月的使用比例,如我们的 Tokenomics Model 中所报告的那样。

最后,我们乘以按 API 价格计算的每 MTok 混合价格,得到 API 等效价值。

来源:SemiAnalysis Tokenomics Model

发现提供商的 A/B 测试

在完善我们的方法时,我们遇到了一个非常令人困惑的情况:我们为某个提供商测试的 3 个相同订阅中,只有 1 个的限额比其他 2 个低约 20%。这个倒霉的账号恰好也明显更老,我们担心该提供商存在某种糟糕的设置,会根据账号年龄改变订阅限额。

幸运的是,在与该提供商联系后,我们得以确认情况并非如此,我们那个倒霉的账号只是他们正在进行的“极其微小”的限额 A/B 测试的一部分。此外,他们想强调,他们“并非只是全面降低限额”,而是在测试“如何更好地平衡人们触及限额的时机”。

这个结论之所以有趣,有两个原因:

  1. 它证明提供商可以在任何时候悄悄更改订阅限额

  2. 我们的方法足够灵敏,能够检测到这些细微变化!

OpenAI 与 Anthropic

AI 订阅领域最大的问题是 Anthropic 的限额与 OpenAI 相比如何。请注意,OpenAI 上周刚刚对其订阅做了一些重大调整,将 200 美元套餐的 API 等效价值减半,并推出了新的 500 美元档位。以下数字描述的是 OAI 与 ANT 的当前状态。之后,我们将深入审视 OpenAI 近期的变化。

来源:SemiAnalysis Tokenomics Model

GPT-6 Astra 与 Fable 5.1 的限额总体上相当接近,但请记住 Fable 只能使用你限额的 50%。换句话说,你的 200 美元 ANT 套餐在消耗价值 2,485 美元的 Fable 5.1 后仍会剩余 50%,而同等 OAI 套餐在消耗 2,897 美元的 Astra 后就会完全耗尽。

当我们比较 Opus 5.5 与 GPT 6.1 Sol 时,这额外的 50% 开始变得非常重要。

来源:SemiAnalysis Tokenomics Model

在这个中端模型层级——两家公司都将其宣传为大多数用户预期的日常主力——Anthropic 的性价比压倒性地更好,在所有方面都提供了约 5 倍的 API 等效价值。你可能会说这对 OAI 不公平,因为 6.1 Sol 每 token 比 Opus 5.5 便宜得多,但即使改为比较 token 数量,差距仍然巨大。

来源:SemiAnalysis Tokenomics Model

总体而言,我们认为 API 等效价值是衡量订阅套餐“价值”的最佳单一指标,但有时原始 token 量可能更合适。例如,如果某个模型在 API 价格下特别不划算(或特别划算),那么 API 等效价值当然会产生误导。

Token 效率也是一个极其相关的因素,但不幸的是,业界缺乏这方面的可靠数据。许多人喜欢引用 Artificial Analysis 的这张图表,但我们认为 AA Intelligence Index 中的基准任务完全不能代表人们使用 LLM 所做的实际工作。

OpenAI 新的 500 美元套餐与大幅限额削减

我们的追踪证实了 Tibo 宣布的 OpenAI 200 美元套餐 50% 的价值削减。在削减前购买的 200 美元套餐将保留旧的高限额直到 10 月 29 日,但新购买的套餐立即以较低的限额开始。

来源:SemiAnalysis Tokenomics Model

如你所见,OpenAI 专门将每个模型层级获得的 token 数量减半。这导致 Sol 级模型的 API 等效价值下降超过 50%,因为 OAI 还降低了 6.1 Sol 的缓存输入 token 价格。

新的 500 美元套餐仅比旧的 200 美元套餐多提供 21% 的 Astra。有趣的是,由于前述 6.1 Sol 降价,Sol 级模型的 API 等效价值实际上下降了。

来源:SemiAnalysis Tokenomics Model

当然,300 TPS Ultrafast 是 500 美元套餐真正的头条功能,我们目前正在测试其极限。结果一旦可用,将立即发布给 Tokenomics Model 订阅者。我们也在积极测试在 Devin 等第三方应用上使用你的 ChatGPT 订阅时的限额。

200 美元/月套餐过去也比 OpenAI 的其他订阅补贴力度大得多。如果我们将每个(套餐、模型)组合按 API 等效价值和每美元 token 数归一化,可以看到 Pro 100 在 Astra 上提供的每美元价值约为 Plus 的 2 倍,而 Pro 200 在所有模型上又在 Pro 100 的基础上再增加约 2 倍。

来源:SemiAnalysis Tokenomics Model

随着上周的削减,Pro 100、200 和 500 在每个模型上提供的每美元 token 数都相同。Plus 在 Sol 上也相当,但在 Astra 上提供的性价比相对较差。

另一方面,Anthropic 已经为其所有订阅层级提供了相同的每美元价值,并且目前碾压 OpenAI。

来源:SemiAnalysis Tokenomics Model

OpenAI 曾因相比 Anthropic 提供更慷慨的订阅限额而受到独立开发者的赞誉,但如今这已不再属实。任何 Claude 订阅上的 Opus 5.5 所提供的价值都远超 OpenAI 的任何产品。

OpenAI 唯一的反驳论据是,他们的 Pro 计划都没有 5 小时限制,这使得更容易消耗掉每月总限额中更高比例。然而,我们认为这并不能抵消 Claude 计划上 Opus 5.5 所提供的约 4 倍更高的 API 等效价值。

实验室会根据 API 定价变化调整订阅限额吗?

我们最近看到 Anthropic 和 OpenAI 模型出现了一系列大幅降价。

  • Fable 5.1 将缓存读取成本较 Fable 5 降低了 75%

  • Opus 5.5 将输入和输出 token 定价较 Opus 5 降低了 20%,缓存读取降低了 60%。

  • GPT 6.1 Sol 将缓存读取成本较 GPT 6 sol 降低了 50%。此前已将 GPT 6 Sol 较 5.6 Sol 便宜了 60-67%。

一个重要问题是,实验室在这些降价后是否会调整 token 限额,以使订阅的 API 等效价值保持不变。

我们此前已经展示,OpenAI 在发布 6.1 Sol 时并未改变 200 美元/月计划上的 Sol token 限额。这导致 API 等效价值下降了约 30%。

Anthropic 在发布 5.1 时也完全没有提高 Fable 的 token 限额,但他们确实在 5.5 降价时提高了 Opus 的 token 限额。

来源:SemiAnalysis Tokenomics Model

然而,Max 计划约 20% 的 token 增长和 Pro 计划约 50% 的增长,并不足以完全抵消 API 降价。

提高订阅利润率的两种不同方法

正如我们在本文开头所解释的,订阅毛利率远低于 API,并显著降低了 OpenAI 和 Anthropic 每兆瓦的收入。两家公司都清楚这一事实,但选择了两种不同的策略来减少订阅补贴。

对于给定计划,Anthropic 会降低更高端模型的 API 等效价值。Sonnet 5.5 与 Opus 5.5 之间的下降幅度很小,但在 Fable 5.1 上变得非常显著。

来源:SemiAnalysis Tokenomics Model

随着你以更高的标价发布更强大的模型,降低 API 等效价值是停止补贴订阅的更微妙方式。假设 100% 利用率和 92% 的 API 毛利率,用满 Opus 5.5 与 Fable 5.1 的使用量分别对应 -369% 和 1% 的毛利率。如果我们采用更现实的 20% 平均利用率,那么毛利率分别升至 6% 和 80%。

换句话说,如果所有人都只使用 Fable,Anthropic 的订阅计划很可能已经拥有类似软件的利润率。随着 Anthropic 找到如何让模型更小的方法,Opus 级模型的服务成本将随着时间的推移继续降低,而 Fable 之上的新模型层级将拥有更低的订阅限额(假设它们被包含在内的话)。

另一方面,OpenAI 选择了核选项,直接一刀切地将所有限额降至 Fable 级别。

来源:SemiAnalysis Tokenomics Model

这种做法的缺点本应是公众的强烈反对,但 OpenAI 不知何故或多或少地完全避免了这一点。这可能是所有 DevDay 的良好公关淹没了前一天负面新闻,以及对现有计划额外保留一个月的组合结果。

中国的订阅计划仍然很划算

尽管算力匮乏,中国实验室仍提供补贴订阅方案,但各模型之间的补贴力度差异巨大。

来源:SemiAnalysis Tokenomics Model

以下是按每美元归一化后,它们与 OpenAI 和 Anthropic 的对比。

来源:SemiAnalysis Tokenomics Model

从中国实验室购买更高档位的订阅,每美元价值随之增加。平均而言,每美元的 API 等效价值略低于 OpenAI 的约 12 倍。

第三方方案不如第一方

我们要考虑的最后一项对比,是 OpenAI 和 Anthropic 模型在其自家第一方方案上与 Cursor、Cognition(Devin)等第三方封装方案的比较。

阅读更多

来源:SemiAnalysis 长文 RSS · newsletter.semianalysis.com