谁在真正购买 SOTA 模型?OpenRouter 数据显示 84% 的 token 并非前沿模型

Tomer Tunguz 博客(VC 分析)·2026-08-14 08:00·40天前
AI 导读

OpenRouter 数据显示,84% 的 token 并非来自 SOTA 模型,用户选择的六款主力模型仅提供前沿约 77% 的性能,成本却仅为 Claude Fable 5 的 2.5%。这些模型混合价格约 $0.50/百万 token,而 Fable 5 为 $20。企业正转向更小、微调或开源模型,前沿模型的经济效益面临挑战。

Tomer Tunguz 博客(VC 分析)
精选
63AI 编辑部评分,满分 100

谁在真正购买 SOTA 模型?OpenRouter 数据显示 84% 的 token 并非前沿模型

2026-08-14 08:00· 40天前
AI 导读

OpenRouter 数据显示,84% 的 token 并非来自 SOTA 模型,用户选择的六款主力模型仅提供前沿约 77% 的性能,成本却仅为 Claude Fable 5 的 2.5%。这些模型混合价格约 $0.50/百万 token,而 Fable 5 为 $20。企业正转向更小、微调或开源模型,前沿模型的经济效益面临挑战。

推荐理由

作者用 OpenRouter 与 Ramp 数据说明多数流量流向性价比模型,为判断前沿模型商业化的可持续性提供了可参考的框架。

正文 · AI 翻译

最先进的模型比去年 11 月时聪明了三分之二。这种疯狂的改进速度仍在持续,每三天就有两个新模型问世。1

Monthly major-lab model releases since November 2025, averaging about 20 per month

但在 OpenRouter 上,84% 的 token 并非来自最先进的模型。2 3

Non state of the art token share on OpenRouter named top models held near 84 percent

事实上,用户选择用来生成其中绝大多数 token 的那六款模型,性能大约达到前沿模型的 77%。而它们的成本仅为 Claude Fable 5 的 2.5%。2

该指数持续攀升。大约每个季度都会出现三到五个 Artificial Analysis 分值的大幅提升。较小的进步则填补了其中的空隙。

Waterfall of the Artificial Analysis intelligence frontier climbing from 37 to 63 points on three large jumps with smaller steps in between

在 8 月 10 日那一周,六款模型承载了 80% 的用量。它们的混合价格为每百万 token 0.50 美元,而 Fable 5 为 20 美元。

OpenRouter top models at 77% of state of the art quality for one-fortieth the Fable price

Ramp 的数据显示,买家对价格敏感。Fable 5 约为每百万 token 10 美元,在发布一个月后占据了 Anthropic token 的 6% 以及 Anthropic 支出的 11%。GPT-5.6 Sol 是 OpenAI 最贵的主线档位,占据了 OpenAI token 的大约四分之一。4

7 月,Fable 5 产生的模型归属收入大约为 GPT-5.6 Sol 的 75%,尽管其价格要贵得多。

每一次新的 SOTA 发布,所抢占的市场份额都应少于前一次。

企业将整合支出。合同会集中在少数一两家供应商手中,就像云计算时代那样;而一旦某个模型在高价值任务上站稳脚跟,该工作负载就会一直留在那里。

在显著折扣之下,性能已经足够好了。差距正从下方不断缩小。到 5 月,最好的开放权重模型已达到前沿得分的 80%,而一年前这一数字为 48%。2

应用部署则是另一番景象。我们投资组合中的更多公司以及初创企业,默认选择更小的模型、微调模型以及开源方案。它们针对的是一条不同的帕累托前沿——价格优先于性能。

如果份额不再转移,而"足够好"始终足够好,那么 SOTA 的经济学就变了。一次九位数投入的训练运行必须赢得份额才能回本,而这一门槛会随时间推移而抬高。

这个标题有些轻率。很多人购买 SOTA,而且理由充分。软件工程架构与安全设计是最明显的例子,在这些场景中,能获得的最优模型值这个价。

但我们确实拥有的公开数据表明,真正重要的前沿是另一条。


  1. Artificial Analysis 模型目录与 Intelligence Index。主要实验室的月度发布数量与前沿路径。样本起始于 2025-11-01。发布频率趋势持平。大型(≥3 分)前沿跃迁之间的中位间隔约为 3.5 个月。Intelligence Index ↩︎

  2. State of the art 指某一周内可获得的单个最佳 Artificial Analysis 分数;当某模型的分数落在该周最佳具名模型分数的 10% 以内时,即视为接近前沿。将 OpenRouter 每周具名顶级模型与 Artificial Analysis 分数相连接,取的是 OpenRouter 轮播榜的头部,而非每一个 API。份额序列,2025-11-03 至 2026-05-25 各周(n=30),仅限具名模型,Others 已排除。前十三周与后十三周接近前沿的比例约为 17.5% 对 14.6%(约 82-85% 在前沿之外)。集中度快照,2026-08-10 当周,覆盖具名 token 前约 80% 的模型。按 token 加权的 Artificial Analysis 比全球目录的 state of the art 落后约 23%(约为前沿质量的 77%),比该 OpenRouter 榜单上的最佳模型落后约 10%。混合篮子约为 $0.50/m tokens,而 Fable 5 为 $20/m(约 40 倍)。2026 年 5 月的历史核查,比本地榜单领先者落后约 16%。最佳开放权重模型在前十三周达到前沿分数的 47.5%,在后十三周为 70.9%;单周最佳为 2026-05-25,DeepSeek V4 Pro 为 45.27,前沿为 56.31(80.4%)。OpenRouter rankings ↩︎ ↩︎ ↩︎

  3. 这些数据来源并未涵盖第一方云,即 OpenAI、Anthropic 与 Google 自家的服务。运行在原生 API 上的前沿流量从不会进入 OpenRouter 排名,因此数据存在偏差。↩︎

  4. Ramp Economics Lab,AI Index 2026 年 8 月(Fable 5 采用情况)。econlab.substack.com/p/ai-index-august-2026 ↩︎

来源:Tomer Tunguz 博客(VC 分析)· tomtunguz.com