# OpenRouter：企业应转向多模型路由，放弃单一LLM供应商

- 来源：OpenRouter：Announcements（RSS）
- 发布时间：2026-06-12 00:00
- AIHOT 分数：55
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmqfi96pa008nslq8e9em1ir6
- 原文链接：https://openrouter.ai/blog/announcements/dinner-is-served

## 精选理由

OpenRouter 放出的多模型使用数据很实在，成本压力正推动企业从专一走向多模型路由，新分析 API 让这个趋势可度量。

## AI 摘要

OpenRouter指出，企业不应只依赖一家LLM供应商，而应采用多模型路由策略以平衡成本与效果。Anthropic Opus 4.7的“tokenizer税”导致输入token增加35%，新模型Fable定价$10/M输入、$50/M输出，OpenAI GPT-5.5 Pro更高达$30/M输入、$180/M输出。用户正主动跨模型族分配任务，平台3月至4月新增90个模型。OpenRouter作为统一市场，通过标准化API消除切换成本，使路由成为“一等公民”。

## 正文

选择权的价值

路由是一等公民

Semper ad meliora（永远追求更好）

几周前，我和团队在旧金山参加一个会议。我们原本计划在一家相当普通的美国餐厅吃晚饭，但我另有想法，迅速临时变卦，订到了一家寿司店的位置。临时改变计划并不理想，但守了一整天会议展位之后吃一顿平庸的晚餐同样不理想。再说，谁不喜欢寿司呢？

过去 10 年里，我和妻子每逢庆祝都会去吃寿司 omakase（主厨定制）。我不用看菜单就了如指掌。大多数没有经验的寿司爱好者会直奔 O-toro（大腹），但其实还有很多更好的选择。于是我很自然地告诉大家，这一桌由我来点菜。我和朋友、家人以及同事吃饭时一直这么做。100% 的情况下，大家都愿意在这种特定场景下把点菜的自主权交给我，安心享用一顿饭。

对于如何共享一餐，我有一个非常坚定的观点：一定要家庭式共餐，每次都是。

选择权的价值

但为什么？一方面，这降低了单独点餐的风险——你点的夏威夷肋眼牛排可能难吃得很。另一方面，它也会放大"天哪，那口鱼子酱和牛是我今年吃过最棒的一口"这种记忆。这样的时刻会留在我们心里。我总是说，第一次来就把每样都尝一尝，之后随时可以再多点。但前提是我们按家庭分享式来吃，这招才管用。

只用一个 LLM，就等于每人都各点各的主菜。你可能是在为稳妥的选择做优化，而不是为最佳结果。我聊过数百家企业，它们开启 AI 之旅时都是先选定一家供应商，比如 OpenAI、Anthropic 或 Gemini。当你在单一供应商上标准化时，你是在基于今天所知道的、今天所需要的东西下注。

这是老生常谈的"没人会因为采购和实施 Salesforce 而被开除"，只不过这种情况正在改变。等我接触到这些公司时，它们已经准备好"毕业"了——不再只用一个模型家族和一种模态。新的用例每天都在涌现。通常看起来是这样的：

从 OpenAI 企业版起步，把许可证部署给少数几个精选团队。

监控初始那批用户的使用情况，数据呈现出持续上升的趋势。

向更多团队开放使用权限。

图像生成、转录和创意写作等新用例开始出现。

发现 OpenAI 并没有最适合你需求的模型，你需要 Gemini。

去 Gemini 或其他任何提供商那里开通访问权限，而如今可观测性、治理和资源开通功能都被打断了。

我今天观察到的当前模式看起来像是成本压力，但实际情况比这更深。公司们[已经烧光了年度预算，而现在才六月。大家都有强烈的削减 token 用量的意愿，我理解。如果你不小心用上了 Opus 4.8，可能会把每日预算跑光，然后你就没有其他选择了。合上电脑，出去散散步吧。

虽然 Opus 4.7 的标价没有变化，但好几个人写到了“tokenizer 税”。这是 Anthropic 做的一次悄然调整，输入 token 数量增加了将近 35%。这是一个意义重大变化。更新的、能力更强的模型价格也在上涨。

Anthropic 发布的 Fable 定价为每 M 输入 token $10、每 M 输出 token $50。还有更高的：OpenAI 的 GPT-5.5 Pro 达到每 M 输入 token $30、每 M 输出 token $180。

使用时请谨慎！

成本压力是一种强制机制，可能带来更好的结果，也可能带来更糟的结果。从我的角度来看，我乐观地认为它正在带来一些更好的结果。我也很幸运能够促成这些结果。在我从事数据基础设施工作时，这是一个常见的话题。太多对话都围绕着计算成本以及团队在数据仓库上花了多少钱。但这过于关注[显性成本，而忽视了[隐性成本。最有战略眼光的领导者会彻底扭转这种对话。我经常听到：“我每年已经在计算成本上花了 100 万美元，所以我不在乎把它降低 30%。相反，更有价值的是，我那支每年花费 700 万美元的 40 人分析师团队能否提高生产力。在开发者工具方面，我既需要速度，[也需要效率。”

路由是一等公民

在深入探讨下一节之前，先简单说明一下 OpenRouter 到底是什么。OpenRouter 是访问 AI 的标杆性市场。我们让推理即插即用。我们消除了围绕选择提供商、选择模型以及理解各种指标的所有开销：延迟、价格、TPS、模型基准测试等等。

现在，你可以通过 OpenRouter 以干净、标准化的 API 规范在一个地方访问数百个大语言模型。这的存在是多么不可思议？这一切听起来很美好，简直像鱼与熊掌可以兼得，但现实中人们实际在做什么呢？

幸运的是，我能够围绕这一点拉取一些数据。而且时机也恰到好处——就在今天，团队发布了我们的[分析 API！

多模型采用一直是我们持有的一个假设，但我们可以清楚地看到与这一趋势相伴的增长曲线。这合理且在预期之内，但它掩盖了一个事实：大多数人可能只是在尝试每个模型的最新版本。例如，Anthropic 在图表时间线内就相继发布了 Opus 4.6、Opus 4.7 和 Opus 4.8。所以更有意思的问题应该是用户如何跨模型族进行采用。

现在，我们可以捕捉到用户主动将推理分散到多个模型族的真实增长。这描绘了一幅更接近真实的图景，展示了“持续进阶”到底是什么样子。让我们再叠加一个关于模型发布的数据点。

由于发布时间表并不总是规律，这是一张累计图表。但我们可以看到一个显著异常点：3 月到 4 月期间共有 90 个新模型发布。这规模巨大！可选的模型越来越多，而且速度还在不断加快。

这也可能让人有些压力。就像去一家餐厅，菜单上有 225 道菜（那是我最喜欢的餐厅之一）。就算是家庭式共享用餐，你也不可能全部尝一遍。我们显然考虑到了这一点，不希望我们的用户必须了解每个模型之间的区别。因此我们构建了 auto-router 和 pareto-router 等功能，让选择使用哪个模型变得更容易。

这一切都与我之前提到的成本压力息息相关。各公司其实正在以一种有趣的方式使用 OpenRouter。他们能够让每 token 的平均加权成本[随时间逐步降低。这是如何实现的？如果你根据所需的结果，把特定工作负载路由到特定的模型提供商和模型，那么你就可以利用像 Deepseek v4 flash 这样的模型，其输入成本仅约 $0.10/M tokens，输出约 $0.20/M tokens。

再进一步，使用像 Cerebras 这样拥有顶级吞吐量的模型提供商，你就成了像 Bradley Cooper 那样的指挥家，只不过繁重的工作由我们来替你完成。

或者，你可以把一部分流量路由到 Gemini 模型的[flex 优先级层级，以享受五折优惠。再次强调，选择权在你手中。

我们还有一些围绕模型智能的精彩内容即将分享。总的来说，主题始终不变：我们让推理即插即用。

Semper ad meliora（永远追求更好）

感觉推动 AI 采用的顺风正在转向 AI 优化。我们明白，花在 AI 推理上的资金不会以任何有意义的幅度减少，那么次优的选择是什么？那就是降低每个 token 的加权平均成本。各组织正在变得更有意识地推动使用在团队间的普及，同时降低治理方面的风险。而这一切只有在你不被单一供应商锁定时才真正可能实现。当你选择针对不同用例使用不同模型时，你在每一步都能获得议价筹码。你终于可以坐在餐桌旁，随心所欲地享用家庭式共享晚餐了。
