跳到正文
原文
Fireworks AI(网页)·· 1 天前精选AI 评分62

Fireworks AI 推出 FireRouter with Opus,编码任务成本降 57%

Introducing FireRouter with Opus

AI 导读

Fireworks AI 发布 FireRouter with Opus,可在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间做缓存感知路由,并首次以独立路由模型形式作为 serverless 端点开放。

推荐理由

官方给出了内部 A/B 测试的成本与准确率数据,可帮助团队评估用缓存感知路由替代单一 Opus 的可行性。

正文 · AI 翻译

Fireworks Nexus 让工程团队能够将领先的开源模型接入他们已经在使用的工具链中,在不牺牲速度或质量的前提下将支出减半。该解决方案包含 FireRouter——市场上首个缓存感知路由器,它在速度和成本方面带来了巨大差异。

今天,我们推出 FireRouter with Opus,针对 Opus 系列进行了优化,现已在我们 CLI 中提供,并且首次作为独立的路由器模型提供。任何 Fireworks 账户都可以像使用其他模型一样,将其指向为无服务器端点。

经过一个多月的内部 A/B 测试,FireRouter with Opus 执行编码任务的准确率达到单独使用 Opus 的 98.1%,而成本降低了 57%。

FireRouter 是什么

FireRouter-diagram
如今,FireRouter with Opus 在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间进行路由

每一次到达 FireRouter 的用户轮次都会评估模型集合中每个模型对该任务的适合程度。然后它会估算每个模型处理该任务的成本,包括提示缓存的成本,以及为了切换到其他模型而丢失缓存是否值得。最后,它会路由到在质量与成本之间取得最佳平衡的模型。

目前,一个用户轮次将在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间进行路由。随着新模型和新版本的发布,模型集合将会变化。

结果

我们的内部编码流量来自随机分配到 FireRouter with Opus 或仅使用 Opus 的对照组的会话,工作负载和用户均相同。

每次会话的成本下降了 57%(±19 个百分点),从 $15.36 降至 $6.63。

cost

为了评估准确率,我们验证了智能体是否完成了工作、是否得出了正确答案,以及用户是否需要在下一轮进行任何纠正。

FireRouter with Opus 在评分轮次中得分 78.7%,而仅使用 Opus 为 80.2%,即达到其整体准确率的 98.1%。

Accuracy

我们的大部分流量来自内部编码工作,在这些工作中开源模型可以处理许多常规轮次。FireRouter 的缓存感知路由权衡了切换模型带来的节省与丢失缓存命中的成本。结果是,使用 FireRouter 和 Opus 时缓存命中率为 94.2%,而单独使用 Opus 时为 97.8%——这是一个微小而有意的取舍,大幅降低了整体成本。

Cache

两行命令即可试用

FireRouter with Opus 现已在多个工具链中可用,包括 Claude Code、Codex、Cursor IDE 等。使用下面的命令开始,并在 FireRouter 文档中了解更多。

bash

Copy

12

fireconnect login

fireconnect claude --model firerouter/opus

登录 Fireworks 查看您团队 Claude Opus 支出的预估节省额。

FireRouter with Opus savings chart

来源:Fireworks AI(网页) · fireworks.ai