AI行业Token成本失控引发紧急管控:从"加速"转向"设护栏"

TechCrunch:AI(RSS)·2026-06-05 22:49·106天前·Rebecca Bellan
AI 导读

AI行业关注焦点从token最大化与快速迭代转向成本管控。业内普遍呼吁建立护栏机制,以应对推理和生成过程中不断飙升的token费用。这一趋势正在推动模型部署策略、API定价体系以及企业级AI应用的经济性评估发生根本性转变。

TechCrunch:AI(RSS)
精选
73AI 编辑部评分,满分 100

AI行业Token成本失控引发紧急管控:从"加速"转向"设护栏"

2026-06-05 22:49· 106天前· Rebecca Bellan
AI 导读

AI行业关注焦点从token最大化与快速迭代转向成本管控。业内普遍呼吁建立护栏机制,以应对推理和生成过程中不断飙升的token费用。这一趋势正在推动模型部署策略、API定价体系以及企业级AI应用的经济性评估发生根本性转变。

推荐理由

企业开始受不了AI账单了,Uber半年花光全年预算,微软撤销Claude Code许可,这可能是AI泡沫的第一声警报。这篇文章给所有用AI写代码的公司算了一笔账,值得一看。

正文 · AI 翻译

在整个行业里,各公司开始对 AI 的价格望而却步。Uber 在 4 月就花光了其 2026 年全年的 AI 编程预算。微软在为其开发者启用 Claude Code 许可数月后,又撤销了这些许可。一位 Priceline 员工告诉 TechCrunch,一次例行的 Cursor 合同续约报价涨了 4-5 倍。

尽管每 token 的价格已经下降,但推动更广泛采用 AI 以及日益自主的智能体,使 token 消耗量越来越高。那些在 2025 年初大肆享用无限量订阅的公司,如今正手忙脚乱地弄清楚钱都花到哪里去了,削减开支,并判断能否从预算的残骸中挽回一些 ROI。

与此同时,一个满足这些需求的市场正在形成。初创公司、老牌厂商以及一个新的标准机构都在竞相为企业提供工具和话语体系,以追踪它们的支出。

“六个月前,我和客户交谈时,话题全是‘它能做什么?它够好吗?’”OpenAI 企业业务负责人 Alexander Embiricos 本周在纽约市的一场活动上告诉 TechCrunch。“现在我们的话题再也不是这些了。现在的话题是,‘嘿,我们花了这么多钱。你们有什么可见性?你们有什么可审计性?你们有什么 token 控制手段?你们模型的效率如何?’”

正是在这样的背景下,Linux 基金会本周公布了 Tokenomics Foundation 的计划,这是一个新的标准机构,旨在为 AI token 注入与 FinOps 为云支出带来的同样的成本纪律。

“在四月和五月,我开始听到一些公司说:‘天哪,我们整个 2026 年的 token 预算已经超了 3 倍,而现在才四月,’”Linux 基金会旗下项目 FinOps Foundation 的执行董事 J.R. Storment 告诉 TechCrunch。“我们开始听到生存危机的说法,整个讨论从 tokenmaxxing 和‘快速推进’转向了‘我们需要护栏,我们该怎么控制这件事?’”

这场震动整个科技圈的呼声,源于此前 CEO 们热切要求团队使用最好的模型并快速推进,不惜一切代价。11 月发布的新模型,如 Anthropic 的 Claude Opus 4.5、OpenAI 的 GPT-5.1 和 Google 的 Gemini 3 Pro,为智能体工具带来了显著提升,从而使消耗成倍增长。正因如此,一家公司据报道在忘记为员工设置使用限额后,发现自己收到了 5 亿美元的 Claude 账单。

“这就像快克可卡因成瘾一样,”Priceline 的 IT 财务高级总监 Chris Reed 说道,并指出公司已经开始对某些群体设置 token 限额。“他们先让你试用,把你钩住,现在你就有点被它牵着走了。”

工程运营平台 Faros AI 的 CEO Vitaly Gordon 表示,他最近与一位 CTO 交谈,对方告诉他:“我的一名工程师上个月在 token 上花了 4 万美元,我真的不知道是该阻止他,还是该去告诉其他所有人都向他学习。”

Faros 在 4 月发布了一项针对 20,000 名开发者、历时两年的研究,发现产出在上升,但 bug 和重写也在增加。工程管理平台 Jellyfish 同样发现,使用 token 最多的工程师生产率大约是不太使用 AI 的工程师的两倍,但他们为此消耗了 10 倍的 token 数量。

Jellyfish 研究主管 Nicholas Arcolano 通过电子邮件告诉 TechCrunch,AI 支出正在急剧膨胀,很大程度上归因于智能体功能,每位开发者的消耗量在九个月内增长了约 18.6 倍。总而言之,这些数据让生产率的实际情况比支出所显示的更加模糊不清。

“极端支出是否能带来回报,归根结底取决于已交付代码的最终商业价值(例如收入),而大多数公司仍然无法衡量这一点,”Arcolano 说。

至少在一定程度上,这种计量问题源于当今 AI 被使用的规模之庞大。

“追踪云成本是一个每月数亿行的数据问题,”Storment 说。“追踪 token 成本是一个每月数万亿行的数据问题。你不能只是把它塞进随便什么电子表格,甚至基础工具里。要做到这一点,你必须从根本上重新思考你的工具、你的规格和你的会计系统。”

在 Priceline,Reed 已经看到了差异。他指出了供应商报告的使用量与 Priceline 内部数据之间的问题。

“我的职业生涯始于电信费用管理,而我如今看到的是从电信到云再到 AI 的完全相同的相似之处,”他说。“每当你引入新事物时,它就很容易出现计费错误,也蕴含着审计和优化的机会。”

围绕这一问题,一个市场正在开始形成。其中有像 Pay-i 这样的纯专注型公司,它追踪、衡量并优化 GenAI 投资的成本与性能。与此同时,Paid 让开发者能够追踪成本、衡量使用情况,并根据实际价值而非订阅费向用户计费。

此外还有像 Jellyfish、Waydev 和 Faros AI 这样的公司,它们都提供 AI 智能体监控,以证明开发者工具的 ROI。Storment 表示,FinOps Foundation 内 180 家供应商中的大多数都在向这一领域倾斜。

已拥有现成分销渠道的公司也在添加新功能,以抓住这个新市场。Ramp 最近进入了AI 支出管理领域;DatadogNew Relic 则附加了云成本管理、token 级可观测性和 GPU 监控等服务。在下周的 FinOps X 大会上,AWS 预计将推出面向企业 AI 支出的新财务管理功能。

NEA 合伙人 Tiffany Luck 认为,token 效率和可观测性很可能会被添加到“harness 或应用层”。她提到了 Factory,这是一家初创公司,为企业打造 AI 智能体,该公司本周推出了一个模型路由器,可为每项任务自动挑选合适的模型。

Gordon 预计,前沿实验室和其他模型提供商会采用 OpenRouter 式的优化方式,将查询引导至最便宜的模型——这一趋势已经在企业 Claude 账单中显现出来。

“关于你在 Anthropic 上花费了多少的财务报告,即使你调用的是 Opus 模型,部分支出也会落在 Sonnet 或 Haiku 上,因为它们足够聪明,能完成这些任务,”Gordon 说。“我认为这会变得越来越普遍。”

但所有这些工具的构建,都缺乏一套通用语言或共享定义,来说明一个 token 的成本是多少、它产出了什么,以及如何跨供应商比较支出。这正是 Tokenomics Foundation 希望发挥作用的地方。

该基金会正在为“tokenomics”构建一套规范定义和框架;为 AI token 使用和计费制定开放标准、规范和指标;以及为 AI 经济学提出新的指标,如每智能成本或每瓦 token 数。它还计划定义涵盖 token 工厂有效性和消费效率的指标。该组织计划于 7 月正式启动,并将在下周的 FinOps X 大会上宣布更多成员。

“Token 经济学从根本上比我们此前在这个规模上管理过的任何东西都更加抽象和不透明,”Salesforce 首席可用性官 Nishant Gupta 在一份声明中表示。“它需要一种不同于行业为云所构建的运营能力。”

话虽如此,高盛预测,到 2030 年全球 token 使用量将增长 24 倍。那些已经超出预算的公司现在就需要解决方案,而该基金会的首个交付成果还要等好几个月。

“也许我们发明了蒸汽机,但我们还没搞清楚流水线,”Gordon 说。

据 Arcolano 所说,明智之举是广泛而适度地采用。

“最佳 ROI 来自将广泛的中等用户从低使用量推向适度使用量,而不是把重度用户推得更高,”他说。

Russell Brandom 和 Tim Fernholz 对本文报道亦有贡献。

来源:TechCrunch:AI(RSS)· techcrunch.com