智能性价比

Tomer Tunguz 博客(VC 分析)·2026-06-03 08:00·110天前·Tomasz Tunguz
AI 导读

微软在模型发布卡中首次加入平均token使用量指标。其模型在SWE-Bench Verified上达71.6分,仅消耗约Claude Haiku 4.5三分之一的token。Artificial Analysis的Intelligence Index显示GPT 5.5与Claude Opus 4.8得分相近(约60分),但Opus 4.8运行成本高出40%($4,685 vs $3,357)。Uber因四个月内AI预算超支而限制员工使用;Salesforce花费$3亿购买Anthropic tokens并冻结工程招聘。模型公司如今需同时在性能和成本两个维度竞争。

Tomer Tunguz 博客(VC 分析)
精选
66AI 编辑部评分,满分 100

智能性价比

2026-06-03 08:00· 110天前· Tomasz Tunguz
AI 导读

微软在模型发布卡中首次加入平均token使用量指标。其模型在SWE-Bench Verified上达71.6分,仅消耗约Claude Haiku 4.5三分之一的token。Artificial Analysis的Intelligence Index显示GPT 5.5与Claude Opus 4.8得分相近(约60分),但Opus 4.8运行成本高出40%($4,685 vs $3,357)。Uber因四个月内AI预算超支而限制员工使用;Salesforce花费$3亿购买Anthropic tokens并冻结工程招聘。模型公司如今需同时在性能和成本两个维度竞争。

推荐理由

微软在模型发布卡上悄悄加了“平均token消耗”这个指标,这不是小改动,而是宣告AI从堆算力转向算账时代。Uber和Salesforce的预算教训已经很清楚了。

正文 · AI 翻译

简而言之:在困难编码任务(SWE-Bench Verified)上,微软的 MAI-Code-1-Flash 比 Claude Haiku 4.5 少用 60% 的 token,在 SWE-Bench Pro 上领先 16 分,并具备自适应解答长度控制。关键洞见在于:每美元智能,即每消耗一个 token 所获得的价值,才是评估生产环境中 AI 模型的正确指标。

Screenshot 2026-06-02 at 9.22.43 PM

昨天,微软在模型发布卡片上新增了一项指标,这项指标很可能会成为标准。1

平均 token 用量。

在第一行中,微软的模型在 SWE-Bench Verified 上达到 71.6,而所用 token 仅为 Claude Haiku 4.5 消耗量的约三分之一。

如今基准测试从两个不同维度来衡量:整体性能,以及达成该智能水平所需的成本。

这再次表明,补贴2、tokenmaxxing3,以及许多用例中不计代价追求性能的时代已经结束。

即便是全球最有价值的公司,也无力为每一种可能的用例都负担最先进的智能。4 Uber 在四个月内就花光了预算,随后对员工的 AI 支出设了上限。5 Salesforce 在 Anthropic tokens 上花费了 3 亿美元,并已冻结工程岗位招聘。6

这个全新的双重基准回答了买家唯一的问题:我的每一美元能换来多少智能?

Screenshot 2026-06-03 at 5.49.00 AM

Artificial Analysis 已经在对这一点进行基准测试了。7 GPT 5.5 与 Claude Opus 4.8 在 Intelligence Index 上仅相差一个点,均在 60 左右。运行该指数在 GPT 5.5 上花费 $3,357,在 Opus 4.8 上花费 $4,685。同样的答案,贵了 40%。

模型公司如今必须在两个维度上展开竞争。应用层则会在更高一层竞争,即按成果计费——一个已关闭的工单、一个已交付的 PR,或一个已解决的客服案例,实际成本究竟是多少。

如今,技术栈中的每一层都必须按照客户的思维方式来定价:按结果,而非按 token。



  1. 推出 MAI-Code-1-Flash —— 微软发布了一款新的编程模型,并在发布说明中标注了平均 token 用量。↩︎

  2. 不可持续的补贴 — AI 补贴的时代正在终结。↩︎

  3. Token 刷榜 — 那些靠额外 token 刷高基准测试成绩的模型正在失去优势。↩︎

  4. 微软取消 Claude Code 许可证,将开发者转向 GitHub Copilot CLI — 在工程使用量超出预算后,微软取消了其体验与设备部门(Windows、Microsoft 365、Outlook、Teams、Surface)的 Claude Code 许可证。↩︎

  5. Uber 在 4 个月内耗尽预算后限制员工 AI 支出 — Uber 在四个月内耗尽预算后限制员工 AI 支出。↩︎

  6. Salesforce 在 AI 上花费 3 亿美元,冻结工程招聘 — Salesforce 在 AI 上花费 3 亿美元,冻结工程招聘。↩︎

  7. AI 模型与 API 提供商分析 — 对 AI 模型成本的独立分析。↩︎

来源:Tomer Tunguz 博客(VC 分析)· tomtunguz.com