本地AI模型已能胜任89%日常查询,数据中心将走向个人化

Tomer Tunguz 博客(VC 分析)·2026-08-21 08:00·31天前
AI 导读

斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。

Tomer Tunguz 博客(VC 分析)
精选
64AI 编辑部评分,满分 100

本地AI模型已能胜任89%日常查询,数据中心将走向个人化

2026-08-21 08:00· 31天前
AI 导读

斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。

推荐理由

作者借 Koomey 定律类比,把本地模型与云端效率数据放进历史框架,帮助读者理解端侧 AI 的演进节奏。

正文 · AI 翻译

本地 AI 模型在回答日常聊天与推理查询时,已有 89% 的表现能与前沿云端模型媲美,这一结果在超过一百万条真实查询以及 20 多个受测本地模型上普遍成立。1

这意味着我们每消耗一瓦电力就能产出更多智能:同样的电子数量能完成更多工作。1

追踪计算效率随时间的变化并非新鲜事。Koomey 定律发现,几十年来,每瓦计算能力大约每 1.5 年翻一番,这一趋势将一台大型机的算力缩小到了笔记本电脑的机身之中。23

正如每瓦性能指引了从大型机到 PC 的转变,每瓦智能将指引 AI 向边缘端的转变。

—— Jon Saad-Falcon、Avanika Narayan 等,《Intelligence per Watt》

如今 GPU 遵循的曲线则更为平缓,在过去 15 年里效率大约每 2.7 年翻一番,而非每 1.5 年。4

其影响同样令人瞩目:最佳本地模型对前沿模型的胜/平率从 2023 年的 23.2% 上升到 2025 年的 71.3%,大约每年增加 20 个百分点。到 2026 年,由另一个本地 AI 为该任务挑选的本地模型将这一数字推高至接近 90%。5

效率也随这一趋势线同步提升:同一时期内,每瓦智能提升了 5.3 倍,其中 3.1 倍来自更好的模型,1.7 倍来自更好的芯片。计算机更快了,模型更聪明了。最终用户从中受益。

Local models match cloud models on 71.3% of queries in 2025, up from 23.2% in 2023; a 2026 bar shows the ensemble-routed ceiling of 89%, a different metric than the single-model trend

5

云对于长多步推理、最难的技术领域,以及规模和并行化至关重要的负载,仍然不可或缺。在许多用例中,云硬件仍比本地硬件更具优势。相对于本地模型,云端推理带来 40% 的能效提升。6数据中心会批量处理查询,这是目前一次只服务一个用户的本地硬件还无法使用的技巧。

Local AI efficiency improved 18x in 16 months, split between gains from better accelerators and better models

但对于大部分日常知识工作而言,完全没有必要把查询发送到数据中心。本地模型加上一个路由器,就足以应对绝大多数工作。7

与全云端基线相比,它还将能耗降低 80%、算力降低 77%、成本降低 74%。

大型机变成了个人电脑。你的数据中心也将如此。


  1. Jon Saad-Falcon、Avanika Narayan 等,《每瓦智能:衡量本地 AI 的智能效率》,斯坦福大学与 Together AI,2025 年 11 月。arXiv:2511.07885。另见斯坦福 Hazy Research 概述↩︎ ↩︎

  2. Koomey 定律,维基百科。↩︎

  3. 瓦特衡量功率,即能量被消耗的速率,而焦耳衡量能量本身;Koomey 最初的指标是每焦耳的计算量,但其底层趋势与如今每瓦智能为 AI 模型所追踪的趋势相同。↩︎

  4. Anson Ho、Ege Erdil 与 Tamay Besiroglu,《CMOS 微处理器能效的极限》,2023 年。arXiv:2312.08595↩︎

  5. 71.3% 和 89% 是来自同一份 2025 年数据的两个不同测量值,而不是同一数字在不同时间点的取值。71.3% 是最佳单一本地模型对前沿模型的胜/平率,也就是这张图所绘制的趋势线(2023 年为 23.2%,2024 年为 48.7%,2025 年为 71.3%)。89% 则是一个独立的、更高的上限:将每个查询路由到所测试的 20 多个本地模型中处理该查询最佳的那一个,比任何单一模型高出 16.3 到 28.8 个百分点。这一增益是一种选择效应:论文指出,本地路由从 20 多个多样化的模型中挑选,而前沿云端模型只有三个,因此在某些基准测试上,本地最佳集成甚至超过了云端最佳。候选模型更多——而不仅仅是路由更智能——才是提升准确率的原因。这两个数字都来自同一项研究,彼此并不相互取代。↩︎ ↩︎

  6. Jon Saad-Falcon、Avanika Narayan 等人,《Intelligence per Watt: Measuring Intelligence Efficiency of Local AI》,斯坦福大学与 Together AI,2025 年 11 月。云端加速器在运行相同模型时,每瓦智能至少比本地芯片高出 1.4 倍,大约相当于 40% 的效率溢价。arXiv:2511.07885↩︎

  7. Most AI Work Can Wait,tomtunguz.com。 ↩︎

来源:Tomer Tunguz 博客(VC 分析)· tomtunguz.com