# 从 DeepMind 推理指南看大模型推理工程：瓶颈不在算力而在显存带宽

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-12 19:09
- AIHOT 分数：53
- AIHOT 链接：https://aihot.news/items/cmtya9e5305h8rojhtresxfol
- 原文链接：https://x.com/AYi_AInotes/status/2098730751004913820

## AI 摘要

Wafer 联创推荐吃透 How To Scale Your Model 第 7 章，并上线了 AI 性能工程资源系列 repo（Wafer 上周刚融资 4000 万美元）。

## 正文

做 AI 系统部署最致命的认知死穴，就是拿着“训练思维”去算“推理工程”。
很多人买显卡还在第一眼盯它有多少 TFLOPs 峰值算力，

刚融了 4000 万美元的性能工程独角兽 Wafer 联创说了句大白话：
把 DeepMind 那篇经典指南的第 7 章吃透，你对大模型推理的物理认知，就能瞬间超过全行业 90% 只会调参数的人。

这根本不是一篇普通的理论科普，它直接把所有做 Serving 的团队拉进了极其残酷的硬件现实：

Prefill（吃 Prompt）和 Decode（吐 Token），从来不是一件事的两个步骤，而是两场物理法则完全相反的硬件游戏：

1️⃣ Decode 阶段从来不是算力问题，纯粹是“搬家问题”：
在 Prefill 阶段，模型一口气吞下几千个字，矩阵乘法算力吃满，GPU 活得像个计算中心；
但只要一进入 Decode 阶段，序列长度瞬间塌缩成 $$T=1$$！
此时算术强度断崖式暴跌，硬件几乎是在被当作内存条使唤——
每吐出区区一个 Token，硬件都必须把几十 GB 的模型参数、外加所有历史对白算出来的 KV 状态，从 HBM 显存里完整搬进计算核心过一遍。
算力在闲置空转，瓶颈被死死卡死在显存带宽上；
2️⃣ 上下文变长，模型参数直接退化成配角：
在 8k 长度下，KV Cache 的体积就已经开始反超参数本身；而在 128k 上下文和多并发场景下，卡上的主要矛盾根本不是模型有多大，而是你的 HBM 能不能塞得下那片汪洋大海般的历史状态！
GQA 把注意力头合并、FP8/FP4 做 KV 量化、PagedAttention 消除对齐气泡，
所有这些神级优化的本质，全是在拼了命地“少搬一点历史”；
3️⃣ 盲目堆大 Batch，会被反噬得更惨：
以前的直觉是拼命拉大并发去摊销权重搬运成本；
但每一个并发请求都拖着自己长长的 KV 尾巴！
当并发跨过某个临界点，每个 step 的 KV 流量就会把权重复用的红利彻底吃光，吞吐量反而撞上物理天花板；
4️⃣ 终极解法：承认它们不该住在一组机器上：
让吃算力的 Prefill 去高算力卡上拼命吞吐，让吃带宽的 Decode 去大显存机器上安稳吐字——“PD 分离（Disaggregation）”正在成为整个工业界最吸金的基础设施。

开源模型打到今天，胜负手早就不仅在权重刷分了。
同一套开源权重，换一套底层 Kernel、调度层和异构硬件编排，单位成本能硬生生差出 2 到 3 倍。

别再对着参数量凭空臆想了。
大模型推理的真实世界观极其简单：
性能 = 你每走一步必须从显存搬出多少字节，以及你能在工程架构上，把“拒绝搬第二次”做到多么极致。

把这套账算明白了，你手里的算力集群才算真正通了电。

### 引用推文

> wafer：we launched the most comprehensive ai performance engineering repo in the world last week now we'll be posting every single resource this is Wafer's ai performa...
