做 AI 系统部署最致命的认知死穴,就是拿着“训练思维”去算“推理工程”。 很多人买显卡还在第一眼盯它有多少 TFLOPs 峰值算力,
刚融了 4000 万美元的性能工程独角兽 Wafer 联创说了句大白话: 把 DeepMind 那篇经典指南的第 7 章吃透,你对大模型推理的物理认知,就能瞬间超过全行业 90% 只会调参数的人。
这根本不是一篇普通的理论科普,它直接把所有做 Serving 的团队拉进了极其残酷的硬件现实:
Prefill(吃 Prompt)和 Decode(吐 Token),从来不是一件事的两个步骤,而是两场物理法则完全相反的硬件游戏:
1️⃣ Decode 阶段从来不是算力问题,纯粹是“搬家问题”: 在 Prefill 阶段,模型一口气吞下几千个字,矩阵乘法算力吃满,GPU 活得像个计算中心; 但只要一进入 Decode 阶段,序列长度瞬间塌缩成 $$T=1$$! 此时算术强度断崖式暴跌,硬件几乎是在被当作内存条使唤—— 每吐出区区一个 Token,硬件都必须把几十 GB 的模型参数、外加所有历史对白算出来的 KV 状态,从 HBM 显存里完整搬进计算核心过一遍。 算力在闲置空转,瓶颈被死死卡死在显存带宽上; 2️⃣ 上下文变长,模型参数直接退化成配角: 在 8k 长度下,KV Cache 的体积就已经开始反超参数本身;而在 128k 上下文和多并发场景下,卡上的主要矛盾根本不是模型有多大,而是你的 HBM 能不能塞得下那片汪洋大海般的历史状态! GQA 把注意力头合并、FP8/FP4 做 KV 量化、PagedAttention 消除对齐气泡, 所有这些神级优化的本质,全是在拼了命地“少搬一点历史”; 3️⃣ 盲目堆大 Batch,会被反噬得更惨: 以前的直觉是拼命拉大并发去摊销权重搬运成本; 但每一个并发请求都拖着自己长长的 KV 尾巴! 当并发跨过某个临界点,每个 step 的 KV 流量就会把权重复用的红利彻底吃光,吞吐量反而撞上物理天花板; 4️⃣ 终极解法:承认它们不该住在一组机器上: 让吃算力的 Prefill 去高算力卡上拼命吞吐,让吃带宽的 Decode 去大显存机器上安稳吐字——“PD 分离(Disaggregation)”正在成为整个工业界最吸金的基础设施。
开源模型打到今天,胜负手早就不仅在权重刷分了。 同一套开源权重,换一套底层 Kernel、调度层和异构硬件编排,单位成本能硬生生差出 2 到 3 倍。
别再对着参数量凭空臆想了。 大模型推理的真实世界观极其简单: 性能 = 你每走一步必须从显存搬出多少字节,以及你能在工程架构上,把“拒绝搬第二次”做到多么极致。
把这套账算明白了,你手里的算力集群才算真正通了电。