# 102 分钟斯坦福硬核课讲透大模型从分词到对齐的完整流水线

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-09 20:26
- AIHOT 分数：53
- AIHOT 链接：https://aihot.news/items/cmtu35l5o0xpjrofpwbdrijko
- 原文链接：https://x.com/AYi_AInotes/status/2097662828039524437

## AI 摘要

博主推荐一条 102 分钟视频，称其对齐 Stanford CS336，把现代大模型的构建拆成五道工序：分词与 BPE、数据清洗管线、扩展定律（约 40 tok/param）、SFT/Reward Model/PPO 对齐、以及 bf16 计算加 fp32 存权的系统算力细节。作者认为它与点网页写提示词的入门教程不同，完整时间戳和课程大纲整理在评论区一楼，附视频链接。

## 正文

先把话挑明：原推说这视频是“两小时教你用 Claude 做自动化”，完全是误导人的标题党。

如果你只想学怎么点开网页写提示词、接个飞书脚本，这条 102 分钟的视频千万别看，你一定会觉得枯燥；
但如果你想彻底搞懂 ChatGPT、Claude 背后那台昂贵的超级发动机到底是怎么造出来的——
这是我今年看过把“大模型工厂内部流水线”讲得最透的一堂斯坦福硬核课（对齐 Stanford CS336）。

没有玄学魔法，它把造一个现代大模型拆成了 5 道带血的工业工序：

1️⃣ 分词（Tokenizer）：
为什么既不能按词切、也不能按字切？BPE（字节对编码）怎么用算法把 1PB 语料压成最高频的子词词表，既防 OOV 乱码，又保住计算显存；
2️⃣ 洗数据（Data Pipeline）：
“吃下全网数据”是骗外行的口号。真活是从 HTML 里剥广告、做语义去重、启发式过滤、再用 Wikipedia 引用模型当裁判，最后做退火加权；
3️⃣ 扩展定律（Scaling Laws）：
为什么是 Transformer 而不是 LSTM？Llama 3 405B 为什么配 15.6T tokens？模型参数与数据量大约 40 tok/param 才能把算力压平，不是无脑堆越大越好；
4️⃣ 对齐（Alignment）：
预训练出来的只是无脑续写器。SFT 教它说话格式，Reward Model 教它人类品味，PPO 把它推成听话的商业助手；
5️⃣ 系统与算力（AMP）：
万卡集群为什么能跑动？算的时候用 bf16 榨干 Tensor Core，存核心权重用 fp32 防累积误差。

大模型不是神迹，它是一座极其严密的现代重工业流水线。
花两个小时把底层骨架看懂，以后全网 99% 的大模型吹水和营销号套路，你一眼就能看穿。

完整 102 分钟时间戳导航、核心公式和斯坦福原课大纲，我整理在一楼了👇 https://x.com/Dipanshu_AI/status/2097318355241984068/video/1
