102 分钟斯坦福硬核课讲透大模型从分词到对齐的完整流水线

AYi · @AYi_AInotes · X·2026-09-09 20:26·1小时前
AI 导读

博主推荐一条 102 分钟视频,称其对齐 Stanford CS336,把现代大模型的构建拆成五道工序:分词与 BPE、数据清洗管线、扩展定律(约 40 tok/param)、SFT/Reward Model/PPO 对齐、以及 bf16 计算加 fp32 存权的系统算力细节。作者认为它与点网页写提示词的入门教程不同,完整时间戳和课程大纲整理在评论区一楼,附视频链接。

AYi@AYi_AInotes
53AI 编辑部评分,满分 100

102 分钟斯坦福硬核课讲透大模型从分词到对齐的完整流水线

2026-09-09 20:26· 1小时前
AI 导读

博主推荐一条 102 分钟视频,称其对齐 Stanford CS336,把现代大模型的构建拆成五道工序:分词与 BPE、数据清洗管线、扩展定律(约 40 tok/param)、SFT/Reward Model/PPO 对齐、以及 bf16 计算加 fp32 存权的系统算力细节。作者认为它与点网页写提示词的入门教程不同,完整时间戳和课程大纲整理在评论区一楼,附视频链接。

先把话挑明:原推说这视频是“两小时教你用 Claude 做自动化”,完全是误导人的标题党。

如果你只想学怎么点开网页写提示词、接个飞书脚本,这条 102 分钟的视频千万别看,你一定会觉得枯燥; 但如果你想彻底搞懂 ChatGPT、Claude 背后那台昂贵的超级发动机到底是怎么造出来的—— 这是我今年看过把“大模型工厂内部流水线”讲得最透的一堂斯坦福硬核课(对齐 Stanford CS336)。

没有玄学魔法,它把造一个现代大模型拆成了 5 道带血的工业工序:

1️⃣ 分词(Tokenizer): 为什么既不能按词切、也不能按字切?BPE(字节对编码)怎么用算法把 1PB 语料压成最高频的子词词表,既防 OOV 乱码,又保住计算显存; 2️⃣ 洗数据(Data Pipeline): “吃下全网数据”是骗外行的口号。真活是从 HTML 里剥广告、做语义去重、启发式过滤、再用 Wikipedia 引用模型当裁判,最后做退火加权; 3️⃣ 扩展定律(Scaling Laws): 为什么是 Transformer 而不是 LSTM?Llama 3 405B 为什么配 15.6T tokens?模型参数与数据量大约 40 tok/param 才能把算力压平,不是无脑堆越大越好; 4️⃣ 对齐(Alignment): 预训练出来的只是无脑续写器。SFT 教它说话格式,Reward Model 教它人类品味,PPO 把它推成听话的商业助手; 5️⃣ 系统与算力(AMP): 万卡集群为什么能跑动?算的时候用 bf16 榨干 Tensor Core,存核心权重用 fp32 防累积误差。

大模型不是神迹,它是一座极其严密的现代重工业流水线。 花两个小时把底层骨架看懂,以后全网 99% 的大模型吹水和营销号套路,你一眼就能看穿。

完整 102 分钟时间戳导航、核心公式和斯坦福原课大纲,我整理在一楼了👇 https://x.com/Dipanshu_AI/status/2097318355241984068/video/1