先把话挑明:原推说这视频是“两小时教你用 Claude 做自动化”,完全是误导人的标题党。
如果你只想学怎么点开网页写提示词、接个飞书脚本,这条 102 分钟的视频千万别看,你一定会觉得枯燥; 但如果你想彻底搞懂 ChatGPT、Claude 背后那台昂贵的超级发动机到底是怎么造出来的—— 这是我今年看过把“大模型工厂内部流水线”讲得最透的一堂斯坦福硬核课(对齐 Stanford CS336)。
没有玄学魔法,它把造一个现代大模型拆成了 5 道带血的工业工序:
1️⃣ 分词(Tokenizer): 为什么既不能按词切、也不能按字切?BPE(字节对编码)怎么用算法把 1PB 语料压成最高频的子词词表,既防 OOV 乱码,又保住计算显存; 2️⃣ 洗数据(Data Pipeline): “吃下全网数据”是骗外行的口号。真活是从 HTML 里剥广告、做语义去重、启发式过滤、再用 Wikipedia 引用模型当裁判,最后做退火加权; 3️⃣ 扩展定律(Scaling Laws): 为什么是 Transformer 而不是 LSTM?Llama 3 405B 为什么配 15.6T tokens?模型参数与数据量大约 40 tok/param 才能把算力压平,不是无脑堆越大越好; 4️⃣ 对齐(Alignment): 预训练出来的只是无脑续写器。SFT 教它说话格式,Reward Model 教它人类品味,PPO 把它推成听话的商业助手; 5️⃣ 系统与算力(AMP): 万卡集群为什么能跑动?算的时候用 bf16 榨干 Tensor Core,存核心权重用 fp32 防累积误差。
大模型不是神迹,它是一座极其严密的现代重工业流水线。 花两个小时把底层骨架看懂,以后全网 99% 的大模型吹水和营销号套路,你一眼就能看穿。
完整 102 分钟时间戳导航、核心公式和斯坦福原课大纲,我整理在一楼了👇 https://x.com/Dipanshu_AI/status/2097318355241984068/video/1