DeepSeek V4.1 Flash 架构创新非蒸馏可得

AYi · @AYi_AInotes · X·2026-09-12 06:49·57分钟前
AI 导读

学者 @hsu_steve 评价 Peter Gostev 用 3D 还原的 DeepSeek V4.1 Flash 架构图,称其底层设计"任何蒸馏技术都偷不来"。该架构采用 20 层因果编码器 + 20 层解码器的 CED 架构,读长文本仅激活约 8B 参数、生成时激活 16B;KV 显存压至约 890 字节/token,为上一代四分之一。

AYi@AYi_AInotes
50AI 编辑部评分,满分 100

DeepSeek V4.1 Flash 架构创新非蒸馏可得

2026-09-12 06:49· 57分钟前
AI 导读

学者 @hsu_steve 评价 Peter Gostev 用 3D 还原的 DeepSeek V4.1 Flash 架构图,称其底层设计"任何蒸馏技术都偷不来"。该架构采用 20 层因果编码器 + 20 层解码器的 CED 架构,读长文本仅激活约 8B 参数、生成时激活 16B;KV 显存压至约 890 字节/token,为上一代四分之一。

DeepSeek V4.1 Flash 不是靠蒸馏就能得到的,

这是著名学者 @hsu_steve 借着@petergostev Gostev 用 3D 还原出的 DeepSeek 底层图纸和3D架构图发出的评价,直接一巴掌抽碎了海外科技圈最虚伪的傲慢偏见: “这种东西,是全世界任何蒸馏技术都绝对偷不来的。”

过去一年,大量非技术评论员和带着意识形态滤镜的人, 天天在推特上念经说“DeepSeek 无非就是蒸馏了 OpenAI 和 Claude 的闭源数据”; 但当 Peter Gostev 拿工具把 V4.1 Flash 和 2017 年原版 Transformer 的三维结构并排切开时, 只要是对计算机系统结构稍有常识的工程师,全都闭嘴了。

蒸馏能给你相似的参数分布和回答语气, 但蒸馏绝对生造不出这一整套被彻底重写的底层工业设计:

1️⃣ 撕碎对称的因果编解码(CED 架构): 整个行业在对称的 Decoder-only 架构里困守了 9 年; DeepSeek 直接把它劈成了 20 层因果编码器 + 20 层解码器—— 读长文本时只激活约 8B 参数,生成输出时激活 16B。输入输出在物理层面彻底解耦,长上下文吞吐量直接成倍暴涨; 2️⃣ 算术级压榨的 KV Cache(CSA2 + 跨层复用 + FP4): 大模型最吃显存的死穴就是 KV 缓存。 它通过稀疏压缩和跨层直接复用,把全局 KV 显存硬生生压到了约 890 字节/token(上一代的四分之一,持久化状态直接砍到八分之一); 3️⃣ 原生多模态与 Engram 稀疏记忆: 再加上 SWA 有界重放、DSpark 投机解码, 这根本不是在原版框架上修修补补,这是一座全新的算力炼钢厂。

这才是为什么它能把价格干到每百万 Token 只要两毛钱、还能在端侧飙出 400 TPS 的物理根基!

你可以靠抄作业学到别人的解题思路, 但你不可能靠抄作业,凭空发明出一套“谁来计算 KV、谁负责复用、谁来压缩”的全新硬件通信调度体系。

只有真正拥有极高工程自信和开源格局的团队, 才会把这些价值连城的架构创新,白纸黑字毫无保留地写在论文里开源给全人类。

别再拿“纯蒸馏”这种自欺欺人的遮羞布当借口了。 先有了体系结构的断代发明,才配谈后面的便宜、极速与百万长上下文。 在这张清晰可见的架构图纸面前,所有不愿承认创新的偏见,不过是在对物理世界的客观规律装瞎。 https://x.com/petergostev/status/2098150322996703398/video/1

steve hsuYou don't get this from distillation

来源:AYi· x.com