按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)NVIDIA 技术博客解析 Dense 与 MoE 模型的激活参数、吞吐差异及选型方法
AI 导读
NVIDIA 技术博客讲解 dense 与 MoE 两种架构的参数使用差异:MoE 通过 router 网络在每个 token 只激活部分 FFN 专家,30B 总参数的 Nemotron 3.5 Lightning 每 token 仅激活 3B。
NVIDIA Technical Blog:Agentic AI / Generative AI
52
AI 编辑部评分,满分 100NVIDIA 技术博客解析 Dense 与 MoE 模型的激活参数、吞吐差异及选型方法
NVIDIA 技术博客讲解 dense 与 MoE 两种架构的参数使用差异:MoE 通过 router 网络在每个 token 只激活部分 FFN 专家,30B 总参数的 Nemotron 3.5 Lightning 每 token 仅激活 3B。
来源:NVIDIA Technical Blog:Agentic AI / Generative AI· developer.nvidia.com