返回
AI 评分 52/100

NVIDIA 技术博客解析 Dense 与 MoE 模型的激活参数、吞吐差异及选型方法

NVIDIA Technical Blog:Agentic AI / Generative AI·2026-09-16 01:39·10小时前
AI 导读

NVIDIA 技术博客讲解 dense 与 MoE 两种架构的参数使用差异:MoE 通过 router 网络在每个 token 只激活部分 FFN 专家,30B 总参数的 Nemotron 3.5 Lightning 每 token 仅激活 3B。

NVIDIA Technical Blog:Agentic AI / Generative AI
52AI 编辑部评分,满分 100

NVIDIA 技术博客解析 Dense 与 MoE 模型的激活参数、吞吐差异及选型方法

2026-09-16 01:39· 10小时前
AI 导读

NVIDIA 技术博客讲解 dense 与 MoE 两种架构的参数使用差异:MoE 通过 router 网络在每个 token 只激活部分 FFN 专家,30B 总参数的 Nemotron 3.5 Lightning 每 token 仅激活 3B。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:NVIDIA Technical Blog:Agentic AI / Generative AI· developer.nvidia.com