跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分45

循环 MoE 的缩放定律:首次联合建模循环与稀疏性

Scaling Laws for Looped Mixture of Experts

AI 导读

研究提出 Loop Scaling Laws,首次将循环结构与 MoE 稀疏性同模型规模、数据量一起联合建模,可更准确预测循环模型的留出损失,并将标准稠密与 MoE 缩放定律作为特例涵盖。实验显示稀疏性带来约 3 倍活跃参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模、相同训练算力下,循环 MoE 在推理基准上可匹配约 2 倍大的非循环 MoE。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org