热点事件观察中
循环 MoE 缩放定律研究发布
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月30日,HuggingFace Daily Papers 收录一篇关于循环 MoE 缩放定律的研究(arXiv 发布《Scaling Laws for Looped Mixture of Experts》)。该研究提出 Loop Scaling Laws,据其表述,这是首个将循环结构与 MoE 稀疏性同模型规模、数据量一起联合建模的缩放定律,可更准确预测循环模型的留出损失,并将标准稠密与 MoE 缩放定律作为特例涵盖。实验结果显示:稀疏性带来约 3 倍活跃参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模、相同训练算力下,循环 MoE 在推理基准上可匹配约 2 倍大的非循环 MoE。目前该事件仅有这一篇主报道,尚无后续跟进报道,上述效率倍数均为该研究自身给出的实验结论。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 08:00
循环 MoE 的缩放定律:首次联合建模循环与稀疏性报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- HuggingFace Daily Papers(社区热门论文)循环 MoE 的缩放定律:首次联合建模循环与稀疏性
研究提出 Loop Scaling Laws,首次将循环结构与 MoE 稀疏性同模型规模、数据量一起联合建模,可更准确预测循环模型的留出损失,并将标准稠密与 MoE 缩放定律作为特例涵盖。实验显示稀疏性带来约 3 倍活跃参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模、相同训练算力下,循环 MoE 在推理基准上可匹配约 2 倍大的非循环 MoE。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。