跳到正文
热点事件观察中

循环 MoE 缩放定律研究发布

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年9月30日,HuggingFace Daily Papers 收录一篇关于循环 MoE 缩放定律的研究(arXiv 发布《Scaling Laws for Looped Mixture of Experts》)。该研究提出 Loop Scaling Laws,据其表述,这是首个将循环结构与 MoE 稀疏性同模型规模、数据量一起联合建模的缩放定律,可更准确预测循环模型的留出损失,并将标准稠密与 MoE 缩放定律作为特例涵盖。实验结果显示:稀疏性带来约 3 倍活跃参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模、相同训练算力下,循环 MoE 在推理基准上可匹配约 2 倍大的非循环 MoE。目前该事件仅有这一篇主报道,尚无后续跟进报道,上述效率倍数均为该研究自身给出的实验结论。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. HuggingFace Daily Papers(社区热门论文)
    循环 MoE 的缩放定律:首次联合建模循环与稀疏性

    研究提出 Loop Scaling Laws,首次将循环结构与 MoE 稀疏性同模型规模、数据量一起联合建模,可更准确预测循环模型的留出损失,并将标准稠密与 MoE 缩放定律作为特例涵盖。实验显示稀疏性带来约 3 倍活跃参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模、相同训练算力下,循环 MoE 在推理基准上可匹配约 2 倍大的非循环 MoE。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。