扩展分类流映射(Categorical Flow Maps)规模

Apple Machine Learning Research(RSS)·2026-08-07 08:00·45天前
AI 导读

连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。

Apple Machine Learning Research(RSS)
精选
64AI 编辑部评分,满分 100

扩展分类流映射(Categorical Flow Maps)规模

2026-08-07 08:00· 45天前
AI 导读

连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。

推荐理由

研究将分类流映射扩展到大规模语言建模,为连续扩散替代自回归提供了实验证据,可能影响模型架构选择。

正文 · AI 翻译

查看论文

连续扩散模型与流匹配模型有望成为语言建模(LM)中自回归方法之外的一种强大替代方案,因为它们解锁了一系列目前仅为连续模态所保留的优势,包括加速采样与倾斜。近期,多项工作已经证明,可以通过一个简单的高斯分布与 one-hot 编码数据分布之间的流匹配过程来连续生成离散数据。

他们进一步展示了通过 Categorical Flow Maps(CFMs)实现加速采样的可行性,从而在少步采样机制下获得了具有竞争力的样本质量。然而,该方法此前仅在相对较小的规模(< 1B)上进行了评估,其可扩展性问题完全悬而未决。

在本文中,我们在 2.1T tokens 上训练了一个 1.7B 参数的基础流模型,并将其自蒸馏为一个 CFM,该 CFM 能够在少至 4 个推理步骤内生成多样化的高质量文本,同时保持接近数据级别的 token 熵。此外,我们引入了半离散设置下 CFM 的似然界,并表明它们可用于在标准 LM 基准上对模型进行评分,取得与离散扩散方法同一区间的结果。

最后,我们揭示了在大规模训练这些模型时出现的一些挑战,并就损失加权与时间调度提供了规范性见解。

  • † 牛津大学
  • ** 在 Apple 期间完成的工作

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com