蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

蚂蚁 inclusionAI:HuggingFace 新模型·2026-08-11 20:10·32天前
AI 导读

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。

蚂蚁 inclusionAI:HuggingFace 新模型
精选
64AI 编辑部评分,满分 100

蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

2026-08-11 20:10· 32天前
AI 导读

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。

推荐理由

把训练中间态作为可下载 checkpoint 开放,配合 WSM 合并替代学习率衰减,做继续预训练或 MoE 研究时可从中间阶段开始,省去重复前置训练成本。

正文 · AI 翻译

Image 1

简介

我们已开源 Ling-3.0 系列,这是我们迄今为止最高效的语言基础模型家族。为支持研究与社区驱动的创新,我们发布训练过程中的一系列检查点,如下所示:

模型 预训练 中训练 合并(即 WSM
Ling-3.0-tiny Ling-3.0-tiny-base-30T Ling-3.0-tiny-base-midtrain Ling-3.0-tiny-base
Ling-3.0-flash Ling-3.0-flash-base-30T Ling-3.0-flash-base-midtrain Ling-3.0-flash-base

这些检查点对应训练过程的不同阶段:

  • 预训练检查点已完成大规模预训练,但尚未经过中期训练、WSM 合并(或学习率衰减)或后训练。
  • 中期训练检查点已完成中期训练,但尚未经过 WSM 合并(或学习率衰减)或后训练。
  • 合并检查点已在中期训练检查点的基础上经过 WSM 合并(或学习率衰减),但尚未经过后训练。

发布这些检查点是为了支持持续预训练、微调以及进一步研究。关于后训练模型,请参见 Ling-3.0-tinyLing-3.0-flash

模型概览

核心特性

  • 高度稀疏(1/64)MoE 架构:512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家。这使其具备广泛的模型能力,同时每个 token 仅激活 5.1B(非嵌入)参数;
  • 原生混合线性注意力: Ling-3.0 系列从预训练一开始就采用原生混合线性注意力架构,将 KDA 与 Gated MLA 相结合,从而实现对长上下文输入的高效处理。
  • 预热-稳定与合并 我们以加权检查点合并取代了传统的学习率衰减。通过消除衰减阶段,我们的 Base Model 更适合持续预训练和动态数据扩展,同时还能离线探索不同的衰减曲线,而无需为每种策略重新运行昂贵的实验。
  • 无缝扩展: Ling-3.0-tiny-base 与 Ling-3.0-flash-base 共享相同的训练配方,使社区能够先在 Ling-3.0-tiny-base 上进行实验,然后将经过验证的训练策略扩展到更大的 Ling-3.0-flash-base。
模型类型 Base(中期训练的最终检查点)
架构 混合线性 MoE
参数规模 总计 124B,激活 5.1B(非嵌入)
Transformer 层数 35 KDA + 7 Gated MLA(5:1)
稠密层数量 2
路由专家数量 512
共享专家数量 1
激活专家数量 8
注意力头数 32
隐藏层维度 2560
专家中间层维度 768
稠密中间层维度 6144
词表大小 157,184

Image 2

基础模型评估

为了系统性地评估基础模型的能力,我们使用了一套全面的基准测试套件,覆盖数学、编程、推理、多语言理解和长上下文理解等多个关键领域。预训练基础检查点(即 Ling-3.0-flash-base)的性能对比如下:

Image 3

预期用途

推荐用例:

  • 持续预训练
  • 中期训练
  • 面向领域适配的监督微调
  • 偏好优化与 RL 后训练 知识蒸馏研究
  • 长上下文与 MoE 系统研究

不推荐直接用于:

  • 直接面向终端用户的对话部署
  • 未经额外对齐和评估的安全关键型应用
  • 未经后训练和任务特定验证的生产环境使用

使用方法

关于微调示例,请参考我们的 ling-cookbook

常见问题

如有任何问题,欢迎随时发起讨论。

许可证

本模型基于 MIT License 发布。

包含 inclusionAI/Ling-3.0-flash-base-midtrain 的合集

Ling 3.0 •13 个项目•17 分钟前更新• 15

inclusionAI/Ling-3.0-flash-base-midtrain 的论文

来源:蚂蚁 inclusionAI:HuggingFace 新模型· huggingface.co