# 蚂蚁百灵发布 Ling-3.0-flash：124B 总参数、5.1B 激活参数，智能密度超越 1T 级旗舰

- 来源：蚂蚁百灵：Developer Blog（网页）
- 发布时间：2026-07-24 00:00
- AIHOT 分数：55
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cms3889p308xrro3fqkm5rabd
- 原文链接：https://developer.ant-ling.com/zh-CN/blogs/ling-3.0-flash-release

## 精选理由

蚂蚁把124B模型的激活参数压到5.1B，还敢对标上代1T旗舰，如果实测不翻车，这个智能密度对端侧和低成本部署是个真信号。

## AI 摘要

蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash，总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。

## 正文

今天，我们正式发布百灵新一代原生混合推理模型 Ling-3.0-flash。

相比上一代 1T 级旗舰思考模型 Ring-2.6-1T，Ling-3.0-flash 的总参数量为 124B（约为 Ring-2.6-1T 的 12.4%），激活参数量仅为 5.1B（约为 Ring-2.6-1T 的 8.1%），却实现了全方位的能力对标甚至超越。这不仅是一次参数量级的重构，更是一场 paradigm shift（范式转移）——模型获取智能的方式，不追求单纯的规模堆砌，而更关注于对每一寸算力与状态的高效压榨，追求”智能密度”的极致提升。

Ling-3.0-flash 的能力跃迁并非来自参数规模扩张，而源于底层架构升级与 Agent 定向优化的双轮驱动：一方面，原生混合线性注意力、细粒度 KDA 状态记忆与 1/64 稀疏 MoE 协同提升了参数向实际能力的转化效率；另一方面，面向生产力场景的定向打磨强化了模型在复杂规划、多轮工具调用与长程任务交付中的核心战力。在两者的共同作用下，模型以极低体量展现出向更大体量模型对标甚至越级挑战的可能，让高性能与高性价比真正兼得。

具体而言，Ling-3.0-flash 的核心改进体现在如下几个方面：

混合线性架构，原生进化： 从预训练伊始即采用原生混合线性注意力架构（5:1 交替堆叠 KDA 与 MLA），并升级全新 KDA 细粒度对角门控与 1/64 稀疏 MoE。在 124B 总参数、5.1B 激活参数规模下，实现了长上下文效率、状态记忆与计算成本的协同跃升。

极致智能密度，越级挑战： 追求”快、省、可落地”的智能密度与智效比极限，在直面更大尺寸竞对 SOTA 及上一代旗舰时实现性能越级。仅需 5.1B 激活参数即可提供卓越的传统推理、指令遵循与长文本能力，全面赋能复杂 Agent 场景的高效落地。

Agent 全面进化，长程闭环： 围绕真实生产力场景深度打磨，扩展 10,000+ 可交互训练环境，实现 Coding、General 与 Deep Research Agent 任务的全程闭环，做到”能力强、响应快、协同稳”。同时创新接入 SGLang HiCache + Mooncake 分级缓存架构（物理双池、集群共享 L3），使长程交互无需重算，长输入下 TTFT 降低 60% 至 80%+。

01 Ling-3.0 架构升级：124B 释放 1T 级能力

Ling-3.0 系列模型在架构设计上实现系统性升级，深度融合长上下文计算、状态记忆与专家路由优化，以更低的单 Token 激活规模承载并转化更大容量的知识与能力。

Hybrid-linear：原生混合线性注意力架构

不同于 Ling-2.6 依赖架构迁移进行预训练改造，Ling-3.0 从预训练伊始即采用原生混合线性注意力架构，以 5:1 的比例交替堆叠 KDA 线性注意力层与 MLA 层（每 6 层包含 5 层 KDA 和 1 层 MLA）。该设计使全链路模型组件在整个训练周期内深度协同优化，在长上下文效率与模型能力之间实现更优平衡。

Ling-3.0 将上一代的 Lightning Attention 升级为 KDA（Kimi Delta Attention）。KDA 在 Delta Rule 的状态更新中引入细粒度对角门控，赋予不同特征通道独立的保留、衰减与写入控制能力。这一机制显著提升了有限状态记忆的控制精度，使模型在处理长文档、大型代码库和复杂资料包时，能够精准维护跨段落、跨步骤的关键信息，为长上下文检索、信息整合和持续推理奠定坚实的架构基础。

基于 Ling Scaling Law，更低的专家激活比例可带来更高的”效率杠杆”，即以更少的实际计算获得更高的等效模型能力。因此，Ling-3.0 将每个 Token 的专家激活比例由前代的 1/32 进一步降低至 1/64，以极低的计算消耗驱动模型能力的跃迁。

综上，原生混合线性注意力、KDA 与稀疏 MoE 三者深度协同，大幅提升了参数规模、计算开销与模型能力之间的转化效率，为 Ling-3.0-flash 在 124B（激活 5.1B）规模下的跨越式发展提供了坚实的架构支撑。

以极致智能密度，探索能力边界与落地极限

在上一代 flash 模型对智能密度与智效比极致探索的基础之上，Ling-3.0-flash 持续全面进化。我们不求单纯的”大而全”，而是专注于在”足够强”的前提下，把”快、省、可落地”做到极致，不断突破模型能力的上限与智能密度的绝对边界。面对更大尺寸的 SOTA 模型及上一代旗舰 Ring-2.6-1T，Ling-3.0-flash 在多项关键指标上展现出不逊色甚至更优的越级表现：

核心能力全面对标，性能实现越级。 Ling-3.0-flash 在传统推理、指令遵循与长文本交互上展现出向更大体量模型对比的底气，不仅全面覆盖数学、传统逻辑与代码等核心复杂场景，精准驾驭多约束及智能体环境下的严苛指令，更能从容支撑海量上下文处理，保障长周期、多轮次深度交互中复杂业务逻辑的持续推进。

多场景深度适配，Agent 扎实落地。 围绕当下最炙手可热的 Agent 场景，Ling-3.0-flash 展现出极高的场景契合度，做到”能力强、响应快、协同稳”。无论是深度覆盖代码生成、多文件重构与结果验证的 Coding Agent，具备出色任务规划、工具组合与动态调整能力的 General Agent，还是专注于多轮检索、跨源整合与证据闭环的 Deep Research Agent，模型均能扎实落地，以卓越的闭环执行力从容驾驭各类复杂生产力场景。

极致智能密度，兼顾高性能与高性价比。 在追求高性能的同时，Ling-3.0-flash 在智能密度与智效比的维度上追求极致。凭借极少的总参数与激活参数，模型在多项测评指标中达到或超过大尺寸 SOTA 与上一代旗舰 Ring-2.6-1T，更将推理开销压至极低。这种极致的智能密度转化为实际应用价值，意味着更短的生成时延、更快的首字响应（TTFT）与更低的 API 调用成本，全面赋能高频线上服务与真实 Agent 的落地。

评测默认开启思考模式，计算均分时使用所有模型都有评测得分的部分。

智能密度（IQ/显存成本） = 平均榜单分数 ÷ 总参数量（B），代表”单位显存下的智能水平”，衡量起步部署硬件门槛

智效比（IQ/计算成本） = 平均榜单分数 ÷ 单 token 激活参数量（B），代表”单位计算算力下的智能水平”，衡量高并发服务能力

激活参数决定单次推理计算量与服务吞吐：Ling-3.0-flash 仅需 5.1B 激活参数即可提供具有竞争力的智能分数。

02 Agent 全面进化：能力强、响应快、协同稳

值得一提的是，Ling-3.0-flash 还围绕真实生产力场景，对 Agent 能力、运行效率与协同架构进行了系统升级。面对复杂约束和长程任务，Ling-3.0-flash 能够持续规划、调用工具、响应环境反馈，并根据中间结果动态调整执行路径，最终完成可验证的任务交付。与此同时，我们通过分级缓存和 Multi-Agent 协同架构，进一步提升了长会话交互效率，以及复杂任务执行的能力上限与稳定性。

能力强：复杂任务，持续优化

在训练方面，我们将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 10,000 余个，并持续提升环境的质量、多样性和任务难度。针对长程 Agent 任务，我们在 RL 阶段引入完整执行轨迹复盘和步骤贡献评估机制，为任务执行过程生成更细粒度的步骤级训练信号，帮助模型更高效地从环境交互、失败反馈和自主纠错中学习。

由此，相比上一代旗舰 Ring-2.6-1T，Ling-3.0-flash 的 Agent 能力实现全面提升，在多项指标上对齐甚至超越体量达其 2～3 倍的开源 SOTA 及行业领先闭源模型，展现出面向真实生产力场景的任务执行与交付能力。这种能力也经受住了真实 APP 生成需求场景的检验，Ling-3.0-flash 在 MiniAppBench 上的通过率达到 25.3%，与总参数规模约为其两倍的开源 SOTA 模型达到同等水平。MiniAppBench 要求模型仅根据一句用户需求，生成完整可用的 APP，参与评测的 16 个主流模型平均通过率仅为 17%。

响应快：长程交互，无需重算

Agent 任务越复杂，对话轮次越多，上下文也越长。传统推理服务中，一旦本地缓存被新请求挤出，或同一会话被调度至其他计算节点，系统往往需要重新处理前面数万 Token 的上下文，导致首 Token 延迟（TTFT）快速上升。为此，Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系，让已有上下文能够跨层级存储、跨节点共享和按需恢复，将缓存从”实例私有”升级为”集群共享”，最大限度减少长上下文的重复计算。实测显示，在长输入场景下，命中 L3 Cache 相比直接重新计算，可将 TTFT 降低 60%～80% 以上。

从本地缓存到集群共享，从重复计算到分层复用，Ling-3.0-flash 显著提升了长会话的 Token Efficiency。对于 Coding Agent、长文档问答等需要持续携带完整历史的场景，这意味着更快的任务接续、更低的计算开销，以及更加流畅稳定的交互体验。

Multi-Agent 协同稳：多元智能，相互校验

面对复杂 Agent 任务，传统的 Single-Agent 推理链路容易受到决策漂移、局部误判和容错能力不足等问题影响。为此，Ling-3.0-flash 升级了多智能体协同架构 “Ling Multi-Agent”。我们在 SearchSwam “委派智能（Delegation Intelligence）“范式的基础上，进一步研究了 Multi-Agent 架构的 Scaling 机制。不同 Agent 可以围绕任务进行多层级分工，并通过交叉验证、信息补充、协同纠错与竞争赛马，降低单一推理路径带来的偏差。

如下图，在 BrowseComp 和 BrowseComp_zh 上，通过”Ling Multi-Agent”架构可获得 log-linear 的性能提升。未来，我们将把这一范式拓展到更广泛的任务场景，持续探索更大规模智能体协同的能力边界。

03 生产力场景：从 Agent 评测到真实系统执行

Ling-3.0-flash 原生支持 256K 上下文，并可扩展至 1M；同时针对 Agent 场景进行了专项优化，使模型能力不止体现在评测指标上，也能更好地转化为真实系统中的任务执行能力。

Blender 自动化建模

Ling-3.0-flash 已经突破了平面代码的限制，可以直接介入 3D 设计世界，成为你随时可调用的虚拟三维建模助理。

在 Blender 使用场景中，Ling-3.0-flash 通过 Blender MCP 接口控制 3D 软件，自动编写 Python 脚本在一句话指令下搭建包含高架路网、摩天大楼与材质的城市场景，最后设置相机路径并渲染输出航拍视频。

在生成过程中，Ling-3.0-flash 体现出了复杂 3D 几何空间推理、Blender Python API 控制以及长程 MCP 工具调用等能力。

视频 · 前往原文观看

自主多智能体科研大盘

拿到一个课题不知从何下手？Ling-3.0-flash 可以扮演多重角色快速进行文献检索、数据质询，并生成论文，合成你需要的 PPT。

Ling-3.0-flash 搭建的自主多智能体科研大盘，支持跨角色（Scientist、Data Analyst、CrossValidator、Archivist、Writer）自主进行假说推演、文献检索、数据质询打回、黄区现场研讨与自动化成果论文及 Slide 报告合成。

视频 · 前往原文观看

办公软件自动化

如果你有一堆凌乱的立项草稿和预算数据需要梳理，不需要手动调格式和套公式，模型能像私人秘书一样帮你完成这些日常核算工作。

面向真实的办公场景，Ling-3.0-flash 能够基于 Office MCP 接口，由 AI 直接读取并排版 Word 提案（调整格式并生成目录），同时核算 Excel 财务数据（处理 SUMIF 公式与透视表汇总），最终输出规范文档与 PDF 滚动长图。

过程中表现出了 Ling-3.0-flash 对多模态文档解析、Office API 精细控制与自动化长程执行的稳定性。

视频 · 前往原文观看

批量美学网页生成

大模型不仅是代码工具，更是设计大师。即使没有任何图片素材，Ling-3.0-flash 只凭代码，就能批量为你搭建出极具视觉冲击力的前卫艺术网页。

Ling-3.0-flash 批量生成了数个现代设计流派页面（含包豪斯、波西米亚、酸性设计等，包含 Easy 到 Hard 渐进难度），在不依赖外部图片的前提下，纯靠 CSS 渐变、SVG 路径和排版布局还原流派质感。

不同风格的页面生成展现出了 Ling-3.0-flash 对视觉流派设计的理解力、极高质量的前端代码批量生成与无图美学排版能力。

视频 · 前往原文观看

网页版黑白极简电子琴与合成器

如果你需要一个多媒体应用来教学或了解，不需要买什么专业软件，可以让 Ling-3.0-flash 给你写一个。

Ling-3.0-flash 开发了一个网页版黑白钢琴电子琴，利用浏览器 Web Audio API 实现多种合成器波形选择与声音包络调校，并配合 Canvas 实时声波可视化动效。

过程中展现出了 Ling-3.0-flash 的代码开发、3D、多媒体生成等综合能力。

视频 · 前往原文观看

根据上下文生成营销文案

如何在已有信息里快速发现关键信息，并生成可对外发布的营销文案？如果你没有精力处理，Ling-3.0-flash 可以帮你针对不同平台的特征快速整理出合适的文案。

房地产销售给运营发邮件，通过接入 Ling-3.0-flash 结合上下文，并快速生成适合 Instagram、X/Twitter、Linkedin 的营销文案。

视频 · 前往原文观看

自动规划课程安排

课程时间安排繁琐而复杂？在没有时间处理的情况下，Ling-3.0-flash 可以像一位私人秘书，帮你实现自动回复与更新课程安排。

Ling-3.0-flash 通过联合 OpenClaw，在收到课程时间询问时，自动查看日历中的课程安排，并自动回复自选的课程时段，同时向咨询者发送确认信息，对日历进行更新。

视频 · 前往原文观看

04 局限性与未来计划

在追求极致智能效率与高性价比落地的同时，基于当前的架构设计与权衡取舍，Ling-3.0-flash 目前也客观存在以下局限性：受限于极致压缩的参数规模，模型的资源倾斜主要聚焦于智能体与核心推理能力，因此在广度知识储备上做了一定妥协。同时，多语言控制仍有提升空间，在长对话或高压交互场景下偶发会出现中英混杂现象。

面向未来，我们将聚焦以下方向持续迭代：通过精细化知识注入与多语言对齐策略进行定向优化，补齐短板；在此基础上，进一步拓宽并深化更复杂的智能体场景，攻克长链条、多步骤的长程任务执行难题，持续探索参数规模下的极致智能效率边界。

05 即刻接入

为方便更多开发者快速体验 Ling-3.0-flash，我们将在 OpenRouter 与百灵官方平台同步开放限时免费 API 调用，免费期截至 8 月 3 日 23:00（北京时间）。

OpenRouter 体验地址： https://openrouter.ai/inclusionai/ling-3.0-flash:free

Ling-3.0-flash 模型权重将在免费期结束后正式开源，敬请关注。
