小米开源 MiMo-V2-Flash:309B 总参数 MoE 模型,主打推理、编码与智能体
Xiaomi MiMo-V2-Flash
小米于 12 月 16 日发布并开源 MiMo-V2-Flash,一款 309B 总参数、15B 激活参数的 MoE 基础语言模型,权重以 MIT 许可上传 Hugging Face。
官方完整披露了架构、MTP 推理加速与 MOPD 训练范式细节和基准成绩,可据此评估其性价比与部署可行性。
发布
隆重推出 MiMo-V2-Flash
2025年12月16日
今天,我们发布并开源 MiMo-V2-Flash。它是一款强大、高效且极速的基础语言模型,在推理、编程和智能体场景中表现尤为出色,同时也可作为日常任务的优秀通用助手。
MiMo-V2-Flash 现已在全球范围内上线:
推理、编程与智能体
MiMo-V2-Flash 是一款混合专家模型,总参数量 309B,激活参数量 15B,采用交错滑动窗口与全注意力的混合注意力架构,使用激进的 128 token 滑动窗口和 5:1 的混合比例。凭借如此轻量的模型架构,我们实现了卓越的智能水平。
在数学竞赛 AIME 2025 和科学知识基准 GPQA-Diamond 中,MiMo-V2-Flash 位列开源模型前 2 名,展现出强大的推理能力。在软件工程能力的 SWE-bench Verified 和多语言基准测试中,MiMo-V2-Flash 在所有开源模型中排名第一,并与全球顶尖闭源模型不相上下。该模型专为推理、编程和智能体场景打造。它支持混合思考模式,允许用户切换模型是“思考”还是即时作答;它可一键生成可用的 HTML 网页,与 Claude Code、Cursor、Cline 等 vibe-coding 脚手架无缝协作;并提供超长 256k 上下文窗口,使其能够完成数百轮智能体交互和工具调用任务。
让 MiMo-V2-Flash 融入你的工作流,为你构建所需。
Web 开发展示
提示词 “请用 HTML 生成一个美观、可用的 macOS 模拟操作系统。要求如下: - 终端必须能正常工作,并支持常见命令,包括 cd、mkdir 等。 - 背景不应是纯色;最好使用一张好看的图片,并且可以更换壁纸。 - Finder 应能正常打开,允许在文件夹之间切换,并支持创建新文件。 - 界面应包含基本的 macOS 风格桌面图标。”
认识 MiMo
MiMo-V2-Flash 不仅仅是一个只会写代码和做数学的专家——它可以成为你日常任务的助手,一个可以交流想法、激发灵感的伙伴。
将效率推向极限
MiMo-V2-Flash 专为极致效率而设计。它以每秒 150 token 的速度提供极速推理,同时保持每百万输入 token 0.1 美元、每百万输出 token 0.3 美元的超低成本——使其成为市面上最具性价比的高性能模型之一。
价格与速度对比
价格按输入与输出 3:1 的比例混合计算。数据来自 Artificial Analysis。
效率源自为高吞吐推理而设计的创新架构改进。MiMo-V2-Flash 采用了 Global Attention(GA)与 Sliding Window Attention(SWA)1:5 的混合结构。我们的大量实证结果表明,SWA 简单、高效且易于使用,在通用任务、长上下文负载和推理方面均比 Linear Attention 带来更好的整体性能。它还提供固定大小的 KV cache,使其易于与现有的训练和推理基础设施集成。我们重新定义了并行解码,以实现极高的输出 token 吞吐量:通过引入 Multi-Token Prediction(MTP)训练,我们提升了基础模型的能力,并在推理期间并行验证 MTP token。
Multi-Token Prediction
验证
← 来自前一个 MTP 的草稿
token i
token i+1
token i+2
token i+3
↓↓↓↓
Language Model(验证)
↓↓↓↓
token i+1
接受
token i+2
接受
token i+3
拒绝
token i+4
放弃
生成
token i+3
token i+4
token i+5
↓↓↓
MTP 1
MTP 2
MTP 3
↓↓↓
token i+4
token i+5
token i+6
草稿
MiMo-V2-Flash 将 MTP 作为原生草稿模型用于自推测解码,带来真实部署中的加速。由于算术强度低,LLM 解码本质上是内存受限的。批级并行通常用于提高 FFN 的算术强度,但对注意力计算没有帮助,因为每个请求都维护自己的 KV cache。相比之下,MTP 通过生成多个草稿 token 提升了 FFN 和注意力的算术强度,随后由主模型并行验证这些 token。这种方法在不增加 KV cache I/O 的情况下实现了 token 级并行。在 MiMo-V2-Flash 中,MTP 块被刻意保持轻量,以防止其成为新的推理瓶颈。它使用稠密 FFN(而非 MoE)来限制参数量,并使用 SWA(而非 GA)来降低 KV cache 和注意力计算成本。尽管设计精简,MTP 模块仍实现了高接受率。在我们使用 3 层 MTP 的测量中,它达到了 2.8–3.6 个 token 的接受长度和 2.0–2.6× 的有效加速。
MOPD:一种新的后训练范式
在后训练阶段,为了高效扩展强化学习(RL)计算并增强模型的推理和智能体能力,我们提出了 Multi-Teacher Online Policy Distillation(MOPD)范式。其核心是一种高效的 on-policy 学习机制:在通过 SFT/RL 获得领域特定的专家教师后,学生模型从自己的策略分布中采样(rollout),并利用多个教师提供的稠密、token 级奖励进行优化。
MOPD 训练稳定且极其高效——仅需传统 SFT+RL 流水线不到 1/50 的计算资源,即可达到教师模型的峰值性能。
此外,MOPD 采用解耦设计,支持灵活集成新的教师和 ORM,并天然支持“教学相长”的闭环迭代:蒸馏出的学生模型可以进化为更强的教师,实现能力的持续自我提升。
评估
我们在广泛的基准测试套件上评估 MiMo-V2-Flash:
| 基准 | MiMo-V2 | Kimi-K2 | DeepSeek-V3.2 | Gemini-3.0 | Claude | GPT-5 |
|---|---|---|---|---|---|---|
| Flash | Thinking | Thinking | Pro | Sonnet 4.5 | High |
MiMo-V2-Flash 在大多数推理基准测试上达到了与 K2 Thinking 和 DeepSeek V3.2 Thinking 相当的性能,同时保持了具有竞争力的通用写作能力,可生成高质量的开放式回复。在长上下文评估中,我们的模型超越了 K2 Thinking——一个规模显著更大的全全局注意力 LLM,凸显了我们混合 SWA 架构强大的长上下文能力。
在智能体任务上,MiMo-V2-Flash 在 SWE-Bench Verified 上得分 73.4%,超越所有开源竞品,并接近 GPT-5-High 的性能。在 SWE-Bench Multilingual 上,该模型解决了 71.7% 的问题,成为软件工程领域能力最强的开源 LLM。在 τ²-Bench 的通用工具使用上,其各类别得分分别为 95.3(电信)、79.5(零售)、66.0(航空)。Terminal Bench 结果也显示出具有竞争力的分数。在搜索智能体评估中,MiMo-V2-Flash 在 BrowseComp 上得分 45.4,借助上下文管理进一步提升至 58.3。
开源
一如既往,我们将一切开源。阅读我们的技术报告了解完整的模型细节。
模型权重(包括 MiMo-V2-Flash-Base)已在Hugging Face上以 MIT 许可证发布。
在第 0 天,我们将所有推理代码贡献给了SGLang。我们与其团队紧密合作,并在LMSYS 博客上分享了关于 MiMo-V2-Flash 推理的见解。
让我们用 MiMo 来构建。从这里开始:API 平台 (限时免费!)
来源:小米 MiMo:官网发布与博客 · mimo.xiaomi.com