# 小米发布并开源 MiMo-V2.6 系列，Pro 与 Flash 双版本，API 价格与前代持平

- 来源：IT之家（RSS）
- 发布时间：2026-09-22 07:05
- AIHOT 分数：79
- AIHOT 标记：同事件
- AIHOT 链接：https://aihot.news/items/cmubvi9a804ohro99sfsvkd9m
- 原文链接：https://www.ithome.com/1/005/496.htm

## AI 摘要

小米发布并开源 MiMo-V2.6 系列，含 Pro 与 Flash 两个原生全模态模型。MiMo-V2.6-Pro 在 AA 智能指数 v4.3.2 取得 46 分。

## 正文

IT之家 9 月 22 日消息，小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列，包含 Pro 与 Flash 两个原生全模态模型。

小米称这是其探索 RSI（递归自我改进）路径的关键一步，通过规模化扩展强化学习算力，让模型在持续的探索与反馈中拓展智能边界。

得益于 RL 算力的扩展，MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index（AA 综合智能指数）v4.3.2 中取得 46 分，超过 Kimi K3（44 分）和 GLM-5.3（45 分），成为当前 AA 指数上排名最高的开源权重模型，较其前代 MiMo-V2.5-Pro 的 26 分高出 20 分。

小米官方同时说明，该模型与 Claude Fable 5.1 和 GPT-6 Astra（均为 53 分）等顶级闭源模型相比仍有差距。

在 RL 训练阶段，MiMo-V2.6 可能是目前国产开源模型中投入 RL 算力最多的模型之一。Pro 与 Flash 训练历时不到 6 天，成本分别约 262 万美元与 85 万美元，各完成 30 步，累计约 75 万条轨迹。

训练任务平均通过率分别相对提升 25% 和 12%，样本外的长程软件工程评测基准 DeepSWE v1.1 分别提升约 17 分（48.8 至 65.7）和约 14 分（58.4 至 72.6）。

本次训练从三个维度扩展 RL 算力：更大的 Batch 与更高吞吐，单次更新使用 1568 个样本，支持 100 万上下文长度训练，单步训练 Token 达 3.5 至 3.7B；更多任务与复杂环境，构建覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系；更大的 Grader 算力，通过 Group 内相对比较为长程 RL 任务提供更精准的奖励信号。

能力扩展上，MiMo-V2.6 融合了 3D 空间推理、多模态感知与计算机操作能力。在游戏开发中，用户输入图片、视频或文字后，模型可将需求拆解为多个任务，由多智能体协作完成 3D 场景搭建、交互逻辑编写与视觉验证。在具身仿真环境中，MiMo-V2.6 可直接以多视角相机画面为输入，通过视觉反馈闭环控制 Franka Panda 机械臂，完成物体抓取、颜色匹配与精准放置。

IT之家注：全模态模型指可同时处理文本、图像、视频和音频等多种输入形式的模型。

科研方面，MiMo-V2.6-Pro 协助研究人员完成了全氟和多氟烷基物质（PFAS）吸附用金属有机框架（MOF）材料的设计方案筛选，并在 Lean 4 中完成了 Li-Yorke 经典论文《周期三蕴含混沌》原始主定理的完整形式化，形成 6000 余行 Lean 源码，完整证明通过 Lean 内核核验。模型未接受过针对 Lean 的专项后训练。

MiMo-V2.6 系列沿用 V2.5 系列的 API 定价：Flash 为每百万词元输入 1 元、每百万输出 2 元；Pro 为 3 元和 6 元，并提供 99% 缓存折扣。在同等智能水平下，价格仅为海外模型的 1/20 至 1/60。

伴随新模型发布，MiMo Desktop 桌面客户端（支持 Windows 与 Mac）及会员订阅方案同步上线，订阅会员即可使用 MiMo-V2.6-Pro 和 Flash 模型，也可配置自己的 API Key 使用客户端。

MiMo Desktop 同步上线 MiMo-V2.6-Pro 的 UltraSpeed 超高速模式，提供最高 20 倍的推理速度。

MiMo-V2.6 系列已上线 Xiaomi MiMo 开放平台。原邀测活动将在 1 周后结束，已获得邀测资格的用户切换模型名称后方可继续使用。

同时，小米全面开源 MiMo-V2.6-Pro、Flash 模型权重与技术报告，同步开放 MiMo-V2.6-Distill-Qwen-9B 及配套 RL 研究资源，分享经过验证的训练实践，以下是详细开源内容：

7k+ 高质量 RL 任务环境：覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务。以 MiMo-V2.6-Distill-Qwen-9B 为起点展开 RL 训练，在 11 项评测中均较 SFT 基线取得提升：SWE-bench Verified 从 61.1 提升至 66.2，MiMo Cyber Bench 从 31.3 提升至 47.0，Terminal Bench 2.1 从 37.1 提升至 52.8，MiMo Visual Coding 从 64.0 提升至 72.4；

端到端 RL 训练框架：基于 verl、uni-agent 和 mini-swe-agent，覆盖环境交互、轨迹采集、奖励评估与策略优化的完整训练流程。结合开放的模型与任务环境，支持社区围绕训练算法、奖励机制和 agent harness 开展研究与迭代；

轻量可组合的 Harness：开源极简 mini-harnesses，将系统提示、工具与上下文管理解耦，构建多样且可控的训练配置。通过 Multi-Harness Training，能够将多样性和整洁性纳入 RL 训练，提升模型在不同框架、包括未见框架上的泛化能力，支持社区自由组合框架组件、拓展训练配置，持续探索新的研究方向。
