# 小米发布 MiMo-V2.6 系列，Pro 登顶开源模型榜，Anthropic 指其借 Claude 蒸馏数据

- 来源：The Decoder：AI News（RSS）
- 作者：Maximilian Schreiner
- 发布时间：2026-09-22 19:42
- AIHOT 分数：76
- AIHOT 标记：同事件
- AIHOT 链接：https://aihot.news/items/cmucm88at0bl9roed6q9izl13
- 原文链接：https://the-decoder.com/xiaomis-affordable-flagship-ai-leads-the-open-models-and-anthropic-says-claude-helped-get-it-there

## AI 摘要

小米发布 MiMo-V2.6 系列，旗舰 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得 46 分，居开源模型之首，价格为每百万输入 token $0.435、输出 $0.87。

## 正文

小米

要点

小米全新的 MiMo-V2.6-Pro 模型在当前的开放 AI 模型排行榜上位居榜首，而成本却远低于竞争对手。

小米通过扩大强化学习规模实现了这一性能跃升，并且公开了其工具和训练任务。

与此同时，Anthropic 指控小米通过 Claude 模型不当攫取数据，用于训练自家的模型系列。

小米发布了 MiMo-V2.6 系列，其旗舰模型在开放可用的模型中登顶排行榜，而每项任务的成本仅为竞争对手的一小部分。这一提升来自一轮大规模扩展的强化学习，不过该公司同时也被指控借鉴了 Anthropic 的 Claude。

据小米称，两款新模型中较大的 MiMo-V2.6-Pro 在分析机构Artificial Analysis的 Intelligence Index 上得分 46 分。这使其成为当前最强的开放可用 AI 模型，领先于 Kimi K3 和 Qwen 等竞争对手。真正令人惊艳的是价格：每百万输入 token 0.435 美元，每百万输出 token 0.87 美元。

按照 Artificial Analysis 的计算，单个测试任务成本仅约 0.13 美元，只是同等能力模型收费的一小部分。这使该模型处于所谓的智能与成本帕累托前沿。

图片：Artificial Analysis

Pro 是一个混合专家模型，拥有 1.02 万亿参数，每次请求仅激活其中 420 亿参数。与之并列的是更小、更高效的 MiMo-V2.6-Flash。

性能提升来自强化学习

小米将这一性能跃升归功于大幅扩展的强化学习（RL），即通过试错、反馈和奖励进行训练。该公司从三个维度扩展了这一阶段：每个训练步使用更多数据、更多样化的任务环境，以及更多用于评估解答的计算资源。

小米表示，这次运行耗时不到六天，Pro 的成本约为 262 万美元，Flash 约为 85 万美元。在 DeepSWE 编程测试中，Pro 的得分从 58.4 提升至 72.6，而 Flash 则从 48.8 上升至 65.7。

为了在这种规模下保持训练稳定，小米冻结了模型的内部分布机制，并增加了多层防护，以防止“奖励黑客”——即模型用来骗取奖励却并未真正解决任务的伎俩。

约 7,000 个带有自动评分器的任务

除了这些模型，小米还推出了一个速度特别快的变体，名为 Pro-UltraSpeed，输出速度最高可达 20 倍。最引人注目的是，该公司开放了其 RL 工具包，包括技术报告、完整的训练框架、一个用于进一步训练的较小模型，以及约 7,000 个现成的训练任务，这些任务配有自动评分器，涵盖软件开发、网络安全、办公工作和网页设计，另有约 1,000 个音乐创作任务。

这些任务来自多种来源。部分代码来自员工的真实 GitHub pull request 和用户查询，而其他任务描述则由语言模型生成。网络安全任务取材于 OSS-Fuzz，这是一个汇集了数万个真实软件漏洞的集合，而办公环境则是通过合成方式重建的。

刻意地开放，且正处于 Anthropic 的瞄准之下

这一开放姿态与Anthropic 仅两周前提出的指控形成了鲜明对比。在其威胁情报报告中，Anthropic 审查了 2025 年 12 月至 2026 年 8 月期间发现的 Claude 滥用案例，并点名了七家中国实验室与针对该模型的攻击活动有关：阿里巴巴、Moonshot AI、DeepSeek、智谱、小米、MiniMax 和商汤。

据称，这些实验室总共生成了约 1.9 亿次交互，以攫取 Claude 的能力来训练自己的模型，Anthropic 将这种技术称为非法蒸馏。

小米被点名。在一起标记为 GTG-16008 的案例中，Anthropic 在 2026 年 3 月和 4 月的 20 天里追踪了超过 40 万次交互，其中小米将其自家 MiMo 模型的用户对话和编码会话通过 OpenClaw 和 OpenCode 传给 Claude，目的是为未来模型丰富训练数据。该报告几乎没有记录用于教师模型内部蒸馏的早期训练数据和教师数据来自何处。

换句话说，报告称小米记录了其 MiMo 模型的用户对话，然后将其输入 Claude 以提取训练数据，而正是这些数据如今将它推上了开放模型排行榜的榜首。

MiMo
