# 小米直播 mimo-v2.6-pro 与 flash 后训练，作者推算每秒烧约10美元

- 来源：karminski-牙医 (@karminski3)
- 发布时间：2026-09-17 06:31
- AIHOT 分数：50
- AIHOT 链接：https://aihot.news/items/cmu4panhl02z4rokcdtgm1e6i
- 原文链接：https://x.com/karminski3/status/2100351980451635580

## AI 摘要

小米正在直播 mimo-v2.6-pro 和 flash 两模型的 Agentic RL 后训练，mimo-v2.6-pro 的 DeepSWE 得分为 62，低于 DeepSeek-v4.1-flash 的 74.2，仍处训练早期。

## 正文

1秒烧10刀! 小米正在直播模型训练!

首先注意同时在训练2个模型, mimo-v2.6-pro 和 flash, 这个无疑是进入后训练阶段了, 写着RL嘛.

然后注意它实际上是在进行 Agentic RL, 因为我们能看到衡量训练效果的测试集是DeepSWE, 不过从训练时间和得分来看, 还处于训练早期阶段.

目前mimo-v2.6-pro 的 DeepSWE得分是62, 而现在的头部模型比如DeepSeek-v4.1-flash 是 74.2. 所以训练处于相对早期.

另外注意看这个烧钱速度, 每秒至少10刀. 那么我们能否推算一下训练的用卡规模和预计的训练结束时间呢? 来.

首先注意这个数字(timing_s/outer_gen), 阶段10花费了58分钟, 这个阶段生成了多少token呢? (tokens · step 10) 22亿. 简单计算就能得出, 每秒要生成63万token.

而阶段10平均上下文长度是多少(ctx_total_length/mean)? 答案是89K.

这么长的上下文通常吞吐会下降很多, 我们按照H100来估算, 单卡吞吐在100-150tps 左右的话, 那么大概就需要4000-5000张H100. 注意这还只是训练pro用来解码的. 还有flash模型的, 算下来大概是2000-2500 张H100. 预估总卡量应该是6000-8000左右.

timing_s/outer_gen (生成/推理耗时)58分钟, timing_s/trainer_ops(反向传播计算耗时)：64 分, 正好差不多等于 timing_s/step(单步总耗时)：126 分钟. 所以推理和反向传播应该是同一批卡, 集群是先花 58 分钟全力做 Rollout 推理. 等 22.2 亿 Token 吐完, 环境打分完毕后, 这批 GPU 集群立刻切换角色, 花 64 分钟全力进行分布式长序列的反向传播和梯度更新. 所以用 Rollout decode 推测出来的卡量应该就是全量了.

另外要注意, 这训练的可是Agent能力, 所以注意下面的 env/active 数据, Pro 维持着 23,180 个活跃沙箱, Flash 维持着 37,786 个活跃沙箱. 所以同时有超过 60,000 个真实的 Linux/Docker 沙箱在并发执行代码和终端命令!

所以这么算下来, 每秒烧10刀, 是不是很合理了?

且慢, 还有其他数据, 一会给大家带来更详细的解读~

#mimov26 #mimo #mimov26pro #mimov26flash
