# 小米直播 MiMo 2.6 训练过程：账单清晰，配方仍藏

**Summary:** 小米的 MiMo 2.6 实时仪表盘显示预估费用已超百万美元，经历六次重启，数据类别宽泛，检查点分数时有下降。这种混乱提供了有用证据，但无法替代模型卡。

- Canonical: https://markhuang.ai/zh/news/mimo-2-6-live-training-bill-not-recipe
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-16
- Section: News
- Tags: 小米 MiMo, MiMo 2.6, 强化学习, AI 透明度, 模型评估
- Source: [Xiaomi MiMo](https://mimo.xiaomi.com/rl/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![两条发光的 AI 训练走廊位于观察玻璃后方，中间是一个封闭的密封舱](https://cdn.markhuang.ai/news/mimo-2-6-live-training-bill-not-recipe/hero.webp)

*小米给两场大规模训练开了一扇窗，但隔着玻璃，能看到的终究有限。*

[小米 MiMo 2.6 强化学习仪表盘](https://mimo.xiaomi.com/rl/)正在直播 Pro 和 Flash 两组训练的运行数据，直接取自训练日志。我 2026 年 9 月 16 日打开页面时，实时估算显示两组训练的总花费已经超过 100 万美元。页面上还写着：Flash 跑完了 15 步，Pro 跑完了 10 步，中间一共重启了六次。

比起又一张精修过的发布 PPT，我更愿意看这个。实时运行把模型开发中最烧钱、最难看的中间阶段摊开给你看——分数上下抖动，基础设施出故障的时候账单照跑不误。这些信息公开出来当然有价值，但它还不是一份可复现的训练方案。我能看到训练在跑，却还远不够拿去复现，也不够用来评判最终模型。

## 波动本身才是看点

仪表盘追踪的指标包括 reward、policy loss、entropy、梯度范数、上下文长度、基础设施报错、耗时等等，还把采样任务拆成了代码、通用、网安、视觉和聊天几个类别。网站最核心的指标是 `avg@n`，小米的定义是：每个训练步里，每条 prompt 成功尝试的平均占比。

这条曲线并不好看。Flash 从第一步的 0.514 涨到第 15 步的 0.596，中间跌了好几次。Pro 起步 0.565，第 9 步摸到 0.604，第 10 步又掉回 0.590。两组训练都还在跑，最新的数据点说明不了什么。但至少能看出，强化学习是一场进行中的实验，而不是发布后那张平滑上扬的阶梯图。

我截图的时候，Flash 重启了一次，Pro 重启了五次。小米还挂了一条公告，说 Pro 因为某个节点的 VRAM 问题正在重启。这种细节在发布稿里很容易被藏起来，但留着它，工程师才能更清楚地了解这套系统是怎么跑出模型来的。

## 编码分数也会往回掉

小米目前只挂了一项离线评估：用 mini-swe-agent 跑的 DeepSWE v1.1，报的是三次运行的平均分。Flash 公布的分数从第 1 步的 48.67 涨到第 12 步的 60.77，但中间有些 checkpoint 反而比前一步低。Pro 在第 8 步达到 62.24，之前同样走得磕磕绊绊。

[DeepSWE 的公开仓库](https://github.com/datacurve-ai/deep-swe)介绍了 113 道原创软件工程题，覆盖五种编程语言。作者也把话说得很明白：这个 benchmark 测的是固定 harness 下的长周期代码库任务，不等于模型整体水平，更不等于厂商最终产品的编码能力。所以小米这张实时图只是 checkpoint 行为的有趣证据，不能拿来证明 MiMo 2.6 会是最强的编码 agent。

仪表盘最好看的时候，反而是后续分数掉下来的时候。一个发布数字会把 checkpoint 挑选和运行间波动都抹掉，让人误以为训练进展就是产品提升的铁保证。我在[那篇模型比拼的文章](https://markhuang.ai/news/model-build-offs-need-failure-rates)里说过同样的话：失误的分布和波动，比一座奖杯告诉我的东西多得多。

## 离审计还差得远

直播页面说 MiMo 2.6 系列即将推出，但架构、参数量、训练数据配方、许可证、安全评估、发布日期、model card——一个都没给。它列了几个宽泛的数据类别，也展示了每步的活动，但这些标签告诉我不了用了哪些数据集、怎么过滤的、哪些 reward signal 塑造了行为、上线前测了哪些风险。

不过这也许只是时间问题。这毕竟是个训练仪表盘，不是发布包。小米之前的 [MiMo 2.5 发布](https://mimo.mi.com/docs/en-US/news/latest/v2.5-open-sourced)后来放出了 MIT 许可的权重和基座模型，声称支持百万 token 上下文，也给了部署链接。我愿意给 MiMo 2.6 同样的机会，等它带着完整文档来。但不会因为一张实时图表看着挺开放，就提前把这些文档的功劳算给它。

[r/LocalLLaMA 的一个小帖](https://www.reddit.com/r/LocalLLaMA/comments/1wi9ebm/xiaomi_mimo_26_live_training_dashboard/)里，有人为这种透明度叫好，也有人对七位数账单配上 benchmark 下滑感到不安。这点讨论量远谈不上共识。不过那条怀疑的评论恰恰解释了为什么我会一直盯着这个页面：它展示了一个发布 PPT 里大概率不会出现的结果。

> **Info:**
>
> 实时仪表盘能当作训练过程的证据。最终的 model card、权重、评估产物和独立测试，才是关于模型本身的证据。

## 训练结束后，请把直播留下

我希望更多团队能这样公开训练记录。成本、重启、checkpoint 跳动、基础设施故障——这些东西让模型开发看起来没那么理所当然。小米在训练还可能翻车的时候就把细节摆出来，这一点值得肯定。

但真正的考验在发布那天。我会盯着看：具体有哪些模型变体、架构是什么、许可证怎么签、数据和 reward 方法怎么描述、安全结果如何、benchmark 设置是什么、评估产物能不能下载。我还希望直播仪表盘能带着时间戳一直留在那里，而不是被最终分数盖过去。

眼下，我能看到 MiMo 2.6 跑花了多少钱、曲线怎么走。至于能不能信任这个产品，得看训练结束后小米愿意拿出什么。
