# 小米开源 MiMo-V2.6 权重，但我会先用 API 测试

**Summary:** 小米发布了采用 MIT 许可证的 MiMo-V2.6 权重，但官方 Pro 版本的部署方案假设你拥有相当规模的基础设施。在为自托管集群定价之前，我会先测试低成本的 API。

- Canonical: https://markhuang.ai/zh/news/mimo-v2-6-open-weights-api-first
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-21
- Section: News
- Tags: 小米 MiMo, 开源权重, AI 基础设施
- Source: [Xiaomi MiMo](https://mimo.xiaomi.com/mimo-v2-6)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个开放式液冷 AI 计算系统填满了数据中心，一根线缆将其连接到小型访问终端](https://cdn.markhuang.ai/news/mimo-v2-6-open-weights-api-first/hero.webp)

*MiMo-V2.6 足够开放，你可以审查它、操作它。但这份自由背后的机器，依然庞大。*

[小米 MiMo-V2.6 发布页面](https://mimo.xiaomi.com/mimo-v2-6)把上周那场公开训练，变成了两个可以下载、MIT 协议的模型。MiMo-V2.6-Pro 总参数 1.02 万亿，激活参数 420 亿；Flash 总参数 3090 亿，激活参数 150 亿。两者都支持文本、图像、视频和音频输入，小米给出的上下文窗口是 100 万 token。

这基本补齐了我之前想看的东西。小米只晒训练账单、不给完整方案的时候，我是存疑的。现在权重、模型卡片、架构、部署命令、技术报告、托管端点都摆出来了。但我还是会先从 API 开始——开源是真的，要不要自己运维是另一回事。

## 小米补齐了缺失的交付物

9 月 16 日我写过，[实时仪表盘让 MiMo-V2.6 的账单比配方更清楚](https://markhuang.ai/news/mimo-2-6-live-training-bill-not-recipe)。那时候我能看到成本、重启次数、检查点变化，但看不到模型卡片、许可证、架构，也没有权重可以下载。这次发布基本解决了这些问题。

[Pro 模型卡片](https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL)和[Flash 模型卡片](https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL)都标了 MIT 许可证。各自的 MoE 架构、激活参数量、多模态编码器、上下文长度、评测表、部署示例都写得清清楚楚。这些够我上手了。光说“以后会开源”是不够的。

小米还表示会放出技术报告、训练环境和强化学习代码。我自己还没复现过这次训练，放出组件也不等于外部团队能重新跑出同样的检查点。但至少，研究人员和运维团队现在有了可以审查的实质材料。“东西在哪？”这个问题，已经不再是合适的质疑了。

## 许可证变了，运营成本还在

下载权重之前，我会先看 Pro 的部署示例。小米官方的 SGLang 命令用了 16 路张量并行、2 路数据并行、16 路专家并行，跑在两个节点上。vLLM 示例用的是 8 路张量并行。这些只是示例配置，不是官方给出的最低硬件要求，但哪个都不是普通工作站能轻松跑起来的。

Flash 把总参数从 1.02 万亿降到了 3090 亿，规模确实小了不少，但它依然是个大模型。对于需要掌控部署方式、模型修改或数据流向的团队，权重很重要。但如果一个开发者只是想试试 MiMo 在实际任务上表现如何，自己部署只会把一次简单的测试变成一场基础设施折腾。

> **Info:**
>
> 我会先用托管 API 跑 Flash 和 Pro，用同一套提示词和验收标准。只有当控制需求、持续高利用率或数据政策真的需要时，才会考虑自托管。

托管 API 的价格让这条路径很难忽视。MiMo-V2.6-Pro 每百万未缓存输入 token 0.435 美元，每百万输出 token 0.87 美元；Flash 分别是 0.14 美元和 0.28 美元。缓存命中的输入更便宜。这些价格没算我的评测时间，也没算 agent 跑飞的损耗，但已经便宜到——在拿到质量结果之前，我根本不需要先想硬件方案。

## 评测数字换个口径就变

小米说每个模型跑了 30 轮强化学习，总共约 75 万条轨迹。Flash 训练成本据称约 85 万美元，Pro 约 262 万美元。在实时训练的 DeepSWE v1.1 评测上，Flash 从 48.8 涨到 65.68，Pro 从 58.4 涨到 72.57。

但正式发布的模型卡片上，Flash 在 DeepSWE v1.1 的分数是 67.9，Pro 是 71.9。这不代表哪张表有问题，只是说明我不该把检查点仪表盘和发布评测当成同一个可以直接比较的数字。模型卡片还显示不同任务之间差异很大：Pro 在 Terminal Bench 2.1 上拿了 89.9，在 Terminal Bench 4.0 上只有 34.9。

小米说 Pro 是"最强开源模型"，这个说法就是在这里说服不了我的。依据是 Artificial Analysis Intelligence Index 的 46.32 分。综合指数能告诉你这个模型在行业里大概什么位置，但没法告诉我 MiMo 能不能干净地完成一次迁移、能不能正确调用我的工具、会不会给 reviewer 留下一笔昂贵的修复账单。

社区反馈现在下结论还太早。[Hacker News 上关于实时训练的讨论](https://news.ycombinator.com/item?id=49732850)，得专门澄清那六天是强化学习后训练，不是从头训练整个模型。新的[LocalLLaMA 帖子](https://www.reddit.com/r/LocalLLaMA/comments/1wmntwv/xiaomimimomimov26prorl_hugging_face/)也主要是初步关注。真正有分量的，还是独立团队在实际工作负载上的报告。

## 先买证据，再想硬件

我的第一轮测试会用更便宜的 Flash 端点，跑一组有明确验收标准的仓库任务。我会记录完成了多少、修了几轮、延迟多少、花了多少 token、花了多少时间看结果。没过的任务再丢给 Pro 跑一遍。这个对比能回答两个最直接的问题：大模型能不能改变结果？省下来的人力值不值那个差价？

跑完这些，我才会考虑本地部署。需求稳定、基础设施到位的公司，算出来的账可能不一样——尤其是输入数据不能出内网的情况。MIT 许可证和可下载的权重让这个选择成为可能。但集群还是要花钱买、花钱运维、还得让它一直忙着。

MiMo-V2.6 的发布比我之前看实时仪表盘时的预期好。小米在一场公开的、混乱的后训练之后，拿出了实打实的交付物，这值得肯定。但对大多数团队来说，第一步还是先跑一个小规模的 API 实验，看看这个模型值不值得给它配一台专属机器。
