# 通义千问图像模型 2.1：70 亿参数视觉引擎上线，商用还得另谈授权

**Summary:** 通义千问图像模型 2.1 将原生透明输出和最多 10 张参考图的编辑能力集成于 70 亿参数的视觉生成器中。我会先做原型验证，但付费产品仍需与通义千问单独达成授权协议。

- Canonical: https://markhuang.ai/zh/news/qwen-image-2-1-7b-commercial-license
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-20
- Section: News
- Tags: 通义千问, 图像生成, 开放权重, 模型授权, 生成式 AI
- Source: [Qwen](https://qwen.ai/blog?id=qwen-image-2.1)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一台小型图像生成引擎将透明抠图素材送向一扇黄铜大门，门的一边是研究工作室，另一边是商业展厅](https://cdn.markhuang.ai/news/qwen-image-2-1-7b-commercial-license/hero.webp)

*通义千问图像模型 2.1 把创意流程做得更短、更直接。但想进商业产品，还得单独谈授权。*

[通义千问图像模型 2.1](https://qwen.ai/blog?id=qwen-image-2.1) 把文生图、图像编辑和原生透明输出整合到一个模型里。视觉生成组件包含 32 层单流 DiT，共 70 亿参数，一次编辑最多能用 10 张参考图。做产品摄影或可复用设计素材的话，这套组合能省掉大量抠图和遮罩的重复劳动。

我的看法是，正式投入生产之前，先做个原型验证比较稳妥。通义千问说这是开源模型，权重也确实开放下载。但附带的《通义千问研究许可协议》只允许用于非商业研究或评估，想商用得另外申请授权。

这个区别决定了谁能马上用起来。做研究或评估图像管线的人，现在就能拿到一个可以检查、可以本地跑的新模型。但如果团队想把权重放进付费产品，就得先把授权问题搞定，基准测试、速度、透明通道这些特性才有意义。

## 原生透明通道，省掉一个又烦又贵的环节

我觉得最实用的是原生 RGBA 输出。通义千问说，同一个模型既能生成带透明通道的素材，也能编辑已有的透明图层，还能从普通 RGB 照片里抠出主体。发布示例还展示了换表情时不用回填背景，以及直接编辑透明图层上的文字。

这听起来不如刷榜那么酷，但它解决的是实际生产里的麻烦事。一个干净的抠图通常要再跑一个模型、用遮罩工具，或者手动清理。如果 Qwen-Image-2.1 能在多次编辑中保持 Alpha 通道，产品团队就能让素材一直可复用，而不是每次改完都要重新压平到新场景里。

不过我还是会先拿那些棘手的边缘情况测一测再说。头发、半透明材质、柔和阴影和反光——这些地方看着抠得还行，真要修起来成本很高。发布页面放的是精选案例，不是失败率统计。原生支持去掉了一道流程边界，但不代表每道边界都处理得干净。

## 十张参考图把生成变成了组装

支持最多 10 张参考图，把模型推向了另一个方向。通义千问展示了把六张人像合成一张合影、五套时装拼成一套穿搭、十件家具摆进一个房间。局部编辑可以用圆圈、涂色区域或者单独的遮罩来指定。

如果这些例子在普通输入上也能站住脚，那这个模型就不只是从零生成的画布，更像是一个视觉拼装工具。对那些手里已经有定稿的产品、角色、组件，又需要新构图但不能走样的人来说，这很有用。

这时候，保真度才是关键。输入里如果是一只特定的鞋、一个标签、一张脸、一把椅子，编辑之后必须还是那个东西，那输出再好看也没用。通义千问说这次发布改进了人像身份保持和产品一致性，但发布页上的证据都来自通义千问自己。在 [LocalLLaMA 的发布讨论](https://www.reddit.com/r/LocalLLaMA/comments/1wlgrft/qwenimage21_released/)里，早期问题很快就转到了硬件需求、角色一致性、这些例子到底怎么做出来的。我会逐个检查参考对象有没有走样，而不是看一个总体画质分数就下结论。

## 70 亿参数只是运行时的一部分

通义千问很谨慎，只说 70 亿是“视觉生成组件”的规模。[模型仓库](https://huggingface.co/Qwen/Qwen-Image-2.1)里还有文本编码器、Transformer、VAE、处理器和调度器。[Diffusers 文档](https://huggingface.co/docs/diffusers/main/api/pipelines/qwenimage21)说，提示词和条件图像会先用 Qwen3-VL 编码，然后由块因果 Transformer 对目标图像去噪。

所以我不会简单地把 70 亿参数类比成 70 亿语言模型的显存需求。通义千问的模型卡在基础示例里推荐 BF16、40 步推理和 CUDA，同时提供 CPU 卸载来优化内存。但它没有给出一个简单的最低显存承诺。混合粒度注意力和 KV 缓存复用也许能让重复的多图编辑更快，但发布里没有提供我需要的延迟和内存数据来规划服务。

一篇早期的[预发布对比](https://www.reddit.com/r/StableDiffusion/comments/1wklr8z/qwen_image_21_prerelease_comparison_by_sandlers/)在夸输出的同时，提到 ModelScope 上生成很慢。我觉得这更多是在提醒演示平台的问题，因为托管速度混杂了模型、排队和基础设施。发布的权重还是得在产品预期的具体硬件、分辨率、参考数量和批处理模式下测试。

## “开源”没解决使用权问题

授权协议是我下载前会先看的部分。[2026 年 9 月 20 日版的《通义千问研究许可协议》](https://huggingface.co/Qwen/Qwen-Image-2.1/blob/main/LICENSE)把非商业用途限定为仅研究或评估，并明确说商业用户必须向通义千问申请单独授权。Hugging Face 元数据把这个许可标记为 `qwen-research`，不是 Apache 2.0 或其他标准宽松许可。

公开权重给了研究人员实质性的访问权，他们不用等 API 就能检查和测试模型。但公司并没有因此获得商业部署权，这也是为什么我把开放权重和开放生产选项分成两栏。

之前写[通义千问 3.8 承诺的开放权重发布](https://markhuang.ai/news/qwen38-open-weight-preview-gap)时，我就说过授权协议会决定这个承诺实际能走多远。Qwen-Image-2.1 补上了缺失的那一块，答案现在很清楚：非商业研究和评估开放，商业条款另谈。

> **Info:**
>
> 我的上手原则：先用公开权重测 RGBA 质量、参考对象保真度、延迟和显存占用。如果这套流程确实值得放进商业产品，再去找通义千问谈单独授权的价格和条款，谈完再正式接入。

## 授权应该放进第一轮测试

Qwen-Image-2.1 把通常分散在好几个工具里的步骤合并了。原生透明通道省下的时间，可能比微弱的基准领先更有价值；10 张参考图编辑或许让它更适合有明确素材的视觉拼装，而不是随便写一句提示词。这些都是值得跑一轮评估的理由。

团队可能花几周调提示词、遮罩和部署代码，最后才发现商业条款跟产品对不上。我会反过来做：先低成本验证流程，尽早跟通义千问聊授权，厂商的基准数字先当假设看，等模型能扛住我自己的素材再说。

Qwen-Image-2.1 在产品形态上挺有潜力，尤其适合需要可复用透明素材的团队。但在商业价格和条款明确之前，我会把它放在研究候选那一栏。
