结论先行:阿里千问团队于 2026 年 9 月 20 日开源 Qwen-Image-2.1,把一个「文生图 + 图像编辑」合一的图像模型放进单个权重里——视觉生成部分只有 7B 参数(32 层 Single-Stream DiT),并原生支持透明图像(RGBA)的生成与编辑。权重已同步上线 GitHub、Hugging Face 与 ModelScope,diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 在发布当天即提供 Day-0 支持。
一句话概括这次更新的取舍:不追参数规模,而是把此前需要独立模型才能做的透明素材与多图编辑,收敛进一个可自行部署的 7B 模型,并优先把推理生态铺满。
Qwen-Image-2.1 更新了什么:四项核心升级
| 方向 | 关键变化 | 对用户意味着什么 |
|---|---|---|
| 小模强效 | 视觉生成部分 7B 参数、32 层 Single-Stream DiT;混合粒度注意力 + 前缀 KV 缓存复用 | 更小显存占用,多图编辑时耗时更低 |
| 原生透明,创改一体 | 由提示词决定输出普通图或带 Alpha 通道的透明图;支持透明图层编辑与照片抠图 | 贴纸、素材、电商图一次生成,不必再过一遍抠图模型 |
| 全能编辑 | 最多 10 张参考图;圆圈、涂鸦、独立 mask 三种局部指定方式;人像与商品保真 | 多人合影、虚拟试穿、室内搭配这类多主体合成更好控 |
| 真实质感,字雅人美 | 文字排版、人像光影与细节表现提升 | 海报、信息图中的中英文排版更耐看 |
7B 参数如何做到「小模强效」
从官方给出的架构看,Qwen-Image-2.1 是一个 single-stream DiT:Transformer 共 32 层、7B 参数;文本编码器采用 Qwen3-VL 8B 视觉语言模型,把文字指令与条件图像编码进统一表征;VAE 为 64 通道 RGBA 自编码器、16× 空间压缩,这是原生透明得以成立的底座;调度器使用 Flow Matching 配 Euler 离散调度与动态 shifting。
混合粒度注意力是效率的关键
文本部分(含系统前缀与编辑指令)使用 token 级因果掩码,图像生成本身使用 chunk 级掩码。这种划分带来一个很实用的结果:输入图像与编辑指令可以在第一个去噪步就算完并缓存,后续步直接复用前缀 KV 缓存。参考图越多、编辑指令越长,收益越明显——多图编辑正是过去最吃显存和时间的场景。
原生透明:从 Qwen-Image-Layered 到统一模型
2025 年 12 月,Qwen 曾推出 Qwen-Image-Layered 作为专门的透明图像生成模型。Qwen-Image-2.1 把这项能力并进了统一模型,由提示词判断该输出普通图像还是带透明通道的图像。官方推荐的提示词格式为:
This is an RGBA image with transparency. <你的描述>. The image has alpha channel and the background is transparent.
除了单个主体,它也能生成由多个元素组成的复杂透明图。已有透明图层同样可以直接编辑:既能在保留透明背景的前提下修改主体表情,也能替换图层中的文字(官方示例把「BLOOM」改成了「Qwen-Image」)。更进一步,给一张 RGB 照片,模型可以把主体抽成带透明通道的 RGBA 图层,方便在设计稿中直接复用。
编辑能力:10 张参考图与三种局部指定方式
多参考图:最多 10 张
官方给出了三类典型场景:6 张单人肖像合成一张合影;模特、上衣、鞋、包、帽子 5 张输入合成整套穿搭;10 张家居单品图生成完整的室内布置。这类「多主体合成」过去常需要拼 LoRA 或多模型串联,现在是一次推理完成。
局部编辑:圆圈、涂鸦、独立 mask
- 彩色圆圈:可一次性指定多个区域,例如「去掉蓝圈里的金属手表、把红圈里的头发改成黑色、把绿圈区域换成灰色短袖亚麻睡衣」。
- 涂鸦标注:直接在图上涂抹出目标区域,官方示例是在画面右侧白色标注处加入一名潜水员。
- 原图 + 独立 mask 双输入:圆圈和涂鸦都会遮挡部分原图,若需要完整保留输入,可改用「原图 + 单独 mask」两张图,模型只改 mask 指定区域。
保真与任务覆盖
保真方面分两条线:人像侧保留面部特征,使同一个人的身份在多次编辑后仍保持一致;商品侧保留文字、纹理与形状。任务覆盖上,官方展示了全景图、信息图、分镜故事板等,甚至可以用连续局部编辑把画面逐步改动后拼成简单动画。
规格与首日生态
| 项目 | 规格 |
|---|---|
| 架构 | 32 层 Single-Stream DiT,视觉生成 7B 参数 |
| 文本编码器 | Qwen3-VL 8B |
| VAE | 64 通道 RGBA,16× 空间压缩 |
| 调度器 | Flow Matching + Euler 离散,动态 shifting |
| 原生分辨率 | 2K(默认 2048×2048),最高 2752×1536 |
| 宽高比 | 1:1、4:3、3:4、3:2、2:3、16:9、9:16 共 7 种 |
| 默认推理步数 | 40 步 |
| 权重精度 | BF16 |
| 推理入口 | diffusers QwenImage21Pipeline |
Day-0 支持阵容相当完整:diffusers(PR #14804,首个同时处理文生图与图像条件的 Pipeline)、ComfyUI(Comfy-Org 提供兼容权重与文生图/编辑示例工作流)、vLLM-Omni(分步执行、前缀 KV 缓存、CUDA Graph decode、FP8 量化、TP/Ulysses 并行)、SGLang(前缀缓存、Cache-DiT、CUDA graphs、TP/Ulysses/Ring/CFG 并行与组件卸载)、LightX2V(面向数据中心与消费级 GPU 的加速)。
它在 Qwen 图像系列里处于什么位置
回顾这条产品线:Qwen-Image-2.0(2026 年 2 月)主打「重定义 AI 视觉创作标准」;Qwen-Image-3.0(7 月)在信息图这类复杂排版上更进一步,但未开放权重。Qwen-Image-2.1 的定位因此很清楚——不卷参数与炫技,把生成、透明、编辑收敛到一个可自部署的 7B 权重上,并先把推理生态铺满。对于要在本地或自有 GPU 上跑设计、电商流水线的团队,一个「能拿到权重」的模型,比一个「更强但拿不到」的模型更有实际价值。
需要提醒的是:官方目前公开的是 Qwen-Image-Bench 的对比结果,未给出 GenEval、DPG-Bench 一类第三方标准榜单的具体分数,横向比较建议用自己的业务图实测。
常见问题(FAQ)
Q1:Qwen-Image-2.1 可以免费商用吗?
权重已在 Hugging Face 与 ModelScope 公开,可自行下载部署。商用范围请以模型仓库中随附的许可协议为准,不要默认等同于 Apache 2.0,落地前务必先核对许可证条款。
Q2:需要多大显存?
官方以 BF16 权重发布,并支持 CPU offload 与组件卸载;多图编辑场景依靠前缀 KV 缓存复用降低显存占用。实际占用取决于分辨率与参考图数量,建议从 1024×1024 起步实测后再上调到 2K。
Q3:怎么最快上手?
不想写代码就直接装 ComfyUI,用 Comfy-Org 的兼容权重与官方示例工作流;要做工程化部署则用 diffusers 的 QwenImage21Pipeline,或走 vLLM-Omni / SGLang 拿并行与缓存优化。生成透明图时记得套用上文给出的 RGBA 提示词格式。
小结
Qwen-Image-2.1 不是一次参数上的跃迁,而是一次「能力收敛」:用 7B 的视觉生成部分,同时覆盖文生图、透明素材生成、多参考图编辑与局部重绘,并在首日就把主流推理框架全部打通。如果你此前为了抠图、换装、多人合影而维护着好几条不同的模型流水线,这个版本值得拿你自己的场景去实测一轮——尤其是那 10 张参考图的上限,可能是目前开源图像模型里最实用的一条规格。
消息来源:Qwen 官方博客 Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation;GitHub / QwenLM/Qwen-Image-2.1;Hugging Face;ModelScope(发布时间:2026 年 9 月 20 日)。
相关阅读
这条线上还有几篇站内文章可以接着看:
