阿里千问发布Qwen‑Image‑2.1,将文生图、单图及多图编辑、透明图像生成和主体提取统一进同一套可下载权重。其核心视觉生成模块采用32层Single‑Stream DiT,约70亿参数,原生输出2K分辨率和带Alpha通道的RGBA图像,最多可结合10张参考图,并接受圈选、涂抹或独立蒙版指定编辑区域。模型通过混合粒度注意力和跨去噪步骤的KV Cache复用,减少多图编辑中的重复计算;Diffusers、ComfyUI、vLLM‑Omni和SGLang也在发布当天提供支持。不过,“7B”只计算DiT,不包括约80亿参数的Qwen3‑VL文本/图像编码器和VAE;参考实现以BF16加载时文件规模约33GB,不能简单理解为消费级显卡都能轻松运行。更重要的是,权重采用仅限研究和评估的Qwen Research License,未经单独授权不得商用,因此官方所称“开源”更准确地说是“非商用开放权重”。
文章作者、来源:Qwen
“7B模型”并不是整套系统只有70亿参数
Qwen‑Image‑2.1最容易被误解的宣传数字是7B。
这70亿参数指负责生成图像的Single‑Stream DiT,共32层。实际运行还需要Qwen3‑VL 8B作为文本和参考图编码器,并配合一个支持RGBA、空间压缩率为16倍的自编码器。
按照vLLM公布的BF16组件大小,文本编码器约17.5GB、DiT约14.2GB、自编码器约1.4GB,文件合计约33.1GB;运行时还需要为中间状态和KV Cache留出显存。因此,它确实比许多大型图像模型轻,却不是一款可以直接塞进七八GB显存显卡的“7B小模型”。
在一块NVIDIA GB300上,vLLM使用40个去噪步骤生成1024×1024图像,实测约需3.3至4.5秒,峰值显存约34GB。这个成绩不能直接外推到普通显卡,更不能代表原生2048×2048输出的耗时。CPU卸载和FP8量化能够降低显存需求,但通常会增加延迟或带来一定精度损失。
一套权重同时负责生成和编辑
不少图像产品会分别部署文生图模型、编辑模型、抠图工具和透明背景生成器。Qwen‑Image‑2.1试图将这些能力合并到同一条推理管线中。
纯文本输入时,它可以按照提示词直接生成图像;加入一张或多张参考图后,同一模型会转为编辑、合成或身份保持任务,无须另外加载专门的编辑检查点。
模型原生推荐2048×2048输出,并支持4:3、3:4、3:2、2:3、16:9和9:16等比例。官方参考实现默认运行40个去噪步骤。
千问还另外开放了两款基于Qwen3.5‑VL 9B微调的提示词改写器,分别用于文生图和图像编辑。它们会把简短指令展开成更详细的英文描述,并选择画面比例。因此,官方展示的最佳效果不一定只来自用户输入的一句原始提示词。
透明图像不是生成后再“抠背景”
这一代最实用的新功能,是原生RGBA输出。
普通生成模型通常只输出红、绿、蓝三个颜色通道。所谓透明背景,往往是在图片生成完成后,再运行另一个分割模型删除背景。边缘头发、半透明玻璃、阴影和柔光经常会在这一阶段受损。
Qwen‑Image‑2.1的自编码器从输入到输出均保留四个通道,Alpha透明度直接属于模型生成结果的一部分。它可以生成贴纸、图标、Logo和商品素材,也可以修改透明图层中的表情或文字,还能从普通照片中提取指定主体并输出RGBA素材。
这并不保证每个像素的Alpha值都准确,复杂毛发、玻璃、烟雾和反射仍需实际测试;但从系统结构看,它不再依赖事后背景删除。
十张参考图,把模型推向实际设计工作流
官方模型最多接受10张参考图,可以把人物、商品、服饰、背景和风格素材组合到同一画面中。
展示案例包括将六张独立人像组成一张合照;将模特、服装、鞋、包和帽子组合成完整穿搭;以及读取十张家居素材生成室内布置图。模型还强化了人物面部和商品文字、纹理及外形的一致性。
局部编辑可以通过三种方式指定:
圈出需要修改的物体;在图片上直接涂抹目标区域;或者把完整原图与单独的黑白蒙版作为两张输入图片。独立蒙版不会像画圈或涂抹那样遮挡原图信息,更适合精细编辑。
需要区分模型能力与部署框架限制。千问官方将上限写为10张,但vLLM当前发布指南的编辑接口暂时只接受最多4张;不同工具前端实际开放的数量可能不同。
KV Cache为什么对多图编辑特别重要
扩散模型通常需要反复执行数十个去噪步骤。传统结构在每一步都可能重新处理提示词和参考图,即使这些输入从未改变。
Qwen‑Image‑2.1采用混合粒度注意力:文字使用Token级因果掩码,图像使用块级双向掩码。提示词和参考图被放在生成序列前部,模型在第一个去噪步骤完成计算后保存其Key和Value,后续步骤直接复用。
这种缓存是精确复用,而不是跳过部分去噪步骤的近似加速,因此理论上不会改变结果。它对短提示词的纯文生图帮助有限,对输入多张高分辨率参考图的编辑任务则更有价值。
vLLM的实现说明称,输入四张参考图时,后续步骤只需重新计算约五分之一的序列;重复长提示词的计算量约为第一次的三分之一。但这些数字来自特定运行框架和硬件,不应理解为模型在所有设备上都能获得五倍速度提升。
官方称质量进入第一梯队,独立评测仍不充分
千问展示了一张Qwen‑Image‑Bench对比图,声称新模型以较小的视觉生成模块,在综合生成和编辑质量上达到开源模型前列,并能与多款闭源模型竞争。
官方案例中,模型在中英文排版、人像光影、商品细节、信息图、全景图和分镜生成方面表现突出。
但这批结果仍以开发团队自测和挑选的展示图为主。官方没有同时公开完整逐项成绩、评测提示词、随机种子、置信区间和全部原始输出,外部团队也还没有完成覆盖文字准确率、人物一致性、复杂空间关系和失败率的大规模复现。
早期社区测试同样呈现混合结果:部分测试者认为其高分辨率细节、编辑一致性和文字表现优于现有本地模型;另一些测试则发现人物皮肤仍带有明显的AI质感,复杂动作、手指和物理关系偶尔出错。因此,“超过多数闭源模型”目前应视为官方结论,而不是已经形成共识的独立排名。
下载得到权重,不等于可以自由商用
Qwen博客和GitHub将此次发布称为“open source”,X帖子则使用了相对准确的“open weights”。许可证显示,后者更接近实际情况。
Qwen Research License允许用户下载、研究、评估、修改和再分发权重及衍生版本,但授权明确限定为非商业用途。商业部署需要另行向千问申请许可。
如果利用模型、输出或结果训练并发布另一个AI模型,许可证还要求在产品文档中显著标注“Built with Qwen”或“Improved using Qwen”。
因此,它不同于Apache 2.0、MIT等通常意义上的开源许可证,也不满足允许任意领域使用的开源定义。个人研究者可以本地实验和微调,创业公司却不能因为权重能够下载,就默认将其接入收费产品。
发布当天已经接入主流生成生态
Qwen‑Image‑2.1发布时同步获得Diffusers、ComfyUI、vLLM‑Omni、SGLang‑Diffusion和LightX2V支持。开发者可以使用同一条管线完成文生图及编辑,ComfyUI则提供节点式工作流。
这类Day‑0支持很重要:开放权重模型能否被采用,往往不只取决于画质,还取决于量化、显存卸载、批量服务、LoRA训练和可视化工具是否及时就绪。
不过,部分支持仍位于开发分支或尚未进入正式版本。例如,vLLM指南在发布时明确说明相关支持尚未进入带版本号的稳定发行,需要使用指定PR代码。因此,“已经支持”不一定等于执行一次常规升级便能立即使用。
Qwen‑Image‑2.1真正有价值的地方,是把过去分散在多个模型和工具里的能力——生成、编辑、多图合成、局部控制、主体提取及透明素材——压缩到一套可以部署的权重中。它没有彻底解决图像模型的物理错误、人物一致性或商业授权问题,却给本地视觉工作流提供了一个功能相当完整的新底座。