- 人工智能
- 大模型
- 媒体生成
- 多模态
【免费下载链接】Qwen-Image-2.1
本文是基于 README.md 编写的部署与使用指南,面向 ComfyUI 用户:将 Qwen-Image 2.1 官方模型仓库中针对 ComfyUI 重新打包的 8 个单文件模型(.safetensors)按目录放置、选型与运行文本生成、图生图、背景移除等官方工作流。读完本文你将掌握:每个模型文件在 ComfyUI 中的正确落盘位置、不同精度变体的适用场景与硬件权衡、Prompt Enhancer 与 TextGenerate 节点的配合方式,以及如何导入官方 Workflow 模板完成文生图与图像编辑。
一、仓库定位:面向 ComfyUI 的 Qwen-Image 2.1 模型再打包
本仓库(hf_mirrors/Comfy-Org/Qwen-Image-2.1)的核心作用是将 Qwen 官方发布的 Qwen-Image 2.1 系列模型重新打包为 ComfyUI 可直接加载的单文件格式(diffusion-single-file),原模型仓库位于 HuggingFace 的Qwen/Qwen-Image-2.1。
仓库采用 Git LFS 管理全部模型权重(见 .gitattributes 中*.safetensors filter=lfs规则),文件以 LFS 指针形式存在于仓库中,实际权重由 LFS 存储,因此克隆仓库后必须执行git lfs pull才能获取完整权重。文件命名中的后缀含义:
bf16:bfloat16 全精度权重,质量最佳、显存占用最大;int8_convrot:INT8 量化权重,为线性层/卷积层(Convolution)旋转(Rot)重排后的低精度变体,在显存与质量间取得平衡;w4a8:权重 4-bit、激活 8-bit 的混合量化变体,体积最小、显存占用最低。
仓库中实际存放的文件与 LFS 声明的大小如下(单位 GiB,数值由size字段换算):
| 文件 | 逻辑分类 | 声明大小 |
|---|---|---|
| diffusion_models/qwen_image_2.1_bf16.safetensors | 扩散主干 | 13.3 GiB |
| diffusion_models/qwen_image_2.1_int8_convrot.safetensors | 扩散主干 | 6.8 GiB |
| text_encoders/qwen3vl_8b_bf16.safetensors | 文本编码器 | 16.3 GiB |
| text_encoders/qwen3vl_8b_int8_convrot.safetensors | 文本编码器 | 8.7 GiB |
| text_encoders/qwen3vl_8b_w4a8.safetensors | 文本编码器 | 5.9 GiB |
| text_encoders/qwen3.5_9b_qwen_image_2.1_pe_i2i.int8_convrot.safetensors | Prompt Enhancer(I2I) | 8.8 GiB |
| text_encoders/qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors | Prompt Enhancer(T2I) | 8.8 GiB |
| vae/qwen_image_2.1_vae_bf16.safetensors | VAE 解码器 | 0.6 GiB |
提示:上述文件在仓库中均为 Git LFS 指针文本(约 130 字节),通过
git lfs pull拉取后才会成为真正的权重文件;磁盘需求约为表中大小之和,请预留充足空间。
二、安装:将文件放入 ComfyUI 对应模型目录
README 明确给出了文件目录映射关系。ComfyUI 通过models/下的子目录按类型加载模型,因此路径必须严格对应,否则节点无法在列表中看到对应模型:
📂 ComfyUI/ └── 📂 models/ ├── 📂 diffusion_models/ │ ├── qwen_image_2.1_bf16.safetensors │ └── qwen_image_2.1_int8_convrot.safetensors ├── 📂 text_encoders/ │ ├── qwen3vl_8b_bf16.safetensors │ ├── qwen3vl_8b_int8_convrot.safetensors │ ├── qwen3vl_8b_w4a8.safetensors │ ├── qwen3.5_9b_qwen_image_2.1_pe_i2i.int8_convrot.safetensors │ └── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors └── 📂 vae/ └── qwen_image_2.1_vae_bf16.safetensors对应关系可以总结为三条规则:
- 扩散主干(Diffusion Model):
diffusion_models/下的两个qwen_image_2.1_*.safetensors放入ComfyUI/models/diffusion_models/; - 文本编码器(Text Encoder):
text_encoders/下的 5 个文件放入ComfyUI/models/text_encoders/,其中既包含用于提示词理解的基础编码器(qwen3vl_8b 系列),也包含用于提示词增强的编码器(qwen3.5_9b 系列); - VAE:
qwen_image_2.1_vae_bf16.safetensors放入ComfyUI/models/vae/。
文本编码器的两种角色
README 中特别说明:qwen3.5_9b_qwen_image_2.1_pe_*系列模型(pe即 Prompt Enhancer)是专门用于提示词增强的模型,必须搭配TextGenerate 节点使用,而不是作为常规文本编码器直接接入 CLIP 加载节点。两个变体分别对应两种场景:
qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors:服务于 Text-to-Image(文生图)工作流;qwen3.5_9b_qwen_image_2.1_pe_i2i.int8_convrot.safetensors:服务于 Image Edit / I2I(图生图、图像编辑)工作流。
而qwen3vl_8b_*三个变体才是真正承担提示词编码任务的视觉语言文本编码器:bf16(全精度)、int8_convrot(INT8 量化)、w4a8(4-bit 权重 + 8-bit 激活)。它们与扩散主干之间通过精度匹配可以灵活组合,例如“int8 主干 + int8 编码器”适合中低显存环境,“bf16 主干 + bf16 编码器”适合追求最佳质量的显存充足环境。
三、选型参考:不同精度变体的适用场景
模型仓库为扩散主干与文本编码器各提供了多个精度变体,结合文件命名与常见实践可以给出如下选型思路(具体显存需求请以 ComfyUI 实际加载为准):
| 场景 | 扩散主干 | 文本编码器 | 说明 |
|---|---|---|---|
| 追求最佳质量 | qwen_image_2.1_bf16.safetensors(13.3 GiB) | qwen3vl_8b_bf16.safetensors(16.3 GiB) | bf16 全精度,质量上限最高,显存需求最大 |
| 均衡选择 | qwen_image_2.1_int8_convrot.safetensors(6.8 GiB) | qwen3vl_8b_int8_convrot.safetensors(8.7 GiB) | INT8 量化,体积约为 bf16 的一半,兼顾质量与显存 |
| 极致省显存 | qwen_image_2.1_int8_convrot.safetensors(6.8 GiB) | qwen3vl_8b_w4a8.safetensors(5.9 GiB) | w4a8 混合量化,体积最小,适合显存受限环境 |
w4a8的“4-bit 权重 + 8-bit 激活”混合量化是三个文本编码器变体中体积最小的(5.9 GiB),适合在小显存显卡上运行完整管线;- 无论选择哪个变体,VAE 都使用唯一的
qwen_image_2.1_vae_bf16.safetensors(0.6 GiB),无需选择; - 同名变体的质量差异属于量化引入的近似,实际效果建议在同一工作流中切换对比验证。
四、工作流:官方提供的三套模板
README 提供了三套官方工作流模板(存放于 Comfy-Org 的 workflow_templates 仓库):
- Text-to-Image(文生图):
image_qwen_image_2_1_t2i.json - Image Edit(图像编辑/图生图):
image_qwen_image_2_1_image_edit.json - Remove Background(背景移除):
image_qwen_image_2_1_background_removal.json
4.1 文生图工作流(T2I)
工作流模板image_qwen_image_2_1_t2i.json展示的是最基础、也是最能体现整套模型能力的流程,核心链路为:
TextGenerate(可选:Prompt Enhancer)→ 文本编码器(qwen3vl_8b)→ 扩散主干(qwen_image_2.1)→ VAE 解码 → 图像输出- 输入:文本提示词;
- 可选增强:将提示词送入
qwen3.5_9b_qwen_image_2.1_pe_t2i模型进行语义增强后再编码; - 输出:生成的图片。
4.2 图像编辑工作流(Image Edit)
image_qwen_image_2_1_image_edit.json面向图生图与局部编辑场景,在 T2I 链路的基础上增加输入图像分支:
- 输入:文本提示词 + 参考/编辑目标图像;
- 可选增强:提示词送入
qwen3.5_9b_qwen_image_2.1_pe_i2i模型(I2I 专用变体)增强; - 输出:编辑后的图片。
该模板官方配图以 Before / After 形式展示输入与输出效果,是验证图像编辑能力的最直观入口。
4.3 背景移除工作流(Remove Background)
image_qwen_image_2_1_background_removal.json是 Qwen-Image 2.1 的图像理解与生成能力的典型应用:输入图片 + 适当的移除背景提示词,输出透明背景/去背景结果。官方同样以 Before / After 形式展示。
4.4 如何导入工作流
在 ComfyUI 中导入官方工作流模板的标准操作:
- 获取模板 JSON 文件(可从 workflow_templates 仓库下载
image_qwen_image_2_1_t2i.json等文件); - 在 ComfyUI 界面中点击Load(加载),或直接将 JSON 文件拖拽到画布上;
- 模板中的节点会自动展开,此时在对应节点下拉框中选择你已安装的模型文件(因为模型文件名可能与模板默认值略有差异,需手动确认);
- 点击Queue Prompt(提交)运行。
注意:导入模板前请确保
diffusion_models/、text_encoders/、vae/三个目录中的文件已就位,且 TextGenerate 节点所需的qwen3.5_9b_*_pe_*模型已放入text_encoders/。
五、实现原理与源码佐证
虽然本仓库是一个纯模型分发仓库(不含 Python 源码、测试或配置实现),但通过仓库结构可以印证 ComfyUI 的加载机制与本文档的部署要求:
- 目录即类型:ComfyUI 以
models/下的子目录作为模型类型命名空间(diffusion_models、text_encoders、vae分别对应 Diffusion Model、Text Encoder、VAE 三类加载器),这正是 README 强调目录映射的原因——文件放错目录将无法被对应节点识别。 - LFS 指针文件:仓库中的
.safetensors文件实际是 Git LFS 指针文本(含oid sha256与size字段),表明模型权重由 LFS 远端提供;.gitattributes中*.safetensors filter=lfs规则确认了这一点。这意味着克隆后必须执行git lfs pull才能获得可加载的权重,直接复制指针文件到 ComfyUI 目录将导致加载失败。 - 单一文件(diffusion-single-file):README 的
tags声明comfyui与diffusion-single-file,说明仓库将完整模型打包为单一.safetensors文件(而非拆分到多个文件),这与 ComfyUI 的 UNETLoader / DiffusionModelLoader 等单文件加载接口的设计一致,也方便用户直接替换或备份模型。
从源码结构可以推断,ComfyUI 加载这些单文件模型时,会解析 safetensors 头部的张量名称与形状以识别模型架构(例如qwen_image_2.1主干的 UNet/DiT 结构与 VAE 的通道配置),再依据权重名称装配进对应的模型类;因此文件命名中的架构标识(如qwen3vl_8b、qwen3.5_9b、qwen_image_2.1)是 ComfyUI 识别模型身份、匹配正确加载器的重要依据,不建议修改文件名。
六、常见问题与排查建议
- 模型不出现在下拉列表:检查文件是否放置在正确的子目录(
diffusion_models/、text_encoders/、vae/),并确认已通过git lfs pull拉取真实权重(指针文件无法加载)。 - 加载报错/架构不匹配:确认所选文件与节点类型匹配——扩散主干应接入 Diffusion Model 类节点,
qwen3vl_8b_*接入文本编码器类节点,qwen3.5_9b_*_pe_*只接入 TextGenerate 节点,VAE 接入 VAE 类节点。 - 显存不足(OOM):优先将扩散主干与文本编码器切换为
int8_convrot或w4a8变体,这两个量化系列可将权重体积降至 bf16 的一半乃至三分之一(见第三节选型表)。 - 工作流导入后提示缺少模型:模板 JSON 中的模型名称可能与本地文件名不完全一致,手动在节点下拉框中选择对应文件即可。
七、结语
本仓库以“目录即类型、单文件即模型”的方式,将 Qwen-Image 2.1 全链路(提示词增强 → 文本编码 → 扩散生成 → VAE 解码)所需的 8 个模型文件整理成 ComfyUI 可直接使用的形态。只要按 README.md 的目录映射正确放置文件、按场景选择精度变体、并配合官方三套工作流模板(T2I、Image Edit、Remove Background),即可在 ComfyUI 中快速搭建基于 Qwen-Image 2.1 的文生图、图像编辑与背景移除能力。
- 人工智能
- 大模型
- 媒体生成
- 多模态
【免费下载链接】Qwen-Image-2.1
相关推荐
stable-diffusion.cpp 运行 Ovis-Image-7B 文生图完整指南:模型权重、VAE、Ovis 2.5 文本编码器与 CLI 实战
stable diffusion.cpp 运行 Ovis Image 7B 文生图完整指南:模型权重、VAE、Ovis 2.5 文本编码器与 CLI 实战 导读
人工智能大模型本地部署推理引擎媒体生成Qwen-Image 2.1模型文件放置位置指南:diffusion_models、text_encoders、vae三大目录一次讲清
Qwen Image 2.1模型文件放置位置指南:diffusion_models、text_encoders、vae三大目录一次讲清 Qwen Image 2
人工智能大模型媒体生成多模态通义千问图像模型Qwen-Image本地化部署全攻略:ComfyUI多工作流实战指南
通义千问图像模型Qwen Image本地化部署全攻略:ComfyUI多工作流实战指南 在AIGC图像生成领域,阿里巴巴通义千问团队推出的Qwen Image模型
基础模型模型量化计算机视觉
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考