Qwen-Image-2.1开源之后,人像生成和编辑这块基本可以说是“出片率”最高的方向之一。最近后台问得最多的问题集中在三个方面:人像提示词怎么写、发型表情怎么改、老照片怎么修,然后顺带问一句有没有现成的整合包能一键跑起来。我干脆把这些内容整理成一篇完整攻略,从提示词模板到ComfyUI整合包部署,再到本地Diffusers或者GGUF量化版运行,一次讲透。这篇内容主要面向已经装好基础环境、但卡在“照片效果不好”或“不知道怎么改局部”的玩家,对纯新手也友好,我会把每个参数的作用都交代清楚。
1. 先把Qwen-Image-2.1这人像模型摸个底
1.1 Qwen-Image-2.1到底是什么水平
Qwen-Image-2.1是阿里开源的多模态图像生成模型系列,整体延续了通义万相那套技术路线,但它和同系列前几个版本相比,最明显的差异在于对中文提示词的理解更自然、对文字渲染更准确、对人脸生成细节的稳定性更强。它不是专门做人像的模型,但在人像这个细分场景下,优势恰恰被放大了:中文提示词不需要翻译成英文,可以直接写“一头黑色长卷发,眼神温柔,穿着米色针织毛衣”这种大白话,模型也能稳定理解。
实际跑下来,我个人的体感是:它在写实人像上的质量接近中高端商业摄影图,尤其是在肤质、发丝、瞳孔高光这些细节上,比很多中小尺寸模型强一截。它支持多种分辨率输入,默认常用1024x1024或832x1216之类的比例,修图或者做人像海报都够用。再加上它支持图像编辑、局部重绘、老照片修复这类任务,等于一个模型干了好几种活,这对个人创作者来说确实省事。
1.2 人像场景的优势与局限
优势很明确:中文语义理解好、一次性出图成功率较高、对带文字元素的图片渲染能力强。比如你写“一杯咖啡杯上写着‘早’字,旁边坐着一个穿复古衬衫的女孩”,这种图文混合的内容,它能处理得不错。这人像场景里还有一个隐藏优点,就是它的负面提示词容错率很高。很多模型稍微写错负面提示词,画面就会发灰或者出现奇怪色彩,而它在默认情况下,色彩饱和度和对比度都相对稳定。
局限同样要说清楚。第一,它对东亚人种特征的编造能力很强,但如果你输入的是真实人物照片,就需要搭配参考图或局部编辑流程,否则“像不像”完全取决于随机因素。第二,它生成的多人场景会偶尔出现肢体融合、手指多指等问题,虽然比前代好,但并非完全免疫。第三,本地部署对显存有一定要求,非量化版本在8GB以下显存的卡上会比较吃力,这点后面整合包部分我会详细讲。
2. 人像生成提示词:从入门到够用
2.1 基础人像提示词模板
写人像提示词,我习惯用“主体描述+环境/着装+光线/氛围+镜头语言+画质词”的五段式结构。这个结构不一定完全固定,但它能最大程度减少漏项。很多人提示词写得短,比如“一个女孩”,出来的效果就完全看运气;你把每一段都补上,画面控制力会立刻上升。
拿一个实用例子来说:
一位25岁左右的亚洲女性,黑色长直发,自然妆容,脸上带着温和微笑,穿着白色衬衫坐在窗边咖啡馆内,背景有轻微虚化的书架和绿植,午后阳光从侧面照进来,皮肤质感真实,五官比例协调,特写镜头,浅景深,皮肤细节清晰,8K画质这一段里,真正提高稳定性的关键词其实是“皮肤质感真实、五官比例协调、浅景深、特写镜头”。模型对人像的审美匹配度很高,你只要不写“镜头畸变”“鱼眼”“恐怖”之类的词,出图一般不会太离谱。新手最容易犯的毛病是堆砌大量风格词,比如“杰作、最佳质量、超高清、获奖摄影”全上,这在Qwen-Image-2.1里意义不大。它的大模型训练已经内化了高画质概念,多写这类词反而浪费时间,甚至会让细节过锐。
还有一个经验:提示词里的名词顺序有优先级。靠近前面的内容会被优先保障,所以“主体是人”一定要写在最前面,后面再叠加环境和服饰。比如“室内灯光昏暗,一位老人坐在木椅上”和“一位老人坐在木椅上,室内灯光昏暗”,两种写法出来的画面重点可能完全相反。
2.2 风格化人像的提示词组合
人像生成经常遇到的场景是古风、胶片、赛博朋克这几类。风格化不是简单加一个形容词,而是需要把“风格词+材质词+镜头感”组合起来。拿古风人像举例,单纯写“古风女孩”很空,更好的写法是:
古风女子,身着淡青色汉服,盘发,发簪点缀,手持团扇,妆容素雅,背景是江南庭院,白墙黛瓦,桃花枝从画面左上角垂入,柔光,画意摄影,多层次景深,人物轮廓清晰这里“画意摄影”是在定义整体美学方向,“柔光”是定义光质,“多层次景深”是告诉模型前后景不是完全贴在一起的。在胶片风格里,可以写“胶片颗粒感、低饱和、暗角、日光白平衡”,但注意不要和“细腻皮肤”同时出现,否则模型会犹豫到底要颗粒还是细腻,最后生成一个“带颗粒还磨皮”的怪效果。赛博朋克场景则要多写光线颜色和环境符号,例如“霓虹青紫双色路灯光、雨天地面反射、机械义体感饰品、景深浅、广角变形尽量小”。
2.3 负面提示词与参数配合
负面提示词的写法,比很多人以为的更重要。Qwen-Image-2.1对负面提示词的响应比较直接,常用的负面词可以这么写:
低质量,模糊,噪点,畸变,五官扭曲,手指数量错误,多指,水印,文字,Logo,过度锐化,病态肤色,塑料感,背景杂乱需要特别提醒的是“文字”和“Logo”这类词。如果你生成的是纯人像,不想要画面出现任何文字,负面词里一定要带。如果做的是海报设计,那就不能统一屏蔽文字,而要正面引导。参数配合方面,我用的是:步数20到30,CFG 3.5到6之间。Qwen-Image-2.1官方建议CFG不要太高,超过8容易让画面变“焦”、产生光环感,尤其在额头和肩膀边缘。种子值建议固定,方便复现和微调。想快速看不同构图效果,先锁种子只改提示词后半段,效率最高。
2.4 常见报错与提示词修正
- 脸部歪斜、五官不对称:大多数原因不是模型不好,而是提示词里写了正面特写的同时又写了“身体全貌”,模型为了兼顾两者而做了奇怪的脸部透视。解决方法是明确镜头语言,正面特写就写“脸部特写、平视、五官对称”,不要写“全身照”。
- 性别特征混淆:很多人写着写着塞了太多“中性、英气、俊美”这类词,模型偶尔会出现男相女身。想保持明确女性特征,用“女性特征明显、妆容、柔和的骨骼轮廓”这类词兜底。
- 出现多余肢体:多人场景尤其常见。提示词里尽量对每个人的位置、动作写清楚,比如“左一戴帽、右一背包”,不要只写“两个女人”。
- 颜色溢出:红色衣物容易让肤色发红。这时候负面词加“色彩溢出、反射色污染”,并在正面把光照写清楚,例如“中性白平衡、无环境色染”。
3. 发型表情编辑:用提示词做局部修改
3.1 发型编辑提示词示例
Qwen-Image-2.1的图像编辑能力,适合拿来改发型。核心思路是:输入一张原图,用自然语言描述“保留脸部特征,只把头发改成XX”。实际操作里,裁剪原图到脸部附近会得到更精准的效果。你如果全图丢进去,模型要同时维护场景、衣物、背景,留给发型的容量自然就小了。
给一个改发型提示词模板:
基于参考图,保留人物五官和面部特征不变,将发型修改为齐刘海黑色波波头,发尾内扣,头发质感真实,发丝清晰,背景和服装保持不变这里“基于参考图”和“保留人物五官和面部特征不变”是关键。模型接收到这类指令后,会把编辑重心放在头发区域。如果原图的头发遮挡了前额,改成齐刘海时就需要提示词里额外写“脸部参考使用额头以下区域的五官特征”,避免模型把原来的中分线残留下来。
另一种情况是只给提示词、不输入参考图,让模型凭空想象人像并附带发型。这时发型描述要更物质化,比如“高颅顶”、“厚实蓬松”、“碎发修饰额角”,这些词其实是在告诉模型“发型的体积感和存在方式”,而不是单纯指颜色。很多新手只写“长发”或“卷发”,出来的发型永远是一团没有层次的色块,就是因为没有描述头发的体积与分界。
3.2 表情与情绪引导
面部表情的修改,分寸感很关键。Qwen-Image-2.1对“微笑”、“大笑”、“悲伤”、“惊讶”这些大表情理解得很好,但如果你想要微表情,比如“嘴角微扬但眼神平静”,就需要把矛盾信息拆开:先指定嘴部动作,再指定眼部情绪。
我常用的表情编辑提示词写法:
保持人物身份特征,修改面部表情为淡淡的微笑,嘴角自然上扬,眼睛保持平和的视线,眉毛放松,表情自然不做作改写悲伤情绪可以这样:
眉头轻微蹙起,嘴唇轻抿,眼神下垂,眼尾略带泛红,整体情绪为克制的悲伤注意“克制”这种词很有效,模型对情绪强度的理解基本靠它。你直接写“悲伤”,模型可能生成大哭那种;加上“克制”就会变成压抑感的微表情。表情编辑还会遇到一个典型问题:改完表情后,五官位置微变,脸型却崩了。解决办法是在提示词里加“脸型轮廓保持不变,五官比例协调、对称”,同时负面提示词加“面部扭曲、脸型改变”。
3.3 局部编辑的注意事项
局部编辑的核心是“控制区域”。在ComfyUI里,通常用遮罩或重绘区域来限定模型改动范围,而提示词只描述这个范围内发生的变化。如果完全靠纯自然语言编辑,模型会自行判断修改范围,结果往往不可控。我的建议是:能用遮罩尽量用遮罩,提示词负责描述结果,区域控制交给UI。
编辑发型或表情时,原图分辨率也会影响结果。低分辨率脸部特征信息不足,模型会“脑补”五官,结果可能换了一张脸。所以老照片或模糊小图要先做脸部增强,或者用局部重绘把脸部放在足够大的像素范围内,我一般会让脸部区域至少占画面宽度的1/3。还有一个经验:编辑后如果发现人物身份感变了,可以把原图同时作为参考图再次叠进画面,配合低重绘幅度做一轮“身份拉回”,这招在写实人像里尤其好用。
4. 老照片修复实操
4.1 预处理与参数选择
老照片修复不是简单丢给模型“修复一下”就完事。预处理决定了修复上限。流程上我通常会做三步:扫描或拍摄原图、污损区域尽量保留最大信息、先放大到合适分辨率。很多人直接把几十KB的小尺寸照片丢进去,出来的修复图就像一个“锐化过的模糊块”,因为源信息已经丢了,模型再强也只能无中生有。
分辨率选择上,修复目标建议在不拉伸导致明显涂抹感的前提下,尽可能提高输入分辨率。如果原图只有512x512,可以先做一个基础放大到1024x1024,再放进Qwen-Image-2.1做修复。放大算法用什么?我个人常用Real-ESRGAN或类似算法,但它会造成皮肤蜡感,所以放大之后需要用提示词拉回真实质感。参数方面,修复类任务建议步数24到30,CFG 5左右,重绘幅度控制在0.35到0.55之间。幅度太低,污渍裂纹去不掉;幅度太高,人脸会直接换头。
4.2 修复提示词写法
老照片修复的提示词,重点是同时说清楚“我想看到什么”和“我不想看到什么”。一个可复制的模板:
修复这张老照片,去除划痕、噪点、污渍和折痕,增强人物面部清晰度,恢复自然肤色,保留人物原本的五官特征,头发纹理清晰,衣物细节自然,背景保持合理,不要改变人物身份,画面整体自然细腻,不做过度磨皮这里“保留人物原本的五官特征”和“不做过度磨皮”是反向约束,能有效防止模型把照片修成“网红塑料脸”。老照片修复还有一个典型踩坑点:模型会默认把旧时代的着装改成当代审美。如果你修复的是民国时期或上世纪80年代的老照片,需要明确告诉模型,比如“维持原照片的年代服饰特征、发型与服装式样保持不变”,否则它会给你换上一身现代装。
对于黑白照片,要在提示词里处理色彩策略。如果你想保留黑白质感,就写“保持黑白影调,只修复清晰度,不添加颜色”;如果你想上色,则写“基于服装年代特征,进行写实彩色化,肤色自然,色彩饱和度适中”。彩色化的时候,皮肤颜色是最容易编造的,建议负面词加“夸张化色彩、混色不均、皮肤发蓝发绿”。
4.3 修复质量判断与反修复
修复完怎么判断质量?我有一个笨但有效的方法:把修复图和原图并排看五官一致性。如果脸型、眼型、鼻子的相对关系出现大变化,基本可以判定修复过度了。另一个方法是看皮肤纹理。修复图如果整张脸光滑如蜡,说明重绘幅度或提示词中的“磨皮”语义过强。此时要做“反修复”,也就是把修复图再局部重绘一遍,提示词换成“增强皮肤毛孔细节、增加适度的真实肤质纹理、保留五官结构不变”。这算是一个二次精修思路,很多人不知道,但实际非常管用。
修复老照片时,人像同时存在多个破损区域的情况下,不建议一次性全局修复。我会用遮罩把面部单独修一遍,再把身体衣服部分遮罩修一遍,最后是全图统一降噪。分区域修复让每个区域的光影和尺度都对得上,最后合并时很少出现“脸是实拍、背景是画”那种割裂感。
5. 整合包部署与环境配置
5.1 整合包是什么,为什么要用整合包
整合包的最大价值是省掉环境配置过程。本地部署Qwen-Image-2.1本身不难,难点在于依赖版本匹配:PyTorch版本、CUDA版本、ComfyUI版本、模型文件结构,随便一个不匹配就是黑洞式的报错。整合包把所有东西打包好,像秋叶的ComfyUI整合包,就内置了常用模型管理、一键启动器和预装节点,对新手来说,这是最稳妥的入口。
“整合包”这个说法在不同社区里指的东西不完全一样。有的是纯粹模型打包,有的是工作流加模型加插件全家桶。下载的时候要优先看说明里有没有明确标注“包含Qwen-Image-2.1模型文件”和“依赖环境版本”,否则你可能要自己去模型社区下权重文件。模型比较大的情况下,用网盘分片压缩包是比较常见的分发方式,校验一下文件哈希或压缩包完整性,能避免解压出损坏文件。
5.2 ComfyUI秋叶整合包安装步骤
结合我自己的实测流程,完整步骤如下:
- 去整合包发布页下载对应版本的压缩包,优先选标注了Qwen-Image-2.1适配的版本,如果不确定,至少也要下载ComfyUI较新版本,模型文件另外补充。
- 解压到纯英文路径,这一步很重要。路径里有中文会导致一些外置节点读取失败,我踩过坑,比如“D:\软件\ComfyUI”和“D:\ComfyUI_windows”出现的报错概率完全不同。
- 打开“启动器”或“A启动器”,第一次启动会检查环境。如果提示缺少依赖,先更新依赖再运行,不要跳过。
- 模型放置路径:Qwen-Image-2.1的文生图模型文件一般是safetensors格式,放进ComfyUI的models/checkpoints目录;如果用Diffusers结构,要放到models/diffusers目录。放完后,启动ComfyUI,在模型列表里刷新,如果能看到Qwen-Image-2.1,就说明导入成功了。
- 推荐导入一个现成的人像工作流,选那种带“提示词文本框、负面提示词框、采样器、VAE解码”的标准流程。第一次跑图不要改任何参数,先跑一张确认环境正常。
- 升级节点:部分整合包自带“一键更新”,建议刚下载时更新一次核心节点,因为Qwen-Image-2.1出图对节点版本有要求,旧版采样器节点可能出现“未知调度器”报错。
如果你是Mac用户,整合包同样可用。M系列芯片建议使用GGUF量化版,内存占用会更友好。具体来说,选择带mlx或mps支持的整合包会更顺手,纯CUDA版本在Mac上跑不了。
5.3 GGUF量化版本地部署
GGUF量化版适合显存或内存紧张的机器。它在保持模型推理框架不变的前提下,把权重压缩到不同位宽,例如Q4_K_M、Q5_K_M等。对本地部署来说,Q4或Q5就已经能获得比较稳定的出图效果,再往下的Q2、Q3画质衰减就比较明显了。部署方式不算难,在ComfyUI中安装对应的加载器节点,然后指定GGUF模型路径即可。在Diffusers框架下跑则更接近传统流程。
量化版的好处是门槛低,但有一定的细节损失。人像场景下最明显的是发丝和皮肤纹理变软。如果你主要用于老照片修复这种细节敏感任务,我更推荐用完整版;如果主要玩法是“快速出概念人像”,GGUF量化版足够。使用量化版时,采样步数建议稍微增加一点,比如从24步加到30步,能在一定程度上弥补细节损失。
5.4 显存占用与速度优化
关于显存,完整版Qwen-Image-2.1在生成1024x1024图片时,依赖环境和采样参数不同,显存占用大约在5GB到8GB之间。8GB显卡能跑,但如果你同时打开多个工作流或者分辨率上到1344,就容易OOM。我常用的优化顺序是:
- 优先开启“内存管理/缓存管理”选项,让模型在生成间隙自动释放中间变量
- 将批次大小设为1,不要为了一次出四张图把显存直接拉爆
- 分辨率从1024起步,逐步上升,观察显存余量
- 使用轻量VAE或者开启tiled VAE,大图生成时可以减少单次峰值显存
- 若仍然爆显存,就换GGUF量化版
速度方面,20系列或30系列显卡基本是十几秒到三十秒一张图,40系速度会有明显提升。遇到出图极慢的情况,先检查是不是跑在CPU上,比如启动日志里显示“Using device: cpu”,那就需要重新调整环境变量,强制指定CUDA或MPS设备。
6. 常见问题与排查技巧实录
6.1 提示词不生效
这是最频繁的提问。提示词写了“卷发”,出来的还是直发,或者写了“夜景”,天空还是亮的。排查思路按顺序走:先确认采样步数是否过小,步数低于15可能导致语义融入不完全;再检查CFG是否过低,CFG小于3时模型对提示词的遵循度会明显下降;最后看是不是负面提示词里写了冲突内容,比如负面词里有“卷发”,那画面自然就不出卷发了。
还有一种情况是开启了随机提示词增强或自动扩写,模型把输入改写成了完全不相关内容。ComfyUI里如果串联了“CLIP Text Encode”之外的自然语言处理节点,先断开再测试,问题经常就出在这。
6.2 人脸崩坏、五官变形
人脸崩坏可分两类。第一类是“完全崩”,五官扭曲、眼睛错位,这通常是采样步数太少或者模型加载不完整。重新加载模型、提高步数即可。第二类是“轻微畸形”,比如眼睛一大一小,或者笑起来嘴是歪的。这种情况一般可以通过提示词修正:正面写“五官对称,面部自然”,负面词写“非对称面部、五官歪斜、左右眼不一致”。
如果崩坏只出现在画面边缘,可以放宽构图,不要把人脸贴边。很多工作流默认生成横向构图,人脸位置靠边缘,模型在这种位置的基础生成能力会变弱。换成竖构图或把主题放中间,“边缘脸崩”出现的概率会低很多。
6.3 多角色一致性
生成多个角色时,最让人头疼的就是“左脸右脸不是同一人”。要解决这个问题,可以把多个角色的特征写得很具体,避免只用“男”“女”区分。比如“戴眼镜的短发女性”和“扎马尾的女性”,特征词汇足够多时,模型会自动建立区分。如果你要两个人长得相似,比如双胞胎,就写“两张相似的脸,同样的眼型和鼻型,脸型一致,气质略有不同”,出图效果会明显好于生硬写“双胞胎”。
想追求严格的角色一致性,最靠谱的还是用参考图或IPAdapter类能力,让模型以图生图方式锁定角色特征。提示词在这一场景下更适合用来描述动作和构图,而不是完全指望文本描述人物长相。
6.4 显存不足、OOM报错
OOM时,不同版本的ComfyUI处理方式不一样。有些会在日志里提示“CUDA out of memory”,有些直接卡死。先别着急换显卡,按这个顺序处理:
- 关掉所有无关后台程序,尤其是浏览器里大量标签页,浏览器吃显存这个事经常被忽略
- ComfyUI设置里降低“max memory cache size”,比如从1000降到300
- 打开“smart memory management”选项,让系统自动清理缓存
- 将工作流中的“Batch size”改为1
- 如果仍然报错,把生成分辨率从1024降到768,确认能出图后再考虑优化
注意,笔记本用户如果开了核显和独显同时工作,偶尔会默认让进程跑在核显上,出图慢但显存却显示占用高。建议在系统图形设置里强制指定ComfyUI使用高性能显卡。
6.5 图片质量压制、涂抹感
修复图总感觉像油画或水彩,这种“涂抹感”主要来自重绘幅度过高或模型细节恢复能力不足。对老照片修复来说,重绘幅度0.5以上很容易出现涂抹。遇到这种情况,修图策略改为低幅度多次迭代:第一次幅度0.3修复大瑕疵,第二次0.25增强细节,第三次只在局部重绘。这样比一次幅度拉到0.6再指望用提示词拉回来的效果好得多。
还有一个偏门但特别有用的点:很多涂抹感来自VAE输出和模型不匹配。ComfyUI默认加载的VAE如果和模型不配套,细节纹理就会被挤压。可以手动更换为模型作者推荐的VAE文件,再重新出图,你会发现皮肤的质感和锐度完全不一样。
6.6 整合包下载和解压遇到的坑
下载整合包时,一定要看包体说明里是否有“已包含模型”或“需自行下载模型”字样。很多人下载了一个“ComfyUI整合包”跑起来发现没有Qwen-Image-2.1,不是因为整合包有问题,而是模型需要单独下载。解压时避免杀毒软件隔离部分文件,启动器、Python运行时这类文件经常被误杀。解压完成后,先运行一次“更新依赖”或“检查环境”,能提前暴露很多问题。
压缩包后缀是分卷的那种,一定要全部下载后再解压,少一个分卷解压会报错。如果解压中途报CRC错误,优先考虑重新下载出错的分卷,不要硬解。路径里不要有空格可能还好说,最好不要有中文或特殊符号。
6.7 纯文本生成图片后如何转成可复现工作流
还有一个高频需求:很多人希望把Qwen-Image-2.1的官方示例结果复现出来,但官方页面提供了模型权重和diffusers的推理代码,没有ComfyUI工作流。不要慌,逻辑是通用的。拿到一段推理代码,关注几个关键参数:模型路径、采样器类型、步数、CFG、输出尺寸。然后在ComfyUI里按流程节点搭建即可。
复制采样器名称时要注意命名兼容问题,比如“DPM++ 2M Karras”这类称呼在ComfyUI里可能叫“dpmpp_2m”加“karras”调度器。参数对不上时,画面风格和官方示例差距会很大。我第一次复现官方人像图时,就是因为调度器选成了“normal”,结果整张图偏灰,改成“karras”之后就正常了。
7. 一个最想分享的修图顺序
绕了一大圈,最后分享一条个人的实操顺序,算是结合所有经验浓缩出的工作流。人像生成,顺序是“提示词定人设、参数定氛围、种子定构图”;发型表情编辑,顺序是“裁图定区域、提示词定变化、低重绘保身份”;老照片修复,顺序是“先放大、再分区修、最后统一降噪”。这三条线看起来各自独立,实际操作中经常混用。比如你会先修复老照片得到一张高清底图,再代人像提示词做表情编辑,最后把成品作为参考图输送到新的场景里做主题海报。这种组合玩法,才是Qwen-Image-2.1在人像方向最大的价值。
我也确实踩过很多坑。最深刻的一条是:不要迷信“大而全”的提示词,不要以为提示词越长越好。模型真正理解的是结构清晰的语义块,逻辑上互相支撑的信息才能被正确渲染。你堆砌一百个形容词,它只会抓取最前面那三五个。把想法拆开,一句一句写清楚,比任何华丽词库都管用。希望这篇内容能帮你少走点弯路。