今天给大家演示一个结合ControlNet 姿态控制与图像二次生成(Image to Image)的 ComfyUI 工作流。这个流程通过加载输入图像并结合姿态引导,使得生成结果在保持主体结构一致的同时,更加精致和富有表现力。
整个工作流利用了核心模型、VAE、ControlNet 以及多种 Node 节点协作完成,从输入到最终保存图像的每个环节,都体现了稳定扩散模型在图像控制与再创造上的强大能力。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- CLIPTextEncode(第一阶段正向) 语义驱动的姿态重构描述
- CLIPTextEncode(第一阶段负向) 杂质与错误抑制
- CLIPTextEncode(第二阶段正向) 细节强化与风格巩固
- CLIPTextEncode(第二阶段负向) 最终输出质量的矫正
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
该工作流以majicmixRealistic_v7和japaneseStyleRealistic_v20两个 Checkpoint 模型为核心,配合 VAE 进行高质量解码,并结合 ControlNet 的 openpose 姿态引导,实现了人物姿态可控的高写实图像生成。同时,CLIP 编码器负责对正向与负向提示词进行语义解析,使得图像生成既能符合语义表达,又能规避低质量和不需要的元素。通过 LatentUpscale、KSampler、VAE 解码等环节,图像逐步优化并最终保存,确保了成品在细节和整体观感上的平衡。
核心模型
在核心模型的选择上,工作流采用了majicmixRealistic_v7模型来保证写实风格的表现力,同时辅以japaneseStyleRealistic_v20模型增强风格化细节。两者的结合让最终生成图像既具备高保真写实效果,又带有艺术化的美学特征。搭配的vae-ft-mse-840000-ema-prunedVAE 则在解码阶段保证了色彩与纹理的准确还原。
| 模型名称 | 说明 |
|---|---|
| majicmixRealistic_v7.safetensors | 高写实风格的稳定扩散模型,保证主体真实感 |
| japaneseStyleRealistic_v20.safetensors | 日系写实风格模型,提升画面艺术表现 |
| vae-ft-mse-840000-ema-pruned.safetensors | 用于高质量解码的 VAE,增强细节与色彩还原 |
| control_v11p_sd15_openpose_fp16.safetensors | ControlNet 姿态引导模型,保证人体结构与动作可控 |
Node节点
该工作流的节点设计围绕输入 → 姿态控制 → 条件采样 → 解码 → 保存输出的逻辑展开。通过 LoadImage 输入图像后,ControlNetLoader 与 ControlNetApplyAdvanced 共同处理姿态信息;CLIP 模块结合文本提示词进行正向与负向引导,KSampler 则在模型条件下进行扩散采样。随后,LatentUpscale 节点对生成的潜空间结果进行放大,VAEDecode 节点完成图像解码,最后经 PreviewImage 预览与 SaveImage 保存,得到最终成品。
| 节点名称 | 说明 |
|---|---|
| LoadImage | 载入输入参考图像 |
| ControlNetLoader | 加载姿态控制模型 |
| ControlNetApplyAdvanced | 将姿态约束应用于条件编码 |
| CheckpointLoaderSimple | 加载核心生成模型 |
| CLIPTextEncode | 将提示词编码为条件信息 |
| KSampler | 基于条件与模型进行扩散采样 |
| LatentUpscale | 对潜空间结果进行放大 |
| VAEDecode | 将潜空间数据解码为最终图像 |
| PreviewImage | 输出中间或最终效果进行预览 |
| SaveImage | 保存最终生成的图像结果 |
工作流程
整个工作流程从输入到输出的环节紧密衔接,首先通过LoadImage节点载入参考图像,并由ControlNetLoader和ControlNetApplyAdvanced提供姿态约束,使生成的图像在结构上保持与输入一致。随后,CheckpointLoaderSimple载入核心模型,结合CLIPTextEncode对正负提示词进行解析与条件引导,再由KSampler执行扩散采样,生成初始潜空间图像。之后,LatentUpscale对潜空间进行尺寸提升,确保图像在细节与分辨率上的增强,接着通过VAEDecode进行解码,还原为高质量图像。最后,用户可以通过PreviewImage预览效果,并在满意后通过SaveImage保存最终结果。整个过程形成了一个从输入控制、条件采样、潜空间优化到最终输出的完整闭环。
| 流程序号 | 流程阶段 | 工作描述 | 使用节点 |
|---|---|---|---|
| 1 | 图像输入 | 载入参考图像,作为姿态与风格控制的起点 | LoadImage |
| 2 | 姿态控制 | 加载并应用 ControlNet 姿态约束,使生成结果遵循目标动作 | ControlNetLoader / ControlNetApplyAdvanced |
| 3 | 模型载入 | 调用核心模型与 CLIP,用于解析正负提示词和提供生成基础 | CheckpointLoaderSimple / CLIPSetLastLayer |
| 4 | 文本条件解析 | 将提示词转化为语义条件信息,引导生成方向 | CLIPTextEncode |
| 5 | 条件采样 | 在模型与条件引导下进行潜空间采样,生成初始图像结构 | KSampler |
| 6 | 分辨率提升 | 对采样结果进行放大处理,增强细节与清晰度 | LatentUpscale |
| 7 | 图像解码 | 通过 VAE 将潜空间图像解码为真实图像 | VAEDecode |
| 8 | 结果预览与输出 | 输出预览效果,保存最终成品图像 | PreviewImage / SaveImage |
大模型应用
CLIPTextEncode(第一阶段正向) 语义驱动的姿态重构描述
第一阶段的正向 Prompt 用来描述画面希望呈现的主体形象、光线、情绪与整体视觉质感。模型根据这些语义信息,在保持原始姿态结构的前提下生成符合描述的初步画面。Prompt 的细节越充分,人物的面部、氛围和光影越能被准确还原。
| 节点名称 | Prompt 信息 | 说明 |
|---|---|---|
| CLIPTextEncode(第一阶段正向) | A serene portrait of a young Asian woman is captured in this photograph, set against a soft, diffused background…(原文较长,已完整保留) | 将长文本转成语义向量,用于引导第一阶段的结构重绘,使姿态与语义内容保持协调。 |
CLIPTextEncode(第一阶段负向) 杂质与错误抑制
第一阶段的负向 Prompt 专注过滤姿态重绘中常见问题,如四肢错位、异常纹理、水印、文字与压缩痕迹,确保初版画面的纯净度。
| 节点名称 | Prompt 信息 | 说明 |
|---|---|---|
| CLIPTextEncode(第一阶段负向) | (hands), text, error, cropped, (worst quality:1.2)…(原文完整保留) | 过滤生成中的杂质与错误,保证初次重绘的干净度和结构稳定性。 |
CLIPTextEncode(第二阶段正向) 细节强化与风格巩固
在第一阶段姿态与结构稳定后,第二阶段正向 Prompt 再次发挥作用,为最终图像补全细腻纹理、提升光影层次并统一整体风格。
| 节点名称 | Prompt 信息 | 说明 |
|---|---|---|
| CLIPTextEncode(第二阶段正向) | A serene portrait of a young Asian woman is captured in this photograph…(与第一阶段一致) | 用于第二阶段高质量生成,使最终成片呈现更成熟、稳定且细节丰富的视觉效果。 |
CLIPTextEncode(第二阶段负向) 最终输出质量的矫正
该节点确保在第二阶段放大生成中依然保持画面干净,无论是脸部还是姿态,都能保持自然,不出现额外噪点或结构问题。
| 节点名称 | Prompt 信息 | 说明 |
|---|---|---|
| CLIPTextEncode(第二阶段负向) | (hands), text, error, cropped, (worst quality:1.2)…(与第一阶段一致) | 防止高分辨率生成中出现新瑕疵,保持最终画面的清晰与自然度。 |
使用方法
这套工作流以双阶段结构为核心,先用姿态 ControlNet 锁定上传图片中的人体骨架,再由两组正向与负向 Prompt 逐步完成画面重建与细节提升。你只需上传一张姿态清晰的原图,并填写希望呈现的画面语义,系统便会依据姿态结构生成第一阶段图像,再在高分辨率阶段进一步增强光影、质感与人像细节。正向 Prompt 决定最终画面的风格与内容,负向 Prompt 负责维持干净的画面质量。整套流程无需手动调整复杂参数,只需替换图片和文本描述,即可获得姿态一致、风格统一且细节精致的成片。
| 注意点 | 说明 |
|---|---|
| 上传图需姿态清晰 | 控制姿态的骨架越明确,最终生成越稳定 |
| 两阶段正向 Prompt 保持一致性 | 有助于统一风格与氛围,避免前后视觉差异 |
| 负向 Prompt 建议完整保留 | 以减少结构错误、噪点和失真细节 |
| 适合人像、时尚和姿态复现 | 强调姿态可控与风格自由组合 |
| 不需手动调节 ControlNet 强度 | 默认结构已适配该双阶段流程 |
应用场景
该工作流的应用场景集中在人物姿态可控的高质量图像生成。在实际使用中,用户能够通过输入参考图像与姿态控制,得到既符合原始结构又具有创意表现的作品,非常适合用于人物写真生成、艺术化再创作以及风格迁移类项目。对于需要严格控制动作或姿势的用户,比如插画师、摄影后期或游戏美术,该流程提供了高效而直观的解决方案。在输出内容上,成品图像不仅具备高清晰度和精细表现力,还能在艺术风格与真实感之间取得平衡,最终实现高质量的视觉呈现。
| 应用场景 | 使用目标 | 典型用户 | 展示内容 | 实现效果 |
|---|---|---|---|---|
| 人物姿态生成 | 通过姿态控制生成符合要求的人物图像 | 插画师 / 游戏美术 / 设计师 | 姿态一致的高质量角色图像 | 保持动作一致同时实现风格化 |
| 人像写真优化 | 在原始照片基础上进行再创作与画质提升 | 摄影师 / 修图师 | 高清真实感人像作品 | 优化光影与细节,保证写实质感 |
| 风格化艺术生成 | 将人物姿态与艺术风格结合进行创作 | 艺术创作者 / 内容创作者 | 带有艺术风格的人物作品 | 在写实与风格化之间自由切换 |
| 二次元或写实混合风格 | 通过不同模型组合实现跨风格表现 | 动漫爱好者 / CG 艺术家 | 半写实或日系写实人物 | 风格多样化,表现力更丰富 |
开发与应用
更多 AIGC 与 ComfyUI工作流 相关研究学习内容请查阅:
ComfyUI使用教程、开发指导、资源下载
更多内容桌面应用开发和学习文档请查阅:
AIGC工具平台Tauri+Django环境开发,支持局域网使用
AIGC工具平台Tauri+Django常见错误与解决办法
AIGC工具平台Tauri+Django内容生产介绍和使用
AIGC工具平台Tauri+Django开源ComfyUI项目介绍和使用
AIGC工具平台Tauri+Django开源git项目介绍和使用