【ComfyUI】SD1.5 + ControlNet 姿态二次引导图生图
2026/9/18 11:09:17 网站建设 项目流程

今天给大家演示一个结合ControlNet 姿态控制图像二次生成(Image to Image)的 ComfyUI 工作流。这个流程通过加载输入图像并结合姿态引导,使得生成结果在保持主体结构一致的同时,更加精致和富有表现力。

整个工作流利用了核心模型、VAE、ControlNet 以及多种 Node 节点协作完成,从输入到最终保存图像的每个环节,都体现了稳定扩散模型在图像控制与再创造上的强大能力。

文章目录

  • 工作流介绍
    • 核心模型
    • Node节点
  • 工作流程
  • 大模型应用
    • CLIPTextEncode(第一阶段正向) 语义驱动的姿态重构描述
    • CLIPTextEncode(第一阶段负向) 杂质与错误抑制
    • CLIPTextEncode(第二阶段正向) 细节强化与风格巩固
    • CLIPTextEncode(第二阶段负向) 最终输出质量的矫正
  • 使用方法
  • 应用场景
  • 开发与应用

工作流介绍

该工作流以majicmixRealistic_v7japaneseStyleRealistic_v20两个 Checkpoint 模型为核心,配合 VAE 进行高质量解码,并结合 ControlNet 的 openpose 姿态引导,实现了人物姿态可控的高写实图像生成。同时,CLIP 编码器负责对正向与负向提示词进行语义解析,使得图像生成既能符合语义表达,又能规避低质量和不需要的元素。通过 LatentUpscale、KSampler、VAE 解码等环节,图像逐步优化并最终保存,确保了成品在细节和整体观感上的平衡。

核心模型

在核心模型的选择上,工作流采用了majicmixRealistic_v7模型来保证写实风格的表现力,同时辅以japaneseStyleRealistic_v20模型增强风格化细节。两者的结合让最终生成图像既具备高保真写实效果,又带有艺术化的美学特征。搭配的vae-ft-mse-840000-ema-prunedVAE 则在解码阶段保证了色彩与纹理的准确还原。

模型名称说明
majicmixRealistic_v7.safetensors高写实风格的稳定扩散模型,保证主体真实感
japaneseStyleRealistic_v20.safetensors日系写实风格模型,提升画面艺术表现
vae-ft-mse-840000-ema-pruned.safetensors用于高质量解码的 VAE,增强细节与色彩还原
control_v11p_sd15_openpose_fp16.safetensorsControlNet 姿态引导模型,保证人体结构与动作可控

Node节点

该工作流的节点设计围绕输入 → 姿态控制 → 条件采样 → 解码 → 保存输出的逻辑展开。通过 LoadImage 输入图像后,ControlNetLoader 与 ControlNetApplyAdvanced 共同处理姿态信息;CLIP 模块结合文本提示词进行正向与负向引导,KSampler 则在模型条件下进行扩散采样。随后,LatentUpscale 节点对生成的潜空间结果进行放大,VAEDecode 节点完成图像解码,最后经 PreviewImage 预览与 SaveImage 保存,得到最终成品。

节点名称说明
LoadImage载入输入参考图像
ControlNetLoader加载姿态控制模型
ControlNetApplyAdvanced将姿态约束应用于条件编码
CheckpointLoaderSimple加载核心生成模型
CLIPTextEncode将提示词编码为条件信息
KSampler基于条件与模型进行扩散采样
LatentUpscale对潜空间结果进行放大
VAEDecode将潜空间数据解码为最终图像
PreviewImage输出中间或最终效果进行预览
SaveImage保存最终生成的图像结果

工作流程

整个工作流程从输入到输出的环节紧密衔接,首先通过LoadImage节点载入参考图像,并由ControlNetLoaderControlNetApplyAdvanced提供姿态约束,使生成的图像在结构上保持与输入一致。随后,CheckpointLoaderSimple载入核心模型,结合CLIPTextEncode对正负提示词进行解析与条件引导,再由KSampler执行扩散采样,生成初始潜空间图像。之后,LatentUpscale对潜空间进行尺寸提升,确保图像在细节与分辨率上的增强,接着通过VAEDecode进行解码,还原为高质量图像。最后,用户可以通过PreviewImage预览效果,并在满意后通过SaveImage保存最终结果。整个过程形成了一个从输入控制、条件采样、潜空间优化到最终输出的完整闭环。

流程序号流程阶段工作描述使用节点
1图像输入载入参考图像,作为姿态与风格控制的起点LoadImage
2姿态控制加载并应用 ControlNet 姿态约束,使生成结果遵循目标动作ControlNetLoader / ControlNetApplyAdvanced
3模型载入调用核心模型与 CLIP,用于解析正负提示词和提供生成基础CheckpointLoaderSimple / CLIPSetLastLayer
4文本条件解析将提示词转化为语义条件信息,引导生成方向CLIPTextEncode
5条件采样在模型与条件引导下进行潜空间采样,生成初始图像结构KSampler
6分辨率提升对采样结果进行放大处理,增强细节与清晰度LatentUpscale
7图像解码通过 VAE 将潜空间图像解码为真实图像VAEDecode
8结果预览与输出输出预览效果,保存最终成品图像PreviewImage / SaveImage

大模型应用

CLIPTextEncode(第一阶段正向) 语义驱动的姿态重构描述

第一阶段的正向 Prompt 用来描述画面希望呈现的主体形象、光线、情绪与整体视觉质感。模型根据这些语义信息,在保持原始姿态结构的前提下生成符合描述的初步画面。Prompt 的细节越充分,人物的面部、氛围和光影越能被准确还原。

节点名称Prompt 信息说明
CLIPTextEncode(第一阶段正向)A serene portrait of a young Asian woman is captured in this photograph, set against a soft, diffused background…(原文较长,已完整保留)将长文本转成语义向量,用于引导第一阶段的结构重绘,使姿态与语义内容保持协调。

CLIPTextEncode(第一阶段负向) 杂质与错误抑制

第一阶段的负向 Prompt 专注过滤姿态重绘中常见问题,如四肢错位、异常纹理、水印、文字与压缩痕迹,确保初版画面的纯净度。

节点名称Prompt 信息说明
CLIPTextEncode(第一阶段负向)(hands), text, error, cropped, (worst quality:1.2)…(原文完整保留)过滤生成中的杂质与错误,保证初次重绘的干净度和结构稳定性。

CLIPTextEncode(第二阶段正向) 细节强化与风格巩固

在第一阶段姿态与结构稳定后,第二阶段正向 Prompt 再次发挥作用,为最终图像补全细腻纹理、提升光影层次并统一整体风格。

节点名称Prompt 信息说明
CLIPTextEncode(第二阶段正向)A serene portrait of a young Asian woman is captured in this photograph…(与第一阶段一致)用于第二阶段高质量生成,使最终成片呈现更成熟、稳定且细节丰富的视觉效果。

CLIPTextEncode(第二阶段负向) 最终输出质量的矫正

该节点确保在第二阶段放大生成中依然保持画面干净,无论是脸部还是姿态,都能保持自然,不出现额外噪点或结构问题。

节点名称Prompt 信息说明
CLIPTextEncode(第二阶段负向)(hands), text, error, cropped, (worst quality:1.2)…(与第一阶段一致)防止高分辨率生成中出现新瑕疵,保持最终画面的清晰与自然度。

使用方法

这套工作流以双阶段结构为核心,先用姿态 ControlNet 锁定上传图片中的人体骨架,再由两组正向与负向 Prompt 逐步完成画面重建与细节提升。你只需上传一张姿态清晰的原图,并填写希望呈现的画面语义,系统便会依据姿态结构生成第一阶段图像,再在高分辨率阶段进一步增强光影、质感与人像细节。正向 Prompt 决定最终画面的风格与内容,负向 Prompt 负责维持干净的画面质量。整套流程无需手动调整复杂参数,只需替换图片和文本描述,即可获得姿态一致、风格统一且细节精致的成片。

注意点说明
上传图需姿态清晰控制姿态的骨架越明确,最终生成越稳定
两阶段正向 Prompt 保持一致性有助于统一风格与氛围,避免前后视觉差异
负向 Prompt 建议完整保留以减少结构错误、噪点和失真细节
适合人像、时尚和姿态复现强调姿态可控与风格自由组合
不需手动调节 ControlNet 强度默认结构已适配该双阶段流程

应用场景

该工作流的应用场景集中在人物姿态可控的高质量图像生成。在实际使用中,用户能够通过输入参考图像与姿态控制,得到既符合原始结构又具有创意表现的作品,非常适合用于人物写真生成、艺术化再创作以及风格迁移类项目。对于需要严格控制动作或姿势的用户,比如插画师、摄影后期或游戏美术,该流程提供了高效而直观的解决方案。在输出内容上,成品图像不仅具备高清晰度和精细表现力,还能在艺术风格与真实感之间取得平衡,最终实现高质量的视觉呈现。

应用场景使用目标典型用户展示内容实现效果
人物姿态生成通过姿态控制生成符合要求的人物图像插画师 / 游戏美术 / 设计师姿态一致的高质量角色图像保持动作一致同时实现风格化
人像写真优化在原始照片基础上进行再创作与画质提升摄影师 / 修图师高清真实感人像作品优化光影与细节,保证写实质感
风格化艺术生成将人物姿态与艺术风格结合进行创作艺术创作者 / 内容创作者带有艺术风格的人物作品在写实与风格化之间自由切换
二次元或写实混合风格通过不同模型组合实现跨风格表现动漫爱好者 / CG 艺术家半写实或日系写实人物风格多样化,表现力更丰富

开发与应用

更多 AIGC 与 ComfyUI工作流 相关研究学习内容请查阅:

ComfyUI使用教程、开发指导、资源下载

更多内容桌面应用开发和学习文档请查阅:

AIGC工具平台Tauri+Django环境开发,支持局域网使用
AIGC工具平台Tauri+Django常见错误与解决办法
AIGC工具平台Tauri+Django内容生产介绍和使用
AIGC工具平台Tauri+Django开源ComfyUI项目介绍和使用
AIGC工具平台Tauri+Django开源git项目介绍和使用

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询