【ComfyUI】Z-Image 基础图生图
2026/9/18 11:16:06 网站建设 项目流程

今天给大家演示一个基于参考图自动生成高质量文生图提示词并完成图像生成的 ComfyUI 工作流。该流程以一张输入图片为起点,通过图像理解模型对画面进行结构化描述,再将生成的自然语言内容与补充文本进行拼接,最终送入扩散模型完成再创作。整体效果偏向“可控、克制、结构清晰”的视觉表达,非常适合用于服装展示、人物比例强化以及偏理性的时尚类图像生成。

通过效果图可以直观看到,这套工作流并不是单纯复刻原图,而是在保留主体结构和气质的基础上,完成一次干净、有方向性的重绘输出。

文章目录

  • 工作流介绍
    • 核心模型
    • Node 节点
  • 工作流程
  • 大模型应用
    • RH_Captioner 图像语义理解与描述生成
  • 使用方法
  • 应用场景
  • 开发与应用

工作流介绍

该工作流围绕“参考图 → 语义理解 → 文本条件生成 → 扩散采样”这一主线展开,整体结构清晰且高度模块化。流程中首先加载参考图片,并利用图像描述节点自动生成高密度、偏客观的画面描述文本;随后通过文本拼接与 CLIP 编码,将这些描述转化为稳定、可控的正向条件;在负向条件上则通过 Conditioning 清空节点进行统一抑制,减少噪声干扰。最终,结合 UNet、VAE 与标准采样器完成图像生成与解码,输出结果在比例、结构与质感上保持高度一致性。

核心模型

本工作流在模型选择上偏向“轻量但明确分工”的组合方式。UNet 负责整体生成风格与结构收敛,CLIP 模型用于承载由图像反推而来的语义信息,VAE 则专注于最终画面的解码质量。三者之间的职责边界清晰,使得整个流程在生成速度与稳定性之间取得平衡,也便于后期针对单一模块进行替换或升级。

模型名称说明
z_image_turbo_bf16.safetensors作为核心 UNet 模型,负责扩散过程中的结构生成与风格控制,偏向稳定、收敛快的图像输出
qwen_3_4b.safetensors

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询