AI绘画技术演进全景图:从GAN到DiT的华丽转身
2026/9/17 2:51:10 网站建设 项目流程

AI绘画技术演进全景图:从GAN到DiT的华丽转身

本文基于AI绘画课程体系整理,涵盖从GAN旧画师到DiT新一代架构的完整技术演进脉络,为你构建AI绘画的系统性认知框架。

一、技术演进时间线

2014 ──── GAN(生成对抗网络)诞生 │ └─ 旧画师:天生有缺陷 │ 2015-2020 ── VAE、流模型、自回归等中间探索 │ 2020 ──── DDPM(去噪扩散概率模型)提出 │ └─ 颠覆者:加噪与去噪的直观理解 │ 2021 ──── DALL-E 1 / CLIP / Guided Diffusion │ └─ Transformer + 扩散模型首次结合 │ 2022 ──── DALL-E 2 / Stable Diffusion / Imagen │ └─ 潜空间扩散 + CLIP文本引导 │ └─ Midjourney 商业化爆发 │ 2023 ──── SDXL / DALL-E 3 / ControlNet / LoRA │ └─ 高分辨率 + 精准控制 + 个性化 │ 2024-2026 ── DiT(Diffusion Transformer) └─ 从UNet到Transformer的架构革命 └─ ComfyUI 节点式工作流成熟 └─ Sora / Flux / SD3 等新一代模型

二、核心模块概览

2.1 课程迭代篇(3讲)

讲次主题时长核心要点
再次前行|紧跟AI绘画技术趋势03:07技术发展节奏与持续学习策略
从UNet到DiT:文生图模型的华丽转身01:13:28架构革命:UNet→Transformer,扩散模型的骨干网络演进
ComfyUI:节点式生图的效率革命27:26节点编排、工作流复用、批量生图

2.2 开篇词篇(2讲)

讲次主题时长核心要点
AI技术爆发,如何实现绘画模型自由?07:42开源生态、模型选择策略
先睹为快,AI绘画作品集09:21效果展示、应用场景概览

2.3 热身篇:AI绘画初体验(4讲)

讲次主题时长核心要点
01WebUI:免费AI绘画工具箱的N大绘图功能14:33Automatic1111 WebUI安装与功能全览
02Prompt使用技巧:精准控制风格和内容09:49正向/负向提示词、权重控制、风格词
03进阶应用:图生图技巧与创作社区初探13:15img2img、inpaint、Civitai社区资源
04实战项目(一):用LoRA制作你的漫画故事11:03LoRA加载、角色一致性、漫画分镜

2.4 基础篇:AI绘画原理揭秘(9讲)

讲次主题时长核心要点
05旧画师GAN:天生有缺陷还是学艺不精湛?15:10GAN原理、模式崩溃、训练不稳定性
06颠覆者扩散模型:直观理解加噪与去噪10:22DDPM前向/逆向过程、马尔可夫链
07AIGC的核心魔法:搞懂Transformer15:38自注意力、交叉注意力、位置编码
08巧用神经网络:如何用UNet预测噪声09:35UNet架构、下采样/上采样、跳跃连接
09采样器:龟兔赛跑,如何选择更好更快的采样器?10:40DDIM/DPM++/Euler/UniPC对比
10CLIP:让AI绘画模型乖乖听你的话14:31对比学习、文本-图像对齐、CLIP引导
11VAE系列:如何压缩图像给GPU腾腾地方11:25潜空间编码/解码、显存优化
12实战项目(二):动手训练你的扩散模型11:43从零训练DDPM、数据集准备、超参数
答疑1热点问题答疑&前两章思考题答案14:05GAN vs 扩散、采样器选择等常见问题

2.5 进阶篇:从DALL-E 2到Stable Diffusion(5讲)

讲次主题时长核心要点
13前浪DALL-E 2:帮你魔改经典画作14:06unCLIP架构、图像变体、编辑能力
14挑战者Imagen:为什么会后来居上?12:44T5文本编码器、级联超分辨率
15显微镜下的SD(一):关键技术揭秘15:15潜空间扩散、LDM、噪声调度
16显微镜下的SD(二):从图像变体到SDXL15:34SDXL双分支、refiner模型
17巅峰画师Midjourney:年入1亿美元的技术方案10:50MJ架构推测、商业闭环

2.6 综合演练篇:AI绘画高手养成计划(10讲)

讲次主题时长核心要点
18DreamBooth和LoRA:低成本IP专属模型11:12两种微调方法对比、适用场景
19实战项目(三):动手做自己的LoRA模型12:12数据集、训练参数、过拟合处理
20ControlNet:出道即巅峰,构图控制没有对手11:41Canny/OpenPose/Depth/Tile多模式
21实战项目(四):用ControlNet给创意上色12:16线稿上色、深度图引导、多ControlNet
22AI图像编辑:Prompt2Prompt实现"言出法随"15:25注意力操控、局部编辑、语义引导
23实战项目(五):类似LensaAI的梦幻照相馆12:33人像风格化、DreamBooth+LoRA组合
24实战项目(六):妙用SD给照片带千百种风格12:14风格LoRA库、批量风格迁移
25视频/3D/数字人:探索AI绘画的N种可能11:07AnimateDiff、3D生成、数字人驱动
答疑2热点问题答疑&第三、四章思考题答案13:02ControlNet选择、LoRA叠加等
用户故事潇然:持续充电,拥抱未来!06:15学习心得、实战经验分享

2.7 扩散模型AI绘画方案(2讲)

讲次主题时长核心要点
26DALL-E 3技术探秘(一):用OpenAI的方式搞数据14:37合成数据增强、描述质量提升
27DALL-E 3技术探秘(二):从unCLIP到缝合怪方案11:49架构演进、与SD的差异

2.8 直播回放与结课(4讲)

讲次主题时长
直播1AI绘画发展脉络与LoRA模型训练实战01:00:00
直播2畅谈AIGC,从AI绘画到GPT-4 Vision00:23:00
结束语未来可期,一起拥抱AI绘画的新时代09:57
结课测试来赴一场满分之约!

三、技术栈全景图

┌─────────────────────────────────────────────────┐ │ AI 绘画技术栈 │ ├─────────────────────────────────────────────────┤ │ │ │ 文本编码器 噪声预测网络 图像解码器 │ │ ┌─────────┐ ┌──────────┐ ┌────────┐ │ │ │ CLIP │──────▶│ UNet │─────▶│ VAE │ │ │ │ T5 │ │ DiT │ │ Decoder│ │ │ │ BPE/SP │ │ ResBlock │ └────────┘ │ │ └─────────┘ │ AttnBlock│ │ │ └──────────┘ │ │ ▲ │ │ │ │ │ ┌───────────┐ │ │ │ 采样器 │ │ │ │ DDIM/DPM++│ │ │ │ Euler/UniPC│ │ │ └───────────┘ │ │ │ │ 控制模块 微调方法 工作流 │ │ ┌─────────┐ ┌──────────┐ ┌────────┐ │ │ │ControlNet│ │DreamBooth│ │WebUI │ │ │ │ LoRA │ │ LoRA │ │ComfyUI │ │ │ │ P2P │ │ Fine-tune│ │API │ │ │ └─────────┘ └──────────┘ └────────┘ │ │ │ └─────────────────────────────────────────────────┘

四、学习路径建议

4.1 入门路径(1-2周)

热身篇(01-04) → 基础篇(05-07) → 进阶篇(15-17)
  • 先用 WebUI 跑通文生图流程
  • 理解扩散模型基本原理(不需要数学推导)
  • 体验 SD 和 Midjourney 的效果差异

4.2 进阶路径(2-4周)

基础篇(06-12) → 综合演练篇(18-22) → ComfyUI
  • 深入理解 UNet、CLIP、VAE 的作用
  • 动手训练 LoRA 模型
  • 用 ControlNet 实现精准构图控制
  • 切换到 ComfyUI 提升效率

4.3 高阶路径(4-8周)

DiT架构 → DALL-E 3方案 → 视频/3D扩展 → 自定义工作流
  • 理解从 UNet 到 DiT 的架构演进
  • 研究数据增强和描述质量提升策略
  • 探索 AnimateDiff 视频生成
  • 构建完整的自动化生图流水线

五、关键概念速查表

概念一句话解释对应课程
GAN两个网络对抗训练,生成器造假、判别器打假05讲
DDPM逐步加噪再逐步去噪的生成过程06讲
Transformer用注意力机制处理序列的万能架构07讲
UNetU形网络,下采样+上采样+跳跃连接08讲
DiT用Transformer替代UNet做噪声预测课程迭代
采样器决定去噪过程的步数和策略09讲
CLIP将文本和图像映射到同一空间10讲
VAE压缩图像到潜空间,降低计算量11讲
LoRA低秩适配,用少量参数微调模型04/18/19讲
ControlNet额外条件输入,精准控制生成结果20-21讲
DreamBooth用少量样本微调整个模型18讲
P2P操控注意力实现局部语义编辑22讲
ComfyUI节点式界面,灵活编排生图流程课程迭代

六、总结

AI绘画技术在短短几年内经历了从GAN到扩散模型、从UNet到DiT的深刻变革。理解这条技术演进线,不仅能帮助你选择合适的工具和模型,更能让你在面对新技术时快速抓住核心。

下一篇:WebUI与Prompt实战指南 — 手把手教你安装WebUI、编写高效Prompt、跑通完整生图流程。


本文整理自AI绘画课程体系,共39讲,涵盖从入门到高阶的完整技术脉络。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询