AI绘画技术演进全景图:从GAN到DiT的华丽转身
2026/9/17 2:51:10
网站建设
项目流程
AI绘画技术演进全景图:从GAN到DiT的华丽转身
本文基于AI绘画课程体系整理,涵盖从GAN旧画师到DiT新一代架构的完整技术演进脉络,为你构建AI绘画的系统性认知框架。
一、技术演进时间线
2014 ──── GAN(生成对抗网络)诞生 │ └─ 旧画师:天生有缺陷 │ 2015-2020 ── VAE、流模型、自回归等中间探索 │ 2020 ──── DDPM(去噪扩散概率模型)提出 │ └─ 颠覆者:加噪与去噪的直观理解 │ 2021 ──── DALL-E 1 / CLIP / Guided Diffusion │ └─ Transformer + 扩散模型首次结合 │ 2022 ──── DALL-E 2 / Stable Diffusion / Imagen │ └─ 潜空间扩散 + CLIP文本引导 │ └─ Midjourney 商业化爆发 │ 2023 ──── SDXL / DALL-E 3 / ControlNet / LoRA │ └─ 高分辨率 + 精准控制 + 个性化 │ 2024-2026 ── DiT(Diffusion Transformer) └─ 从UNet到Transformer的架构革命 └─ ComfyUI 节点式工作流成熟 └─ Sora / Flux / SD3 等新一代模型
二、核心模块概览
2.1 课程迭代篇(3讲)
| 讲次 | 主题 | 时长 | 核心要点 |
|---|
| — | 再次前行|紧跟AI绘画技术趋势 | 03:07 | 技术发展节奏与持续学习策略 |
| — | 从UNet到DiT:文生图模型的华丽转身 | 01:13:28 | 架构革命:UNet→Transformer,扩散模型的骨干网络演进 |
| — | ComfyUI:节点式生图的效率革命 | 27:26 | 节点编排、工作流复用、批量生图 |
2.2 开篇词篇(2讲)
| 讲次 | 主题 | 时长 | 核心要点 |
|---|
| — | AI技术爆发,如何实现绘画模型自由? | 07:42 | 开源生态、模型选择策略 |
| — | 先睹为快,AI绘画作品集 | 09:21 | 效果展示、应用场景概览 |
2.3 热身篇:AI绘画初体验(4讲)
| 讲次 | 主题 | 时长 | 核心要点 |
|---|
| 01 | WebUI:免费AI绘画工具箱的N大绘图功能 | 14:33 | Automatic1111 WebUI安装与功能全览 |
| 02 | Prompt使用技巧:精准控制风格和内容 | 09:49 | 正向/负向提示词、权重控制、风格词 |
| 03 | 进阶应用:图生图技巧与创作社区初探 | 13:15 | img2img、inpaint、Civitai社区资源 |
| 04 | 实战项目(一):用LoRA制作你的漫画故事 | 11:03 | LoRA加载、角色一致性、漫画分镜 |
2.4 基础篇:AI绘画原理揭秘(9讲)
| 讲次 | 主题 | 时长 | 核心要点 |
|---|
| 05 | 旧画师GAN:天生有缺陷还是学艺不精湛? | 15:10 | GAN原理、模式崩溃、训练不稳定性 |
| 06 | 颠覆者扩散模型:直观理解加噪与去噪 | 10:22 | DDPM前向/逆向过程、马尔可夫链 |
| 07 | AIGC的核心魔法:搞懂Transformer | 15:38 | 自注意力、交叉注意力、位置编码 |
| 08 | 巧用神经网络:如何用UNet预测噪声 | 09:35 | UNet架构、下采样/上采样、跳跃连接 |
| 09 | 采样器:龟兔赛跑,如何选择更好更快的采样器? | 10:40 | DDIM/DPM++/Euler/UniPC对比 |
| 10 | CLIP:让AI绘画模型乖乖听你的话 | 14:31 | 对比学习、文本-图像对齐、CLIP引导 |
| 11 | VAE系列:如何压缩图像给GPU腾腾地方 | 11:25 | 潜空间编码/解码、显存优化 |
| 12 | 实战项目(二):动手训练你的扩散模型 | 11:43 | 从零训练DDPM、数据集准备、超参数 |
| 答疑1 | 热点问题答疑&前两章思考题答案 | 14:05 | GAN vs 扩散、采样器选择等常见问题 |
2.5 进阶篇:从DALL-E 2到Stable Diffusion(5讲)
| 讲次 | 主题 | 时长 | 核心要点 |
|---|
| 13 | 前浪DALL-E 2:帮你魔改经典画作 | 14:06 | unCLIP架构、图像变体、编辑能力 |
| 14 | 挑战者Imagen:为什么会后来居上? | 12:44 | T5文本编码器、级联超分辨率 |
| 15 | 显微镜下的SD(一):关键技术揭秘 | 15:15 | 潜空间扩散、LDM、噪声调度 |
| 16 | 显微镜下的SD(二):从图像变体到SDXL | 15:34 | SDXL双分支、refiner模型 |
| 17 | 巅峰画师Midjourney:年入1亿美元的技术方案 | 10:50 | MJ架构推测、商业闭环 |
2.6 综合演练篇:AI绘画高手养成计划(10讲)
| 讲次 | 主题 | 时长 | 核心要点 |
|---|
| 18 | DreamBooth和LoRA:低成本IP专属模型 | 11:12 | 两种微调方法对比、适用场景 |
| 19 | 实战项目(三):动手做自己的LoRA模型 | 12:12 | 数据集、训练参数、过拟合处理 |
| 20 | ControlNet:出道即巅峰,构图控制没有对手 | 11:41 | Canny/OpenPose/Depth/Tile多模式 |
| 21 | 实战项目(四):用ControlNet给创意上色 | 12:16 | 线稿上色、深度图引导、多ControlNet |
| 22 | AI图像编辑:Prompt2Prompt实现"言出法随" | 15:25 | 注意力操控、局部编辑、语义引导 |
| 23 | 实战项目(五):类似LensaAI的梦幻照相馆 | 12:33 | 人像风格化、DreamBooth+LoRA组合 |
| 24 | 实战项目(六):妙用SD给照片带千百种风格 | 12:14 | 风格LoRA库、批量风格迁移 |
| 25 | 视频/3D/数字人:探索AI绘画的N种可能 | 11:07 | AnimateDiff、3D生成、数字人驱动 |
| 答疑2 | 热点问题答疑&第三、四章思考题答案 | 13:02 | ControlNet选择、LoRA叠加等 |
| 用户故事 | 潇然:持续充电,拥抱未来! | 06:15 | 学习心得、实战经验分享 |
2.7 扩散模型AI绘画方案(2讲)
| 讲次 | 主题 | 时长 | 核心要点 |
|---|
| 26 | DALL-E 3技术探秘(一):用OpenAI的方式搞数据 | 14:37 | 合成数据增强、描述质量提升 |
| 27 | DALL-E 3技术探秘(二):从unCLIP到缝合怪方案 | 11:49 | 架构演进、与SD的差异 |
2.8 直播回放与结课(4讲)
| 讲次 | 主题 | 时长 |
|---|
| 直播1 | AI绘画发展脉络与LoRA模型训练实战 | 01:00:00 |
| 直播2 | 畅谈AIGC,从AI绘画到GPT-4 Vision | 00:23:00 |
| 结束语 | 未来可期,一起拥抱AI绘画的新时代 | 09:57 |
| 结课测试 | 来赴一场满分之约! | — |
三、技术栈全景图
┌─────────────────────────────────────────────────┐ │ AI 绘画技术栈 │ ├─────────────────────────────────────────────────┤ │ │ │ 文本编码器 噪声预测网络 图像解码器 │ │ ┌─────────┐ ┌──────────┐ ┌────────┐ │ │ │ CLIP │──────▶│ UNet │─────▶│ VAE │ │ │ │ T5 │ │ DiT │ │ Decoder│ │ │ │ BPE/SP │ │ ResBlock │ └────────┘ │ │ └─────────┘ │ AttnBlock│ │ │ └──────────┘ │ │ ▲ │ │ │ │ │ ┌───────────┐ │ │ │ 采样器 │ │ │ │ DDIM/DPM++│ │ │ │ Euler/UniPC│ │ │ └───────────┘ │ │ │ │ 控制模块 微调方法 工作流 │ │ ┌─────────┐ ┌──────────┐ ┌────────┐ │ │ │ControlNet│ │DreamBooth│ │WebUI │ │ │ │ LoRA │ │ LoRA │ │ComfyUI │ │ │ │ P2P │ │ Fine-tune│ │API │ │ │ └─────────┘ └──────────┘ └────────┘ │ │ │ └─────────────────────────────────────────────────┘
四、学习路径建议
4.1 入门路径(1-2周)
热身篇(01-04) → 基础篇(05-07) → 进阶篇(15-17)
- 先用 WebUI 跑通文生图流程
- 理解扩散模型基本原理(不需要数学推导)
- 体验 SD 和 Midjourney 的效果差异
4.2 进阶路径(2-4周)
基础篇(06-12) → 综合演练篇(18-22) → ComfyUI
- 深入理解 UNet、CLIP、VAE 的作用
- 动手训练 LoRA 模型
- 用 ControlNet 实现精准构图控制
- 切换到 ComfyUI 提升效率
4.3 高阶路径(4-8周)
DiT架构 → DALL-E 3方案 → 视频/3D扩展 → 自定义工作流
- 理解从 UNet 到 DiT 的架构演进
- 研究数据增强和描述质量提升策略
- 探索 AnimateDiff 视频生成
- 构建完整的自动化生图流水线
五、关键概念速查表
| 概念 | 一句话解释 | 对应课程 |
|---|
| GAN | 两个网络对抗训练,生成器造假、判别器打假 | 05讲 |
| DDPM | 逐步加噪再逐步去噪的生成过程 | 06讲 |
| Transformer | 用注意力机制处理序列的万能架构 | 07讲 |
| UNet | U形网络,下采样+上采样+跳跃连接 | 08讲 |
| DiT | 用Transformer替代UNet做噪声预测 | 课程迭代 |
| 采样器 | 决定去噪过程的步数和策略 | 09讲 |
| CLIP | 将文本和图像映射到同一空间 | 10讲 |
| VAE | 压缩图像到潜空间,降低计算量 | 11讲 |
| LoRA | 低秩适配,用少量参数微调模型 | 04/18/19讲 |
| ControlNet | 额外条件输入,精准控制生成结果 | 20-21讲 |
| DreamBooth | 用少量样本微调整个模型 | 18讲 |
| P2P | 操控注意力实现局部语义编辑 | 22讲 |
| ComfyUI | 节点式界面,灵活编排生图流程 | 课程迭代 |
六、总结
AI绘画技术在短短几年内经历了从GAN到扩散模型、从UNet到DiT的深刻变革。理解这条技术演进线,不仅能帮助你选择合适的工具和模型,更能让你在面对新技术时快速抓住核心。
下一篇:WebUI与Prompt实战指南 — 手把手教你安装WebUI、编写高效Prompt、跑通完整生图流程。
本文整理自AI绘画课程体系,共39讲,涵盖从入门到高阶的完整技术脉络。