kohya_ss新手上手指南:5步跑通第一次LoRA训练
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
最后一行模型文件落进硬盘,程序在训练中途生成的那张样图终于有了你脑子里"那个感觉"——这就是 kohya_ss 给你的时刻:一个图形化训练工具,靠LoRA训练把一批参考图变成你的专属风格模型。全程不写代码,每一步都有画面可以对照。
它替你做掉了哪几件烦事
- 以前你得逐条背十几条命令行参数,现在它帮你点几下鼠标就自动拼好命令。
- 以前你得一行行手敲训练配置,现在加载一个预设JSON,几十个参数两次点击全填满。
- 以前得自己装 Python 环境、逐个找依赖,现在一个脚本帮你全部装好。
📋 动手前的最小准备
- 一张 NVIDIA 显卡(唯一的硬件硬要求;Windows 需另装 CUDA 工具包,细节见 docs/Installation/)
- 装好 Git,并备一个基础模型文件(Stable Diffusion 1.5 或 SDXL 的 .safetensors,放进固定目录)
- 10-20 张风格统一的图,512x512 以上
- 没有素材?仓库 test/img/ 里就有 8 张配好说明的示例图,先拿它们走一遍流程
- 几 GB 空闲磁盘(装依赖 + 模型文件)
🚀 主线:跑通第一次 LoRA 训练
包括上面的准备,一共 5 步。就算你手上没有自己的图,也能用仓库自带素材完整走一遍。
第1步:准备 10-20 张图与它们的文字说明
你做什么:把图放进同一个文件夹,每张图片配一个同名的 .txt,内容是一句简短英文描述,比如"a steampunk mechanical skull, gas mask"。
你会看到:每个 .jpg 旁边都躺着一个 .txt,数量一一对应。
注意这一步:图和 .txt 必须同名,说明才不会对上号。
素材没头绪的话,直接看 test/config/dataset.toml:分辨率 512、class 词写的是 'darius kawasaki person'。这份官方演示配置,就是你自己写数据集配置时最直接的抄写范本。
第2步:启动界面,用预设两次点击填满参数
你做什么:把仓库克隆下来,启动界面。
git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ssWindows 双击 gui-uv.bat,Linux/macOS 运行./gui-uv.sh。首次启动时脚本会自动装好依赖,浏览器随后打开 http://localhost:7860。
你会看到:由 kohya_gui.py 驱动的 Gradio 界面,顶部一排 "LoRA"、"Finetuning"、"Dreambooth" 等标签。
接下来三次点击:点 "LoRA" 标签;在预训练模型栏选你的基础模型文件;把数据集目录指向第1步的素材文件夹。
然后是重头戏——加载预设。在预设加载栏指向 presets/,任选一个 JSON,比如SDXL - LoRA AI_characters standard v1.0.json。学习率、网络维度、轮数等几十个参数一次性填好。预设就像调料包,配比都称好了,撕开就用,你不用搞懂每一种香料。
你会发现:参数面板整片变满,"空白表格焦虑"瞬间消失。
第3步:用 30-50 轮启动训练
你做什么:输出模型栏写个名字(比如 my_steampunk),轮数设 30-50,点 "Start training"。
为什么先设 30-50 轮?头一回训练是探路:有效果再加量,没效果也不至于白等一整夜。
你会看到:控制台实时刷日志,训练中途还会周期性生成几张样图。这是"它有没有在学"的反馈窗口,不用干等到最后。
第4步:5分钟验证——对比第一张和最后一张样图
你会看到:输出目录里多了一个 .safetensors 模型文件和一组样图。
怎么算练成了:把第一批样图和最后一批放在一起对比。开头模糊、跑题,结尾逐渐出现素材的构图和色调,越接近说明训练越有效。
正式检验是把 LoRA 丢进 Stable Diffusion WebUI(README 推荐搭配 additional-networks 扩展),用你 caption 里的 class 词生成几张图——出了那个蒸汽朋克味儿,这次训练才算闭环。
⚠️ 三个最常卡住的点
现象:首次启动很慢,像卡死了。 原因:脚本在装依赖、初始化环境,进程没死。 解法:耐心等,看终端有没有文件写入动静就能确认它还活着。
现象:训练完成了,出图却只是"有点像",没有辨识度。 原因:轮数偏少或学习率偏低,模型只学会了素材的平均脸。 解法:把轮数加到 50-100,或换 presets/lora/ 里学习率更高一档的预设重跑,对比样图变化。
现象:启动时报找不到数据集,或说明全部为空。 原因:路径和实际文件夹对不上,或 .txt 没跟图片同名。 解法:用界面里的路径选择器代替手敲;数一下文件夹里 .jpg 和 .txt 的数量是否相等。
🛠️ 顺手能加的小动作
- 自动打标:tools/caption.py 能给整个文件夹的图片批量生成 .txt 描述,省掉逐张手写。
- 批量整理:tools/group_images.py 按尺寸把图分进子文件夹;tools/convert_images_to_webp.py 把它们批量转成 webp 省空间。
- 记住常用路径:在仓库外建一份 config.toml 记下你的常用目录,启动时用
--config参数指过去,下次所有栏位自动预填。键名全集见 config example.toml。
最后
今天就能做这件事:克隆仓库,跑一次 gui-uv.bat,用 test/img 里那 8 张示例图跑一轮 30 轮的演示训练。
先把流程跑通,味道自然会来。
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考