kohya_ss新手上手指南:5步跑通第一次LoRA训练
2026/9/14 7:14:37 网站建设 项目流程

kohya_ss新手上手指南:5步跑通第一次LoRA训练

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

最后一行模型文件落进硬盘,程序在训练中途生成的那张样图终于有了你脑子里"那个感觉"——这就是 kohya_ss 给你的时刻:一个图形化训练工具,靠LoRA训练把一批参考图变成你的专属风格模型。全程不写代码,每一步都有画面可以对照。

它替你做掉了哪几件烦事

  • 以前你得逐条背十几条命令行参数,现在它帮你点几下鼠标就自动拼好命令。
  • 以前你得一行行手敲训练配置,现在加载一个预设JSON,几十个参数两次点击全填满。
  • 以前得自己装 Python 环境、逐个找依赖,现在一个脚本帮你全部装好。

📋 动手前的最小准备

  • 一张 NVIDIA 显卡(唯一的硬件硬要求;Windows 需另装 CUDA 工具包,细节见 docs/Installation/)
  • 装好 Git,并备一个基础模型文件(Stable Diffusion 1.5 或 SDXL 的 .safetensors,放进固定目录)
  • 10-20 张风格统一的图,512x512 以上
  • 没有素材?仓库 test/img/ 里就有 8 张配好说明的示例图,先拿它们走一遍流程
  • 几 GB 空闲磁盘(装依赖 + 模型文件)

🚀 主线:跑通第一次 LoRA 训练

包括上面的准备,一共 5 步。就算你手上没有自己的图,也能用仓库自带素材完整走一遍。

第1步:准备 10-20 张图与它们的文字说明

你做什么:把图放进同一个文件夹,每张图片配一个同名的 .txt,内容是一句简短英文描述,比如"a steampunk mechanical skull, gas mask"。

你会看到:每个 .jpg 旁边都躺着一个 .txt,数量一一对应。

注意这一步:图和 .txt 必须同名,说明才不会对上号。

素材没头绪的话,直接看 test/config/dataset.toml:分辨率 512、class 词写的是 'darius kawasaki person'。这份官方演示配置,就是你自己写数据集配置时最直接的抄写范本。

第2步:启动界面,用预设两次点击填满参数

你做什么:把仓库克隆下来,启动界面。

git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss

Windows 双击 gui-uv.bat,Linux/macOS 运行./gui-uv.sh。首次启动时脚本会自动装好依赖,浏览器随后打开 http://localhost:7860。

你会看到:由 kohya_gui.py 驱动的 Gradio 界面,顶部一排 "LoRA"、"Finetuning"、"Dreambooth" 等标签。

接下来三次点击:点 "LoRA" 标签;在预训练模型栏选你的基础模型文件;把数据集目录指向第1步的素材文件夹。

然后是重头戏——加载预设。在预设加载栏指向 presets/,任选一个 JSON,比如SDXL - LoRA AI_characters standard v1.0.json。学习率、网络维度、轮数等几十个参数一次性填好。预设就像调料包,配比都称好了,撕开就用,你不用搞懂每一种香料。

你会发现:参数面板整片变满,"空白表格焦虑"瞬间消失。

第3步:用 30-50 轮启动训练

你做什么:输出模型栏写个名字(比如 my_steampunk),轮数设 30-50,点 "Start training"。

为什么先设 30-50 轮?头一回训练是探路:有效果再加量,没效果也不至于白等一整夜。

你会看到:控制台实时刷日志,训练中途还会周期性生成几张样图。这是"它有没有在学"的反馈窗口,不用干等到最后。

第4步:5分钟验证——对比第一张和最后一张样图

你会看到:输出目录里多了一个 .safetensors 模型文件和一组样图。

怎么算练成了:把第一批样图和最后一批放在一起对比。开头模糊、跑题,结尾逐渐出现素材的构图和色调,越接近说明训练越有效。

正式检验是把 LoRA 丢进 Stable Diffusion WebUI(README 推荐搭配 additional-networks 扩展),用你 caption 里的 class 词生成几张图——出了那个蒸汽朋克味儿,这次训练才算闭环。

⚠️ 三个最常卡住的点

  1. 现象:首次启动很慢,像卡死了。 原因:脚本在装依赖、初始化环境,进程没死。 解法:耐心等,看终端有没有文件写入动静就能确认它还活着。

  2. 现象:训练完成了,出图却只是"有点像",没有辨识度。 原因:轮数偏少或学习率偏低,模型只学会了素材的平均脸。 解法:把轮数加到 50-100,或换 presets/lora/ 里学习率更高一档的预设重跑,对比样图变化。

  3. 现象:启动时报找不到数据集,或说明全部为空。 原因:路径和实际文件夹对不上,或 .txt 没跟图片同名。 解法:用界面里的路径选择器代替手敲;数一下文件夹里 .jpg 和 .txt 的数量是否相等。

🛠️ 顺手能加的小动作

  • 自动打标:tools/caption.py 能给整个文件夹的图片批量生成 .txt 描述,省掉逐张手写。
  • 批量整理:tools/group_images.py 按尺寸把图分进子文件夹;tools/convert_images_to_webp.py 把它们批量转成 webp 省空间。
  • 记住常用路径:在仓库外建一份 config.toml 记下你的常用目录,启动时用--config参数指过去,下次所有栏位自动预填。键名全集见 config example.toml。

最后

今天就能做这件事:克隆仓库,跑一次 gui-uv.bat,用 test/img 里那 8 张示例图跑一轮 30 轮的演示训练。

先把流程跑通,味道自然会来。

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询