kohya_ss新手完整指南:从安装到训出第一张图的四步LoRA实操
2026/9/18 14:50:17 网站建设 项目流程

kohya_ss新手完整指南:从安装到训出第一张图的四步LoRA实操

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

kohya_ss 是一个面向扩散模型训练的图形界面工具,把 LoRA 训练、Dreambooth 和全量微调的所有参数都变成浏览器里的滑块和输入框,适合没有命令行基础、但想训练专属风格的创作者。

它解决什么问题

很多训练脚本(LoRA、Dreambooth)原本只能靠拼写一长串命令行参数完成,写错一个字符就要重来。kohya_ss 把这些参数收进一个 Gradio Web 界面,你填好表单后它自动生成对应的训练命令并执行。它支持 SD1.5/2.x、SDXL、SD3、Flux.1、Lumina、Anima、HunyuanImage 等主流基模,也覆盖 LoRA、LoHa、LoKr、Textual Inversion 等多种训练方式。

换句话说:你的电脑有 NVIDIA 显卡、有一批喜欢的图片,剩下交给 kohya_ss LoRA 训练界面。

开始前准备

安装环境(约 10 分钟)

先确认两件事:NVIDIA 显卡(建议显存 12GB 以上,跑 SDXL 更从容)、Python 3.11.9 并已加入 PATH(安装时勾选 "Add to PATH")。然后克隆仓库并启动:

git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss
  • Windows:双击运行gui-uv.bat
  • Linux / macOS:终端执行./gui-uv.sh

脚本会自动安装依赖,浏览器打开 http://localhost:7860 即表示成功。两种安装方式的完整说明见 uv 版 Windows 安装 和 pip 版说明。

准备训练素材

kohya_ss 要求数据集按"文件夹 + 同名 .txt 描述"组织,参考 文件夹结构文档:

dataset/ └── 10_my_style/ ├── image1.jpg ├── image1.txt # 内容如:a painting of a steam punk skull └── image2.jpg
  • 数量:10~20 张,风格统一、主题明确,质量优先于数量
  • 分辨率:SD1.5 建议 512x512 起步,SDXL 建议 1024x1024
  • 每张图必须有同名的 .txt 描述文件,描述会覆盖文件夹名参与训练

仓库里自带一组示例数据可以直接打开研究:test/img/10_darius kawasaki person/,8 张图配 8 个 .txt,是最小可用数据集的样板。

核心操作四阶段

阶段一:设置默认路径

目标:让界面记住你的模型和数据存放位置,省得每次手填。

具体操作:把根目录的config example.toml复制一份改名为config.toml,填入你的基模目录、数据集目录、输出目录(路径用正斜杠,绝对路径或相对仓库根目录的路径均可)。

完成标志:重新启动 GUI 后,各标签页的路径输入框已自动预填好你的目录。

阶段二:选择训练模式并加载预设

目标:用社区调好的参数起步,而不是从零猜。

具体操作:进入 LoRA 标签页,点击加载配置,从presets/lora/目录选一个预设。例如:

  • SDXL - LoRA AI_characters standard v1.0.json:角色类训练
  • SDXL - LoRA finetuning phase 1_v1.1.json:两阶段训练的第一阶段
  • iA3-Prodigy-sd15.json:SD1.5 场景

完成标志:表单中的 network_dim、学习率、优化器等字段全部被预设值填充。

阶段三:配置数据集与采样图

目标:告诉界面训练什么、训练中如何预览效果。

具体操作:填入数据集目录(阶段准备里的结构);在采样提示词文件里写 1~2 条提示词,可加生成参数,如--w 768 --h 768 --l 7.5 --s 28(宽度、高度、CFG、步数)。

完成标志:数据集目录被识别出子文件夹和图数,采样提示词文件保存成功。

阶段四:开始训练并观察

目标:启动训练并判断是否健康。

具体操作:点击开始训练,在控制台观察 loss 变化;训练中会按采样提示词周期性生成预览图。

完成标志:输出目录(默认outputs/)中出现 .safetensors 模型文件,预览图风格逐渐接近你的素材。

![kohya_ss LoRA训练素材示例:蒸汽朋克骷髅风格插画](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki.jpg?utm_source=gitcode_repo_files)

完整案例:用仓库示例图训一个"蒸汽朋克骷髅"风格 LoRA

素材:直接用test/img/10_darius kawasaki person/下的 8 张图,它们已带同名 .txt 描述(如a painting of a steam punk skull with a gas mask),无需改动。

配置:在 LoRA 标签页加载presets/lora/SDXL - LoRA AI_characters standard v1.0.json,做三处修改:

  • 输出模型名:my_steampunk_lora
  • max_train_epochs:100 改为 10(首跑验证用)
  • train_batch_size:8 改为 2(显存不够时先降这里)

预设自带的network_dim=32network_alpha=32是社区验证过的标准组合,保持不动。

运行:点击开始训练。SDXL + 8 张图 + 10 轮,8GB 显存显卡大约几十分钟可完成,期间留意控制台 loss 是否在下降,以及每隔若干步生成的采样图是否出现骷髅、面具、黄铜管这些元素。

结果:在outputs/得到my_steampunk_lora.safetensors(约几十 MB)。把它放进 ComfyUI 或 WebUI 的 LoRA 目录,提示词中加上触发词,即可生成同风格新图。如果首跑效果偏淡,把max_train_epochs提到 30~100 再训一轮,这是最直接的改进路径。

常见问题速查

  • 如果启动时提示No module named tkinter:重装 Python(勾选 tcl/tk 组件), kohya_ss 的图形依赖它,详见 README 故障排查。
  • 如果训练中途显存爆掉(OOM):按顺序降train_batch_size、降max_resolution、在优化器选项里选 8bit 版本(如 AdamW8bit),三项通常解决 90% 的情况。
  • 如果在 SSH 远程机器上启动,界面卡死不动:原生弹窗在无显示器环境会阻塞进程,改用./gui.sh --headless启动即可跳过本地文件选择框和覆盖确认。
  • 如果训了几小时看不出效果:先用 5 张图、5 轮做"快速验证",确认流程与描述文件没问题,再加数据和轮数,避免盲目长训。

另外,进阶场景如"只对图片某个区域计损失"(masked loss),仓库的test/masked_loss/目录提供了对应的黑白遮罩示例:

行动清单

  • 按安装文档跑通gui-uv.bat/gui-uv.sh,浏览器能看到 7860 端口界面
  • 复制config example.tomlconfig.toml,填好基模与数据目录
  • 整理 10 张风格统一的图片,每张配同名 .txt 描述
  • 加载一个presets/lora/预设,改输出名和轮数后完成首跑
  • 用训练产出的 .safetensors 生成 3 张测试图,对比你的原始素材风格

工具只管把参数交给机器,风格判断始终在你手里——从最小数据集开始,跑通一次,后面的路就清晰了。

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询