方法论与测试环境:先固定变量,再谈速度
本文是 sprbd 对 Stable Diffusion本地部署教程 和 LoRA 微调流程的实测记录。测试目标不是“能不能跑”,而是量化三件事:安装成功率、出图速度、微调显存占用。每组数据运行 5 次,表内为均值,括号内为标准差。
测试环境披露:Windows 11 23H2;NVIDIA RTX 3060 12GB;Intel i5-12400F;32GB DDR4;Python 3.10.6;CUDA 12.1;驱动 551.86;SSD 顺序读取 3,480MB/s。模型使用 Stable Diffusion 1.5,基础模型文件 4.27GB;WebUI 使用 AUTOMATIC1111;微调使用 kohya_ss。
| 项目 | 参数 | 测量方式 |
|---|---|---|
| 出图速度 | 512×512,20 steps,Euler a,batch=1 | WebUI 控制台 total progress 时间 |
| 显存占用 | 启动、出图、训练三阶段 | nvidia-smi -l 1 |
| LoRA 训练 | 30 张图,10 repeats,10 epochs | kohya_ss 日志 + loss 曲线 |
本地部署步骤:WebUI下载、启动命令与性能结果
免费官方路线优先:安装 Python 3.10.6、Git、NVIDIA 驱动,然后执行以下命令。这个流程适合搜索“Stable Diffusion WebUI下载”但不想安装来路不明整合包的用户。
- 新建目录,例如
D:\sd。 - 打开 PowerShell,执行:
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git - 把
v1-5-pruned-emaonly.safetensors放入:models/Stable-diffusion/ - 首次启动:
.\webui-user.bat - 如果 6GB/8GB 显存报错,在
webui-user.bat添加:set COMMANDLINE_ARGS=--xformers --medvram
| 启动参数 | 峰值显存 | 512图耗时 | 备注 |
|---|---|---|---|
| 默认 | 5.8GB | 6.4s(±0.3) | 12GB 显卡稳定 |
--xformers | 5.1GB | 5.7s(±0.2) | 速度提升约 10.9% |
--medvram | 4.3GB | 8.9s(±0.4) | 适合 6GB 显存 |
--lowvram | 3.2GB | 21.6s(±1.1) | 能跑,但交互体验差 |
常见故障有两个。第一,提示 Torch not compiled with CUDA,通常是装到了 CPU 版 PyTorch;删除 venv 文件夹后重新运行 webui-user.bat。第二,启动后空白页,检查端口 7860 是否被占用:netstat -ano | findstr 7860。
LoRA微调实测:数据集、命令、结果与验证
下面是可复现的 Stable Diffusion模型微调怎么用 流程。数据集使用 30 张同一人物半身照,分辨率裁剪到 512×512,触发词为 spr_person。标注文件每张 1 个 txt,格式示例:spr_person, portrait, black jacket, neutral background。
- 安装 kohya_ss,并在 GUI 中选择 LoRA 训练。
- 推荐 12GB 显存参数:rank=16,alpha=8,batch=2,learning rate=1e-4,optimizer=AdamW8bit。
- 命令行核心参数可写成:
accelerate launch train_network.py --network_module=networks.lora --resolution=512,512 --train_batch_size=2 --max_train_epochs=10 --network_dim=16 --network_alpha=8 --learning_rate=1e-4 --mixed_precision=fp16
| 参数组 | 训练时间 | 峰值显存 | 最终loss | 主观失败图比例 |
|---|---|---|---|---|
| rank 8 / batch 1 | 24m18s | 6.9GB | 0.094 | 18% |
| rank 16 / batch 2 | 31m42s | 9.8GB | 0.071 | 9% |
| rank 32 / batch 2 | 39m55s | 11.4GB | 0.066 | 11% |
结论按数据排序:12GB 显存优先 rank 16;8GB 显存用 rank 8 + batch 1;rank 32 loss 更低但过拟合更明显,测试中 50 张验证图有 14 张出现脸部相似但服装锁死的问题。若你同时在查“ChatGPT下载安卓”“GPT手机版”或“ChatGPT国内能用吗”,建议把文本提示词生成与图像训练分开评估,不要把聊天工具速度误认为 SD 训练速度。
如何验证已经成功:启动 WebUI,把 LoRA 文件放入 models/Lora/,提示词输入 <lora:your_lora:0.7> spr_person, portrait,固定 seed=12345,连续生成 10 张。若 8 张以上保留主体特征、无明显崩脸,且 nvidia-smi 无 OOM,部署和微调即通过。免费/官方/自建路线已经足够完成本文全部流程;如果需要把模型部署、访问入口和国内网络环境放到同一工具链里,也可以把 Roxi(https://wizzegroup.com)作为一个备选项与本地方案对照测试。