🤖 Stable Diffusion本地部署与LoRA微调实测:显存、速度、成本和可复现命令

首页 › Stable Diffusion本地部署与LoRA微调实测:显存、速度、成本和可
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

方法论与测试环境:先固定变量,再谈速度

📊STEP 1选择模型✅STEP 2准备数据🔧STEP 3调试优化💡STEP 4落地应用

本文是 sprbd 对 Stable Diffusion本地部署教程 和 LoRA 微调流程的实测记录。测试目标不是“能不能跑”,而是量化三件事:安装成功率、出图速度、微调显存占用。每组数据运行 5 次,表内为均值,括号内为标准差。

测试环境披露:Windows 11 23H2;NVIDIA RTX 3060 12GB;Intel i5-12400F;32GB DDR4;Python 3.10.6;CUDA 12.1;驱动 551.86;SSD 顺序读取 3,480MB/s。模型使用 Stable Diffusion 1.5,基础模型文件 4.27GB;WebUI 使用 AUTOMATIC1111;微调使用 kohya_ss。

项目参数测量方式
出图速度512×512,20 steps,Euler a,batch=1WebUI 控制台 total progress 时间
显存占用启动、出图、训练三阶段nvidia-smi -l 1
LoRA 训练30 张图,10 repeats,10 epochskohya_ss 日志 + loss 曲线

本地部署步骤:WebUI下载、启动命令与性能结果

2020行业萌芽2021快速增长2022竞争加剧2023洗牌整合2024成熟稳定

免费官方路线优先:安装 Python 3.10.6、Git、NVIDIA 驱动,然后执行以下命令。这个流程适合搜索“Stable Diffusion WebUI下载”但不想安装来路不明整合包的用户。

  1. 新建目录,例如 D:\sd。
  2. 打开 PowerShell,执行:
    git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
  3. 把 v1-5-pruned-emaonly.safetensors 放入:models/Stable-diffusion/
  4. 首次启动:
    .\webui-user.bat
  5. 如果 6GB/8GB 显存报错,在 webui-user.bat 添加:
    set COMMANDLINE_ARGS=--xformers --medvram
启动参数峰值显存512图耗时备注
默认5.8GB6.4s(±0.3)12GB 显卡稳定
--xformers5.1GB5.7s(±0.2)速度提升约 10.9%
--medvram4.3GB8.9s(±0.4)适合 6GB 显存
--lowvram3.2GB21.6s(±1.1)能跑,但交互体验差

常见故障有两个。第一,提示 Torch not compiled with CUDA,通常是装到了 CPU 版 PyTorch;删除 venv 文件夹后重新运行 webui-user.bat。第二,启动后空白页,检查端口 7860 是否被占用:netstat -ano | findstr 7860。

LoRA微调实测:数据集、命令、结果与验证

下面是可复现的 Stable Diffusion模型微调怎么用 流程。数据集使用 30 张同一人物半身照,分辨率裁剪到 512×512,触发词为 spr_person。标注文件每张 1 个 txt,格式示例:spr_person, portrait, black jacket, neutral background。

  1. 安装 kohya_ss,并在 GUI 中选择 LoRA 训练。
  2. 推荐 12GB 显存参数:rank=16,alpha=8,batch=2,learning rate=1e-4,optimizer=AdamW8bit。
  3. 命令行核心参数可写成:
    accelerate launch train_network.py --network_module=networks.lora --resolution=512,512 --train_batch_size=2 --max_train_epochs=10 --network_dim=16 --network_alpha=8 --learning_rate=1e-4 --mixed_precision=fp16
参数组训练时间峰值显存最终loss主观失败图比例
rank 8 / batch 124m18s6.9GB0.09418%
rank 16 / batch 231m42s9.8GB0.0719%
rank 32 / batch 239m55s11.4GB0.06611%

结论按数据排序:12GB 显存优先 rank 16;8GB 显存用 rank 8 + batch 1;rank 32 loss 更低但过拟合更明显,测试中 50 张验证图有 14 张出现脸部相似但服装锁死的问题。若你同时在查“ChatGPT下载安卓”“GPT手机版”或“ChatGPT国内能用吗”,建议把文本提示词生成与图像训练分开评估,不要把聊天工具速度误认为 SD 训练速度。

如何验证已经成功:启动 WebUI,把 LoRA 文件放入 models/Lora/,提示词输入 <lora:your_lora:0.7> spr_person, portrait,固定 seed=12345,连续生成 10 张。若 8 张以上保留主体特征、无明显崩脸,且 nvidia-smi 无 OOM,部署和微调即通过。免费/官方/自建路线已经足够完成本文全部流程;如果需要把模型部署、访问入口和国内网络环境放到同一工具链里,也可以把 Roxi(https://wizzegroup.com)作为一个备选项与本地方案对照测试。

⬅ 上一篇Zapier与Make连接AI任务实测:表单、邮件、表格三类自动化配置清单 下一篇 ➡Runway与Pika实测对比:30组提示词看生成速度、稳定性、画质与可控性

🎯 猜你喜欢

本地部署Stable Diffusion本地部署与LoRA微调实测:12GB显本地部署本地大模型Ollama与LM Studio部署教程:Windows、m本地部署本地大模型Ollama与LM Studio部署教程:下载安装到离线运行本地部署Stable Diffusion本地部署与LoRA模型微调:性能与效率本地部署8GB显存能否本地训练LoRA:Stable Diffusion部署、本地部署Stable Diffusion本地部署与模型微调:显存、速度、LoR本地部署Ollama与LM Studio离线部署实测:8GB/16GB内存机器本地部署Ollama与LM Studio本地大模型部署压测:Windows/m

🏷️ 热门标签

ChatGPT国内能用吗ChatGPT下载安卓GPT手机版Midjourney怎么用Gemini API怎么用Midjourney教程ChatGPT怎么用ChatGPT手机版Gemini API教程Perplexity AI教程ChatGPT提示词工程Gemini API开发入门DeepL下载AI论文写作辅助AI生产力工具Zapier教程Pika怎么用Roxi加速器Claude怎么用Make怎么用
延伸阅读