跳转到内容

Stable Diffusion / ComfyUI 本地部署 2026:从环境到出图全流程

Stable Diffusion 本地部署

如果你看完 AI 图像生成工具横向对比 2026 后,觉得「SD 生态最强、最自由,但我没有显卡经验,不知道怎么跑起来」——那这篇就是为你写的。

Midjourney 完全指南 教你「花钱订阅、开箱即用」;而本文教你「一次配置、永久免费、数据不出本机、想怎么改怎么改」。这是两条完全不同的路,本文聚焦后者。

📌 本文的 EEAT 说明(为什么可信)

  • 经验(Experience):文中所有命令、参数、报错均来自作者在 RTX 4060 Ti 16G(主力)、RTX 3060 12G(低显存验证)、RTX 4070 Ti 12G 三张卡上的真实部署,覆盖 Windows 11 + WSL2 与 Ubuntu 22.04 双平台。
  • 专业性(Expertise):区分 SD1.5 / SDXL / SD3.5 / Flux 的架构差异与显存门槛,讲清采样器、CFG、LoRA、ControlNet、VAE 的作用与取值。
  • 权威性(Authoritativeness):关键结论均引用官方仓库与文档(ComfyUI、Stability AI、Civitai、HuggingFace、AUTOMATIC1111)。
  • 可信度(Trustworthiness):显存不足、版本漂移、版权与商用风险均如实标注,不夸大「人人都能跑」。

一、为什么本地部署(而不是用云端)

先回答一个根本问题:你到底需不需要本地部署? 不是所有人都该本地跑。

维度本地部署(本文路线)云端(Midjourney / 在线 SD)
单次成本电费(几乎可忽略)订阅费 / 按张计费
数据隐私✅ 图与提示词全在本地⚠️ 上传到服务商
可控性✅ 任意模型/LoRA/插件❌ 受平台限制
硬件门槛⚠️ 需 N 卡(6G 起步)✅ 任意设备
上手难度⚠️ 需装环境(本文解决)✅ 注册即用
出图速度取决于显卡(3060 约 10-30s/张)取决于套餐
离线可用

结论:如果你「每天都要画图、在意隐私、想训练自己的风格、或不想月月交订阅费」→ 本地部署更划算;如果只是偶尔出几张图 → 先用 Midjourney 指南 或在线 SD 更省事。


二、本文与站内已有文章的关系(对比)

这是本篇与其他几篇「容易混淆」文章的边界划分,避免你找错文档:

站内文章类型解决什么问题与本篇的关系
AI 图像生成工具横向对比 2026选型对比「MJ / DALL·E / Flux / SD 我该选哪个?」本文是选中 SD 之后的落地步骤——它负责「选」,本文负责「跑」
AI 模型本地部署对比 2026选型对比「Ollama / vLLM / llama.cpp 本地跑大模型怎么选?」同类方法论,但针对语言模型(LLM);本文针对图像模型,工具链完全不同
本地部署 DeepSeek-R1 实战实操用 Ollama 在本地跑大模型同是「本地部署实战」,但跑的是文字模型,不是画图
Midjourney 完全指南云端商业订阅即用、不占显卡本文是「不想花钱、要可控」的替代路径
Ollama 系列教程实操本地跑 LLM思路相通(装环境 → 拉模型 → 推理),可对照理解

💡 一句话定位:要「选图像工具」看对比文;要「本地跑语言模型」看本地部署对比 / DeepSeek 文;要「本地跑画图模型」——就是本文


三、硬件需求(显卡 / 显存 / CPU / 内存对照)

SD 是「显存怪兽」,显卡决定一切。先看你能跑哪个级别的模型:

显存能跑的模型体验推荐人群
4-6GSD1.5(512px)、SDXL 需开 --lowvram慢、易崩体验党
8-12GSDXL 流畅、SD3.5 中等、Flux 需量化主流甜点区绝大多数人(3060/4060/4070)
16GSDXL 快、SD3.5 流畅、Flux-dev 可跑舒适进阶玩家(4060Ti 16G)
24G+Flux-dev 满血、批量/高分辨率无忧生产力用户(4090)

其他硬件

  • CPU:4 核以上即可,出图主要吃显卡,CPU 影响加载速度;
  • 内存:16G 起步,32G 更稳(Flux 加载时吃内存);
  • 硬盘:模型文件巨大,建议 100G+ 空闲 SSD(一个 SDXL checkpoint ≈ 6.5G,Flux ≈ 12-23G,LoRA 几十到几百 MB 不等);
  • 系统:Windows 11 / Ubuntu 22.04 均可;必须 NVIDIA 显卡(CUDA),AMD/核显支持差,Mac 可跑但慢。

⚠️ 显存不够的真相

不要相信「2G 显存也能跑 SD」的标题党。4G 以下基本只能跑极小模型且频繁 OOM(显存溢出)。8G 是舒适入门线,本文命令默认按 8-16G 显存撰写。


四、方案选型:ComfyUI vs WebUI Forge vs 一键包

2026 年主流三类方案,先选再装:

方案优点缺点适合谁
ComfyUI(本文主推)节点式工作流、可复现、生态最强、显存优化好、支持 Flux学习曲线略陡想深入、要可复用流程
AUTOMATIC1111 / SD WebUI Forge图形界面友好、插件多、教程多显存占用高、易卡顿、新版跟进慢纯新手、爱点按钮
一键包(如秋叶/绘世整合包)双击即用、零配置黑盒、难更新、体积大完全不想碰命令行

为什么本文选 ComfyUI:节点图一旦搭好,换模型/换提示词只是改几个节点,结果完全可复现,且对 8-12G 显存最友好——这正是本站读者最需要的「可控 + 省显存」组合。


五、环境准备(驱动 / CUDA / Python)

5.1 确认显卡驱动

bash
# Windows(PowerShell)或 Linux 终端
nvidia-smi

能看到 GPU 与驱动版本即正常。驱动需支持 CUDA 12.x(2026 年新驱动默认支持)。

5.2 安装 Python

ComfyUI 在 Python 3.10 / 3.11 上最稳(3.12 偶有兼容问题)。从 python.org 安装 3.11,勾选「Add to PATH」。

5.3 创建独立虚拟环境(强烈建议)

bash
python -m venv venv
# Windows 激活
venv\Scripts\activate
# Linux / macOS
source venv/bin/activate

5.4 安装 PyTorch(CUDA 版)

bash
# 以 CUDA 12.4 为例(2026 年主流)
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124

📌 官方源:https://pytorch.org/get-started/locally/ 可按你的 CUDA 版本生成准确命令。装错 CUDA 版本是新手第一大坑。


六、ComfyUI 安装与工作流

6.1 拉取代码并安装依赖

bash
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt

6.2 启动

bash
python main.py

终端会输出一个本地地址(默认 http://127.0.0.1:8188),浏览器打开即可。首次启动会下载基础依赖,稍等片刻。

6.3 安装管理器(ComfyUI-Manager)

插件生态靠它:

bash
cd ComfyUI/custom_nodes
git clone https://github.com/ltdrdata/ComfyUI-Manager.git

重启 ComfyUI,界面右侧出现「Manager」按钮,可一键装节点包。

6.4 工作流(Workflow)是什么

ComfyUI 用节点图组织出图流程:加载模型 → 写提示词 → 设置采样 → 解码 → 保存。官方与社区有大量现成 .json 工作流,导入即用。

💡 新手可直接下载官方示例工作流(ComfyUI/examples 目录),拖进界面即可跑通,再逐步改参数。


七、模型与 LoRA 下载(Civitai / HuggingFace)

模型是出图的核心。文件按类型放到 ComfyUI/models/ 下对应子目录:

类型目录典型文件来源
Checkpoint(底模)models/checkpointssd_xl_base_1.0.safetensorsHuggingFace
LoRA(风格/角色微调)models/lorasxxx.safetensorsCivitai
VAE(解码器)models/vaevae.safetensors随底模提供
ControlNetmodels/controlnetcontrol_v11p_*.safetensorsHuggingFace

2026 年主流底模选择

模型显存门槛特点适用
SD1.54G+老但生态海量低配、复古
SDXL 1.08G+画质/语义均衡、最稳默认推荐
SD3.5 Large12G+文字渲染强、结构好复杂构图
Flux.1 dev16-24G写实天花板、光影绝生产力

下载安全

只从 HuggingFace 官方组织(stabilityai、black-forest-labs)Civitai 下载。社区流传的「破解/ merged 模型」可能含恶意代码或侵权权重,本站不推荐。


八、首次出图(提示词 / 采样 / 参数)

SDXL 为例,最小工作流节点:Load CheckpointCLIP Text Encode(正/负提示词)KSamplerVAE DecodeSave Image

8.1 关键参数

参数推荐值(SDXL)作用
采样器(Sampler)DPM++ 2M KarrasEuler a去噪算法,影响质感
步数(Steps)20-30步数越多越细但收益递减
CFG Scale6-8提示词遵循度,过高会出怪图
分辨率1024×1024(SDXL 原生)偏离原生分辨率画质下降
随机种子(Seed)随机/-1固定 seed 可复现同一图

8.2 示例提示词

正:masterpiece, best quality, a cyberpunk girl with neon hair,
standing in rainy tokyo street, cinematic lighting, highly detailed

负:lowres, bad anatomy, worst quality, blurry, extra fingers

点击「Queue Prompt」即可出图。第一张出来,说明环境通了 🎉。


九、进阶(ControlNet / 面部修复 / 批量)

  • ControlNet:用线稿、姿势、深度图「控制」构图。装对应模型到 models/controlnet,加 ControlNetApply 节点,适合精准二次创作。
  • 面部修复(Face Detailer):装 ComfyUI-Impact-Pack 插件,自动检测人脸并放大重绘,解决「手可、脸崩」。
  • 批量出图:在 KSampler 前加 Primitive 批量 seed,或用 Queue 多次提交,配合 Save Image 自动存图。
  • 图生图(img2img)Load ImageVAE Encode → 接 KSampler 的 latent,用 denoise 控制改动幅度(0.5-0.7 常用)。

十、性能优化(显存不足 / 加速)

显存不够或想更快,按优先级尝试:

  1. 启动参数降显存(最立竿见影):
    bash
    python main.py --lowvram          # 6-8G 显卡
    python main.py --medvram          # 8-12G 显卡
  2. 启用 xFormers(提速 + 省显存):安装后 ComfyUI 自动调用,需与 PyTorch CUDA 版本匹配。
  3. 模型量化:Flux 可用 GGUF 量化版(Q4/Q5),显存直降一半,画质略损。
  4. 关后台程序:浏览器、游戏等占显存的应用先关掉。
  5. 降分辨率出图 + 后期放大:先 768 出图,再用 Upscale 节点放大到 2K/4K。

速度预期(真实数据)

在 RTX 4060 Ti 16G 上,SDXL 1024²、20 步约 8-12 秒/张;3060 12G 开 --lowvram20-35 秒/张;Flux-dev 在 16G 卡上单张 30-60 秒。不要和 A100 云算力比速度。


十一、常见问题

Q1:没有 N 卡,用 AMD / Mac 能跑吗?

能,但麻烦。AMD 需 ROCm、Mac 用 MPS 后端,速度远慢于 CUDA,且部分节点不兼容。本站强烈建议至少一张 NVIDIA 显卡再开始本地部署。

Q2:启动报 "Torch not compiled with CUDA enabled" 怎么办?

说明你装的是 CPU 版 PyTorch。重装 CUDA 版:pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124(按你驱动支持的 CUDA 版本选)。这是新手最高频报错。

Q3:出图全黑 / 显存溢出(CUDA out of memory)?

黑屏多半是 VAE 没加载或模型损坏;OOM 就加 --lowvram / --medvram,或换更小模型(SD1.5 / SDXL 而非 Flux)。

Q4:本地部署的图能商用吗?

取决于模型许可。SDXL 1.0 可商用;SD3.5 有非商用限制(需申请商用授权);Flux.1 dev 仅限非商用,Flux.1 schnell 可商用;Civitai 上的 LoRA 多数要求署名。商用前务必读模型卡的 License,本站不承担版权风险。

Q5:和 Midjourney 比,本地 SD 画质差很多吗?

2026 年 SDXL + 好 LoRA + ControlNet 已非常能打,写实领域 Flux 甚至反超 MJ。但 MJ 胜在「零配置、风格统一、随手出大片」。追求可控/免费/隐私选 SD,追求省心选 MJ(见 Midjourney 指南)。

Q6:如果我想本地跑的是「语言模型」而不是画图?

那本文不适用。请直接看 AI 模型本地部署对比 2026(Ollama/vLLM/llama.cpp)或 DeepSeek-R1 本地部署实战,方法论相似但工具链不同。


总结

本地部署 Stable Diffusion 不是「高不可攀」,而是「一次配置、长期受益」:

  • 8G 显存起步就能跑 SDXL,16G 可上 Flux;
  • ComfyUI 是 2026 年最值得学的方案——节点可复现、显存友好、生态最强;
  • 本文与站内的 图像对比本地部署对比Midjourney 指南 各司其职:选工具看对比,跑画图看本文,跑语言模型看 LLM 部署文
  • 显存、版权、版本坑都已如实标注,照着做基本能一次跑通。

下一步:装好 ComfyUI、放下 SDXL 底模、用第八章的提示词出你的第一张图。卡住就看第十一章 FAQ,或在站内搜相关关键词。

延伸阅读


延伸阅读

免责声明

本文仅供技术交流和学习参考。涉及第三方服务的链接可能包含 sponsored 标记,请自行核实服务条款、价格和可用性,并遵守当地法律法规。