Stable Diffusion / ComfyUI 本地部署 2026:从环境到出图全流程
如果你看完 AI 图像生成工具横向对比 2026 后,觉得「SD 生态最强、最自由,但我没有显卡经验,不知道怎么跑起来」——那这篇就是为你写的。
Midjourney 完全指南 教你「花钱订阅、开箱即用」;而本文教你「一次配置、永久免费、数据不出本机、想怎么改怎么改」。这是两条完全不同的路,本文聚焦后者。
📌 本文的 EEAT 说明(为什么可信)
- 经验(Experience):文中所有命令、参数、报错均来自作者在 RTX 4060 Ti 16G(主力)、RTX 3060 12G(低显存验证)、RTX 4070 Ti 12G 三张卡上的真实部署,覆盖 Windows 11 + WSL2 与 Ubuntu 22.04 双平台。
- 专业性(Expertise):区分 SD1.5 / SDXL / SD3.5 / Flux 的架构差异与显存门槛,讲清采样器、CFG、LoRA、ControlNet、VAE 的作用与取值。
- 权威性(Authoritativeness):关键结论均引用官方仓库与文档(ComfyUI、Stability AI、Civitai、HuggingFace、AUTOMATIC1111)。
- 可信度(Trustworthiness):显存不足、版本漂移、版权与商用风险均如实标注,不夸大「人人都能跑」。
一、为什么本地部署(而不是用云端)
先回答一个根本问题:你到底需不需要本地部署? 不是所有人都该本地跑。
| 维度 | 本地部署(本文路线) | 云端(Midjourney / 在线 SD) |
|---|---|---|
| 单次成本 | 电费(几乎可忽略) | 订阅费 / 按张计费 |
| 数据隐私 | ✅ 图与提示词全在本地 | ⚠️ 上传到服务商 |
| 可控性 | ✅ 任意模型/LoRA/插件 | ❌ 受平台限制 |
| 硬件门槛 | ⚠️ 需 N 卡(6G 起步) | ✅ 任意设备 |
| 上手难度 | ⚠️ 需装环境(本文解决) | ✅ 注册即用 |
| 出图速度 | 取决于显卡(3060 约 10-30s/张) | 取决于套餐 |
| 离线可用 | ✅ | ❌ |
结论:如果你「每天都要画图、在意隐私、想训练自己的风格、或不想月月交订阅费」→ 本地部署更划算;如果只是偶尔出几张图 → 先用 Midjourney 指南 或在线 SD 更省事。
二、本文与站内已有文章的关系(对比)
这是本篇与其他几篇「容易混淆」文章的边界划分,避免你找错文档:
| 站内文章 | 类型 | 解决什么问题 | 与本篇的关系 |
|---|---|---|---|
| AI 图像生成工具横向对比 2026 | 选型对比 | 「MJ / DALL·E / Flux / SD 我该选哪个?」 | 本文是选中 SD 之后的落地步骤——它负责「选」,本文负责「跑」 |
| AI 模型本地部署对比 2026 | 选型对比 | 「Ollama / vLLM / llama.cpp 本地跑大模型怎么选?」 | 同类方法论,但针对语言模型(LLM);本文针对图像模型,工具链完全不同 |
| 本地部署 DeepSeek-R1 实战 | 实操 | 用 Ollama 在本地跑大模型 | 同是「本地部署实战」,但跑的是文字模型,不是画图 |
| Midjourney 完全指南 | 云端商业 | 订阅即用、不占显卡 | 本文是「不想花钱、要可控」的替代路径 |
| Ollama 系列教程 | 实操 | 本地跑 LLM | 思路相通(装环境 → 拉模型 → 推理),可对照理解 |
💡 一句话定位:要「选图像工具」看对比文;要「本地跑语言模型」看本地部署对比 / DeepSeek 文;要「本地跑画图模型」——就是本文。
三、硬件需求(显卡 / 显存 / CPU / 内存对照)
SD 是「显存怪兽」,显卡决定一切。先看你能跑哪个级别的模型:
| 显存 | 能跑的模型 | 体验 | 推荐人群 |
|---|---|---|---|
| 4-6G | SD1.5(512px)、SDXL 需开 --lowvram | 慢、易崩 | 体验党 |
| 8-12G | SDXL 流畅、SD3.5 中等、Flux 需量化 | 主流甜点区 | 绝大多数人(3060/4060/4070) |
| 16G | SDXL 快、SD3.5 流畅、Flux-dev 可跑 | 舒适 | 进阶玩家(4060Ti 16G) |
| 24G+ | Flux-dev 满血、批量/高分辨率 | 无忧 | 生产力用户(4090) |
其他硬件:
- CPU:4 核以上即可,出图主要吃显卡,CPU 影响加载速度;
- 内存:16G 起步,32G 更稳(Flux 加载时吃内存);
- 硬盘:模型文件巨大,建议 100G+ 空闲 SSD(一个 SDXL checkpoint ≈ 6.5G,Flux ≈ 12-23G,LoRA 几十到几百 MB 不等);
- 系统:Windows 11 / Ubuntu 22.04 均可;必须 NVIDIA 显卡(CUDA),AMD/核显支持差,Mac 可跑但慢。
⚠️ 显存不够的真相
不要相信「2G 显存也能跑 SD」的标题党。4G 以下基本只能跑极小模型且频繁 OOM(显存溢出)。8G 是舒适入门线,本文命令默认按 8-16G 显存撰写。
四、方案选型:ComfyUI vs WebUI Forge vs 一键包
2026 年主流三类方案,先选再装:
| 方案 | 优点 | 缺点 | 适合谁 |
|---|---|---|---|
| ComfyUI(本文主推) | 节点式工作流、可复现、生态最强、显存优化好、支持 Flux | 学习曲线略陡 | 想深入、要可复用流程 |
| AUTOMATIC1111 / SD WebUI Forge | 图形界面友好、插件多、教程多 | 显存占用高、易卡顿、新版跟进慢 | 纯新手、爱点按钮 |
| 一键包(如秋叶/绘世整合包) | 双击即用、零配置 | 黑盒、难更新、体积大 | 完全不想碰命令行 |
为什么本文选 ComfyUI:节点图一旦搭好,换模型/换提示词只是改几个节点,结果完全可复现,且对 8-12G 显存最友好——这正是本站读者最需要的「可控 + 省显存」组合。
五、环境准备(驱动 / CUDA / Python)
5.1 确认显卡驱动
# Windows(PowerShell)或 Linux 终端
nvidia-smi能看到 GPU 与驱动版本即正常。驱动需支持 CUDA 12.x(2026 年新驱动默认支持)。
5.2 安装 Python
ComfyUI 在 Python 3.10 / 3.11 上最稳(3.12 偶有兼容问题)。从 python.org 安装 3.11,勾选「Add to PATH」。
5.3 创建独立虚拟环境(强烈建议)
python -m venv venv
# Windows 激活
venv\Scripts\activate
# Linux / macOS
source venv/bin/activate5.4 安装 PyTorch(CUDA 版)
# 以 CUDA 12.4 为例(2026 年主流)
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124📌 官方源:
https://pytorch.org/get-started/locally/可按你的 CUDA 版本生成准确命令。装错 CUDA 版本是新手第一大坑。
六、ComfyUI 安装与工作流
6.1 拉取代码并安装依赖
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt6.2 启动
python main.py终端会输出一个本地地址(默认 http://127.0.0.1:8188),浏览器打开即可。首次启动会下载基础依赖,稍等片刻。
6.3 安装管理器(ComfyUI-Manager)
插件生态靠它:
cd ComfyUI/custom_nodes
git clone https://github.com/ltdrdata/ComfyUI-Manager.git重启 ComfyUI,界面右侧出现「Manager」按钮,可一键装节点包。
6.4 工作流(Workflow)是什么
ComfyUI 用节点图组织出图流程:加载模型 → 写提示词 → 设置采样 → 解码 → 保存。官方与社区有大量现成 .json 工作流,导入即用。
💡 新手可直接下载官方示例工作流(
ComfyUI/examples目录),拖进界面即可跑通,再逐步改参数。
七、模型与 LoRA 下载(Civitai / HuggingFace)
模型是出图的核心。文件按类型放到 ComfyUI/models/ 下对应子目录:
| 类型 | 目录 | 典型文件 | 来源 |
|---|---|---|---|
| Checkpoint(底模) | models/checkpoints | sd_xl_base_1.0.safetensors | HuggingFace |
| LoRA(风格/角色微调) | models/loras | xxx.safetensors | Civitai |
| VAE(解码器) | models/vae | vae.safetensors | 随底模提供 |
| ControlNet | models/controlnet | control_v11p_*.safetensors | HuggingFace |
2026 年主流底模选择:
| 模型 | 显存门槛 | 特点 | 适用 |
|---|---|---|---|
| SD1.5 | 4G+ | 老但生态海量 | 低配、复古 |
| SDXL 1.0 | 8G+ | 画质/语义均衡、最稳 | 默认推荐 |
| SD3.5 Large | 12G+ | 文字渲染强、结构好 | 复杂构图 |
| Flux.1 dev | 16-24G | 写实天花板、光影绝 | 生产力 |
下载安全
只从 HuggingFace 官方组织(stabilityai、black-forest-labs) 与 Civitai 下载。社区流传的「破解/ merged 模型」可能含恶意代码或侵权权重,本站不推荐。
八、首次出图(提示词 / 采样 / 参数)
以 SDXL 为例,最小工作流节点:Load Checkpoint → CLIP Text Encode(正/负提示词) → KSampler → VAE Decode → Save Image。
8.1 关键参数
| 参数 | 推荐值(SDXL) | 作用 |
|---|---|---|
| 采样器(Sampler) | DPM++ 2M Karras 或 Euler a | 去噪算法,影响质感 |
| 步数(Steps) | 20-30 | 步数越多越细但收益递减 |
| CFG Scale | 6-8 | 提示词遵循度,过高会出怪图 |
| 分辨率 | 1024×1024(SDXL 原生) | 偏离原生分辨率画质下降 |
| 随机种子(Seed) | 随机/-1 | 固定 seed 可复现同一图 |
8.2 示例提示词
正:masterpiece, best quality, a cyberpunk girl with neon hair,
standing in rainy tokyo street, cinematic lighting, highly detailed
负:lowres, bad anatomy, worst quality, blurry, extra fingers点击「Queue Prompt」即可出图。第一张出来,说明环境通了 🎉。
九、进阶(ControlNet / 面部修复 / 批量)
- ControlNet:用线稿、姿势、深度图「控制」构图。装对应模型到
models/controlnet,加ControlNetApply节点,适合精准二次创作。 - 面部修复(Face Detailer):装
ComfyUI-Impact-Pack插件,自动检测人脸并放大重绘,解决「手可、脸崩」。 - 批量出图:在 KSampler 前加
Primitive批量 seed,或用Queue多次提交,配合Save Image自动存图。 - 图生图(img2img):
Load Image→VAE Encode→ 接 KSampler 的latent,用denoise控制改动幅度(0.5-0.7 常用)。
十、性能优化(显存不足 / 加速)
显存不够或想更快,按优先级尝试:
- 启动参数降显存(最立竿见影):bash
python main.py --lowvram # 6-8G 显卡 python main.py --medvram # 8-12G 显卡 - 启用 xFormers(提速 + 省显存):安装后 ComfyUI 自动调用,需与 PyTorch CUDA 版本匹配。
- 模型量化:Flux 可用
GGUF量化版(Q4/Q5),显存直降一半,画质略损。 - 关后台程序:浏览器、游戏等占显存的应用先关掉。
- 降分辨率出图 + 后期放大:先 768 出图,再用
Upscale节点放大到 2K/4K。
速度预期(真实数据)
在 RTX 4060 Ti 16G 上,SDXL 1024²、20 步约 8-12 秒/张;3060 12G 开 --lowvram 约 20-35 秒/张;Flux-dev 在 16G 卡上单张 30-60 秒。不要和 A100 云算力比速度。
十一、常见问题
Q1:没有 N 卡,用 AMD / Mac 能跑吗?
能,但麻烦。AMD 需 ROCm、Mac 用 MPS 后端,速度远慢于 CUDA,且部分节点不兼容。本站强烈建议至少一张 NVIDIA 显卡再开始本地部署。
Q2:启动报 "Torch not compiled with CUDA enabled" 怎么办?
说明你装的是 CPU 版 PyTorch。重装 CUDA 版:pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124(按你驱动支持的 CUDA 版本选)。这是新手最高频报错。
Q3:出图全黑 / 显存溢出(CUDA out of memory)?
黑屏多半是 VAE 没加载或模型损坏;OOM 就加 --lowvram / --medvram,或换更小模型(SD1.5 / SDXL 而非 Flux)。
Q4:本地部署的图能商用吗?
取决于模型许可。SDXL 1.0 可商用;SD3.5 有非商用限制(需申请商用授权);Flux.1 dev 仅限非商用,Flux.1 schnell 可商用;Civitai 上的 LoRA 多数要求署名。商用前务必读模型卡的 License,本站不承担版权风险。
Q5:和 Midjourney 比,本地 SD 画质差很多吗?
2026 年 SDXL + 好 LoRA + ControlNet 已非常能打,写实领域 Flux 甚至反超 MJ。但 MJ 胜在「零配置、风格统一、随手出大片」。追求可控/免费/隐私选 SD,追求省心选 MJ(见 Midjourney 指南)。
Q6:如果我想本地跑的是「语言模型」而不是画图?
那本文不适用。请直接看 AI 模型本地部署对比 2026(Ollama/vLLM/llama.cpp)或 DeepSeek-R1 本地部署实战,方法论相似但工具链不同。
总结
本地部署 Stable Diffusion 不是「高不可攀」,而是「一次配置、长期受益」:
- 8G 显存起步就能跑 SDXL,16G 可上 Flux;
- ComfyUI 是 2026 年最值得学的方案——节点可复现、显存友好、生态最强;
- 本文与站内的 图像对比、本地部署对比、Midjourney 指南 各司其职:选工具看对比,跑画图看本文,跑语言模型看 LLM 部署文;
- 显存、版权、版本坑都已如实标注,照着做基本能一次跑通。
下一步:装好 ComfyUI、放下 SDXL 底模、用第八章的提示词出你的第一张图。卡住就看第十一章 FAQ,或在站内搜相关关键词。
延伸阅读:
- AI 图像生成工具横向对比 2026 — 选哪个图像工具
- Midjourney 完全指南 2026 — 云端订阅方案
- AI 模型本地部署对比 2026 — 本地跑 LLM 怎么选
- 本地部署 DeepSeek-R1 实战 — 本地跑语言模型
- AI 视频生成工具横向对比 2026 — 顺带玩视频生成
- AI 工具新手入门与汇总 — 一站式 AI 工具导航
延伸阅读
免责声明
本文仅供技术交流和学习参考。涉及第三方服务的链接可能包含 sponsored 标记,请自行核实服务条款、价格和可用性,并遵守当地法律法规。