为什么选择本地部署Stable Diffusion

Midjourney按月收费,生成图片的版权归属有争议。Stable Diffusion完全开源免费,本地部署后无限出图,生成的图片版权归你所有,可以商用。如果你有NVIDIA显卡,这是性价比最高的AI绘图方案。

第一步:硬件与系统准备

最低配置:NVIDIA显卡4G显存(GTX 1650级别),16G内存,50G硬盘空间。推荐配置:RTX 3060 12G或更高,32G内存,SSD固态硬盘。

系统要求:Windows 10/11或Linux。Mac用户(M1/M2)可以部署但速度较慢。确保显卡驱动是最新版,访问NVIDIA官网下载更新。

第二步:安装WebUI

最简单的方式是用整合包(如秋叶整合包),下载解压即用。手动安装步骤:

  1. 安装Python 3.10(勾选Add to PATH)
  2. 安装Git
  3. 打开命令行,克隆仓库:git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
  4. 进入目录运行webui-user.bat(Windows)或./webui.sh(Linux)
  5. 首次启动会自动下载基础模型,约4GB

启动成功后浏览器自动打开http://127.0.0.1:7860,这就是WebUI界面。

第三步:下载与管理模型

基础模型决定画风。常用模型:

  • SDXL Base ——官方基础模型,通用性强
  • Realistic Vision ——写实风格,适合产品图和人像
  • Anime/Manga模型 ——二次元风格
  • 国风模型 ——中国古典风格

模型下载网站:Civitai、Hugging Face。下载的.ckpt或.safetensors文件放入models/Stable-diffusion/目录,刷新WebUI即可使用。

第四步:提示词撰写技巧

提示词结构:质量词 + 主体描述 + 场景环境 + 风格修饰 + 技术参数

masterpiece, best quality, a cup of coffee on wooden table, morning sunlight through window, cozy cafe atmosphere, warm tones, photorealistic, 8k uhd, dslr

负面提示词(避免什么):

low quality, blurry, deformed, extra fingers, bad anatomy, watermark, signature, text

技巧:用括号加权,如(coffee:1.3)增加coffee权重;用[brackets]降低权重。权重范围0.5-1.5。

第五步:ControlNet精准控制

ControlNet让你控制图片的构图、姿势、线条。安装:在WebUI的扩展选项卡中安装ControlNet扩展,下载对应的预处理器和模型。

常用控制方式:

  • Canny边缘——上传线稿,AI按线条生成上色图
  • OpenPose——上传人物姿势图,AI生成相同姿势的人物
  • Depth——上传深度图,控制空间关系
  • Reference——上传参考图,保持风格一致

电商应用:拍摄产品白底图,用Canny控制轮廓,生成不同场景的产品展示图。

第六步:商用授权与注意事项

Stable Diffusion模型本身开源,商用自由。但注意:

  • 基础模型可商用,某些第三方模型有特定授权,下载时查看License
  • 生成的人物肖像用于商业推广需获得肖像权授权
  • 生成的商标、品牌logo可能涉及知识产权,商用前核查
  • 建议保留生成参数和种子值,便于复现和证明原创性

常见问题与误区

  • 生成速度慢——开启xformers加速,或用–medvram降低显存占用
  • 人物手指变形——用ADetailer插件自动修复面部和手部
  • 图片风格不一致——固定种子值和模型,使用Reference控制
  • 显存不足报错——降低分辨率(如512×768),或启用Tiled VAE

效率数据

实测:RTX 3060 12G显卡,512×512图片生成速度约3-5秒/张,1024×1024约10-15秒/张。对比Midjourney Fast模式约1分钟/张,本地部署速度快5-10倍,且完全免费。一次批量生成50张产品场景图约10分钟,传统设计或摄影成本至少数百元。核心建议是:有显卡就本地部署,没显卡可以用Google Colab免费版云端运行。