为什么在线工作台更适合大多数人
本地部署 Stable Diffusion 的门槛不在安装,而在显卡、显存、依赖冲突和模型管理。很多人花两天装好环境,发现 4G 显存跑不动,或者某个依赖版本不对反复报错。
在线工作台把这些都解决了:算力在云端,模型现成,界面可视化。代价是自由度略低、需按量付费,但对绝大多数创作者来说,这个交换非常划算。
第一步:理解模型、LoRA、VAE 三者关系
这是新手最混乱的地方,用一个比喻讲清楚:
- 底模(Checkpoint):画家的手和基本功,决定整体画风走向。写实、二次元、国风、摄影,由它决定
- LoRA:专项技能包,叠加在底模之上。可以是某种画风、某个角色、某种服装或光影
- VAE:色彩与细节的解码器,影响画面通透度和色彩饱和度
所以组合逻辑是:先选一个接近你目标的底模,再叠加一两个 LoRA 做细化,最后确认 VAE 正确。
最常见的错误是:底模选了二次元,却叠一堆写实 LoRA,结果出来不伦不类。底模和 LoRA 的类型必须匹配。
第二步:选择底模
按用途快速定位:
- 通用写实人像:选标注为写实、真人、摄影的底模
- 二次元插画:选二次元、动漫类底模
- 国风与古风:选专门的国风底模,通用模型画古风容易不伦不类
- 产品与电商:选电商、产品摄影类底模
- 建筑与室内:选建筑、空间类底模
选模型时别只看示例图好看,要看:更新日期(半年内的通常更好)、下载量和评分、示例图是否展示了多种场景。只放一张精修示例图的模型,往往只在特定提示词下效果好。
第三步:编写提示词
结构建议按重要性排序,越靠前权重越高:
主体描述 + 细节特征 + 场景环境 + 光影 + 画质词 + 风格词
具体例子:
一位年轻女性,黑色长发,白色衬衫,站在落地窗前,
柔和自然光从侧面照入,浅景深,皮肤质感细腻,
8k,高细节,摄影级画质,胶片色调
负面提示词同样重要,通用的一套:
低画质,模糊,畸形,多余的手指,多余的手臂,扭曲的肢体,
水印,文字,过曝,噪点,塑料感
负面提示词几乎是必备的。不加的话,手部畸变、多余肢体这类问题出现频率会明显上升。
第四步:配置核心参数
新手只需关注四个参数:
- 采样步数:20 到 30 之间性价比最高。超过 40 步画质提升极其有限,只是浪费时间
- 提示词引导系数:控制提示词的服从程度,7 到 9 是常用区间。太高画面会过饱和发糊,太低则不遵循提示词
- 采样器:追求稳定性选 DPM 系列,追求速度选 Euler 系列。不了解就用默认
- 分辨率:不要一上来就开很高。先用标准尺寸出图确认构图,满意后再放大或高清修复
第四条是最有效的省时间技巧。高分辨率生成慢且放大后细节问题更明显,分步走比一步到位快得多。
第五步:用 ControlNet 控制构图
当你需要精确控制人物姿态、画面结构时,ControlNet 是关键工具。常见用法:
- 姿态控制:上传参考图或骨骼图,让生成的人物保持指定动作。电商服装图必备
- 线稿上色:上传线稿,让 AI 填色完成插画
- 深度控制:保持参考图的空间结构,换风格和内容
- 边缘检测:保留轮廓结构,适合产品设计变体
权重设置:0.6 到 0.8 之间通常效果最好。权重过高会让画面僵硬失去 AI 的创造性,过低则控制不住。
第六步:LoRA 的叠加与权重
LoRA 权重建议 0.6 到 0.8。多个 LoRA 叠加时,总权重不要超过 1.5,否则画面会崩坏——表现为色彩异常、结构扭曲。
实践中更稳妥的做法是一次只加一个 LoRA,确认效果后再考虑叠加。贪多是最常见的失败原因。
第七步:高清修复与后期
确认构图满意后,使用高清修复功能放大。放大倍数建议 1.5 到 2 倍,配合较低的重绘幅度(0.3 到 0.5),既能提升清晰度又不会改变画面内容。
重绘幅度过高会重新生成内容,人物长相可能变化。做系列图时要特别注意这一点。
常见问题与误区
- 问:出的图和示例图差很远?检查是否用了相同的底模、VAE 和参数。示例图通常附带完整参数,直接套用最接近。
- 误区:提示词越长越好。堆砌大量风格词会互相干扰,画面反而平均化。20 到 40 个词通常足够。
- 问:手部总是畸形?这是当前技术局限。解决方案:构图时避免手部特写,或用局部重绘专门修复,或后期手工处理。
- 误区:参数照抄就行。不同模型的最佳参数不同。换底模后要重新调提示词引导系数和步数。
- 问:生成太慢?降低分辨率和步数,或减少同时生成的张数。批量出图建议先小图筛选再放大的两阶段流程。
效率数据与实测结论
以电商产品图场景为例:本地部署方案前期投入约 6 到 8 小时(含环境配置和模型下载),单张出图约 20 秒;在线工作台前期投入约 30 分钟,单张出图约 15 到 25 秒(取决于队列)。
对于月产出在 200 张以内的创作者,在线方案在总时间成本上明显占优。超过这个量级,或者需要大量定制训练,再考虑本地部署也不迟。工具选择要看真实用量,而不是想象中的用量。