ControlNet 详解:SD 1.5、SDXL 和 Flux 的姿势、深度、边缘和参考图像
主题:提示词
作者:Captain
发布于 2026-02-18
概述
提示词告诉模型画什么;ControlNet 告诉模型画哪里。它是一个侧网络,按家族训练,读取控制图像(简笔姿势、深度图、边缘线稿、涂鸦、分割图),引导去噪器让结果符合该结构。提示词仍决定主题、风格和光线;控制图像固定构图。这样人们才能让十个角色保持同一姿势,把 3D 渲染变成照片,或者保持产品的精确形状。
总是有两个步骤。先用预处理器把你的原始照片变成控制图像(OpenPose 画骨架,MiDaS 或 Depth Anything 估计深度,Canny 找边缘,Lineart 描轮廓)。然后对应家族的 ControlNet 模型在生成时使用该图像。直接用原始照片而不是预处理图是新手最常犯的错;第二是用
SD 1.5
ControlNet 去配
SDXL
检查点。
Flux
和 2025 年的新模型改变了局面:Black Forest Labs 提供 Flux Depth 和 Flux Canny 作为完整模型和
LoRA
,Union ControlNets 在一个文件里覆盖多种类型,适用于 SDXL 和 Flux,指令编辑器(
Qwen Image
Edit、Kontext)能处理许多“保留这个,改那个”的任务,无需控制图像。本站目录把 ControlNet 按“其他”分类并标明家族;模型页则标明控制类型。
参考
名称 | 类型 | 含义 |
|---|---|---|
OpenPose | control type | 身体、手和脸的关键点,画成简笔骨架。用于姿势转移、编舞、一致角色。手部表现较弱,除非启用了手部模型。 |
Depth (MiDaS, Zoe, Depth Anything) | control type | 灰度深度图。保持空间布局和相机视角,同时允许完全重塑风格。照片转插画时最宽容的控制。 |
Canny / Lineart / SoftEdge (HED) | control type | 边缘线稿。Canny 严格且锐利,Lineart 适合绘画,SoftEdge 较松散。适合产品形状、建筑、标志。 |
Scribble | control type | 你自己画的粗略笔触变成构图。强度低(0.5-0.7),否则结果会像涂鸦。 |
Tile | control type | 指导放大或细节处理时保持对低分辨率输入的忠实。大多数“终极放大”流程的核心。 |
IP-Adapter / Redux / reference | image conditioning | 不是 ControlNet:基于图像的风格或脸部条件,而非结构。可与 ControlNet 结合使用,兼顾两者。 |
Strength / weight | 0.4-1.0 | 结构被强制执行的力度。姿势和深度用 0.8,边缘和涂鸦用 0.5-0.7。 |
Start / end percent | 0.0-1.0 | 控制作用于去噪过程的哪一部分。结束于 0.6-0.8 让模型自由完成细节,去除“描摹”感。 |
Family files | 每个家族需要自己的 ControlNet;大小在 0.7-2.5 GB。Union 文件打包多种类型。 |
分步操作
- 选合适的控制类型:人物用姿势,场景和重塑用深度,硬边形状用 Canny 或 Lineart,想法用涂鸦,放大用 Tile。
- 加载原图并运行对应的预处理器(ComfyUI 用 controlnet_aux 节点;A1111 用 ControlNet 扩展内联处理)。预览控制图,骨架漏肢体要修正。
- ComfyUI:在 CLIP Text Encode 和 KSampler 之间用 ControlNet (Advanced),接入控制图和 ControlNet 模型,强度 0.8,开始 0,结束 0.8。
- A1111 / Forge:启用 ControlNet 单元 0,选同类型的预处理器和模型,权重 0.8,结束控制步骤 0.8,开启像素完美。
- 写你想看到的提示词,不用写姿势(姿势由 ControlNet 处理)。生成四个种子。
- 如果图像看起来像描摹或平淡,降低强度或结束百分比;结构漂移则调高。对难搞的构图叠加第二个单元(姿势 + 深度)。
示例
ComfyUI 中的姿势转移(SDXL)
Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm
用深度做照片转水彩(A1111 / Forge)
ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light
Flux Canny LoRA
Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)
技巧
- 深度比 Canny 更适合照片转插画,因为它保留纹理自由;Canny 比深度更适合标志和产品,因为它保持边缘精确。
- 结束百分比是大多数人从不调的设置,也是解决塑料感、描摹感的关键。
- 把控制图像调整到生成尺寸且保持相同长宽比;形状不匹配会裁剪骨架。
- 用 OpenPose 从你自己的照片生成,是最快获得角色一致姿势库的方法。
- Flux 里,Black Forest Labs 的 Depth 和 Canny LoRA 比完整控制模型轻量,足够大多数任务。
- 指令编辑器(Qwen Image Edit、Kontext)常常替代 ControlNet 处理“同场景不同主体”的编辑;参见 Qwen Image Edit 指南。
问题排查
ControlNet 没反应
原因
家族不匹配(SD 1.5 ControlNet 用在 SDXL 上),或者用了原始照片而非预处理图。
修复方法
匹配家族;运行预处理器并预览输出。
结果看起来像描摹且平淡
原因
强度 1.0 且结束百分比 1.0。
修复方法
强度调到 0.7,结束 0.7;让模型自由完成。
骨架漏手或肢体
原因
预处理器在杂乱照片上检测不佳。
修复方法
用启用手部的 DWPose,裁剪原图,或在 OpenPose 编辑器节点里修骨架。
两个单元时内存不足
原因
每个 ControlNet 最大 2.5 GB。
修复方法
用 Union 模型覆盖多类型,或用 fp8 ControlNet;参见显存指南。
AD

通过回复照片使用 ControlNet
在 PirateDiffusion,你只需在 Telegram 回复任意图片,带上 /render 和控制标志,服务器端就会应用对应模型的 ControlNet。固定价无限渲染。
常见问题
ControlNet 是 LoRA 吗?
不是。它是独立网络,读取图像;LoRA 是从文本调整模型权重。Flux 的 Depth 和 Canny “LoRA”是例外:控制模型以 LoRA 形式发布。
ControlNet 能用在视频上吗?
需要安装预处理模型吗?
需要,首次使用时会自动下载(ComfyUI 的 controlnet_aux,A1111 的扩展)。它们很小。
IP-Adapter 和 ControlNet 哪个更好?
用途不同:IP-Adapter 复制图像的外观或身份,ControlNet 复制结构。很多流程两者都用。
云端能用吗?
PirateDiffusion 和 BitVector 都装有 ControlNet;你只需提供原图和控制类型。
链接与来源
- ControlNet paper (Zhang et al., 2023)
- ControlNet 1.1 models (lllyasviel)
- ComfyUI controlnet_aux preprocessors
- SDXL family page
- Flux family page
- PirateDiffusion
本指南涉及的模型
作者
Captain
相关指南
模型
Checkpoint、LoRA、embedding 和 ControlNet:各文件的作用
你会遇到的六种模型文件,每种文件改变的内容、大小、存放位置和使用时机:检查点和微调,LoRA 及其 LyCORIS 亲属,文本反转嵌入,ControlNet 和 IP-Adapter,VAE 和放大器。
作者:Quartermaster
2025-10-08
提示词
img2img、修补和扩展基础:修复手部、更换物体和延展画面
从已有图片生成的三种方式,而不是从噪声开始:img2img 用去噪值进行风格重塑,修补只重绘遮罩区域(修复手和脸的标准方法),扩展则是延展画布;包括 SD 1.5、SDXL、Flux Fill 和 Qwen Image Edit 的去噪、填充和模型选择。
作者:Captain
2025-12-03
提示词
Qwen-Image-Edit 指南:指令提示、多图编辑及提升效果的 LoRA
如何用 Qwen-Image-Edit 获得干净的编辑效果:写指令而不是描述,保持身份和布局,多图输入,文字替换,姿势和深度控制,4步编辑的 lightning LoRA,以及 Qwen2 家族中流行的 anything-to-real 和滑块 LoRA。
作者:Captain
2026-05-26
ComfyUI
什么是 ComfyUI?新手指南:节点、工作流程和第一个图表
为从 Automatic1111、Fooocus 或网页应用过来的人解释 ComfyUI:为什么它是一个图表,默认工作流程中的七个节点及其作用,如何从图片加载工作流程,模型放在哪里,缺失节点的管理器,以及什么时候用更简单的工具或云端更合适。
作者:Lookout
2025-12-17
模型
AI图像放大:ESRGAN模型、hires-fix、切片扩散及各自适用场景
三种放大方式及其用途:快速像素放大器(4x-UltraSharp、Real-ESRGAN、SwinIR、DAT)用于干净放大,hires-fix在生成时添加细节,切片扩散(Ultimate SD Upscale、SUPIR、基于Flux)用于将1024渲染图变成细节丰富的4K打印;包括去噪值、切片大小和推荐下载的模型。
作者:Quartermaster
2026-03-04
更多指南
云服务
固定费用 vs 代币:为什么像 Graydient.ai 这样的无限计划是 2026 年 AI 创作者的最佳选择
一份排名成本对比,价格截至 2026 年 10 月 8 日,比较了 Graydient.ai 这类固定费用无限计划与 Midjourney、Leonardo、fal.ai、Replicate、Runway 和 Kling 的代币和积分定价:每月 1,000 张图片和 1,000 个视频在各平台的真实花费,以及为什么一个固定费用覆盖无限图片、视频、音频、Grok LLM 聊天和网页应用,对反复创作的创作者来说最划算。
作者:Captain
2026-10-08
模型
FLUX.1 Dev:如何提示,最佳设置和创意点子
Black Forest Labs 的 FLUX.1 Dev 实用指南:自然语言提示、引导和步数设置、LoRA 叠加、文本渲染以及发挥其优势的提示创意。
作者:Captain
2026-09-30
模型
Stable Diffusion XL 1.0:提示词、设置及其优势
如何充分利用官方的 SDXL 1.0 基础模型:原生分辨率、CFG 和采样器设置、精修器、负面提示词以及 SDXL 仍然擅长的风格创意。
作者:Captain
2026-10-01
模型
Stable Diffusion 1.5:经典模型,正确提示使用
Stable Diffusion 1.5 依然值得了解:合适的分辨率、CFG 和采样器,如何使用它庞大的 LoRA 和嵌入库,以及适合 512 像素模型的创意提示思路。
作者:Captain
2026-10-02
模型
FLUX.2 Dev:使用最新的 Black Forest Labs 模型进行提示
FLUX.2 Dev 支持更长的提示词、更好的文本、更强的真实感和多参考编辑。这个指南介绍了 turbo 工作流程、引导和分辨率设置、提示结构以及利用其新优势的思路。
作者:Captain
2026-10-03
模型
Qwen-Image:长提示词、完美文字和双语海报
Qwen-Image 是当画面中文字很重要时的首选模型。学习如何写它的长描述提示词,准确渲染英文和中文文本,设置 CFG 和步数,并探索以布局为主的创意想法。
作者:Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
版权所有
