Model
Trends
.ai
Model
Trends
.ai
最好的开源 AI 模型

ControlNet 详解:SD 1.5、SDXL 和 Flux 的姿势、深度、边缘和参考图像

主题:提示词
作者:Captain
发布于 2026-02-18
Share

概述

提示词告诉模型画什么;ControlNet 告诉模型画哪里。它是一个侧网络,按家族训练,读取控制图像(简笔姿势、深度图、边缘线稿、涂鸦、分割图),引导去噪器让结果符合该结构。提示词仍决定主题、风格和光线;控制图像固定构图。这样人们才能让十个角色保持同一姿势,把 3D 渲染变成照片,或者保持产品的精确形状。
总是有两个步骤。先用预处理器把你的原始照片变成控制图像(OpenPose 画骨架,MiDaS 或 Depth Anything 估计深度,Canny 找边缘,Lineart 描轮廓)。然后对应家族的 ControlNet 模型在生成时使用该图像。直接用原始照片而不是预处理图是新手最常犯的错;第二是用
SD 1.5
ControlNet 去配
SDXL
检查点。
Flux
和 2025 年的新模型改变了局面:Black Forest Labs 提供 Flux Depth 和 Flux Canny 作为完整模型和
LoRA
,Union ControlNets 在一个文件里覆盖多种类型,适用于 SDXL 和 Flux,指令编辑器(
Qwen Image
Edit、Kontext)能处理许多“保留这个,改那个”的任务,无需控制图像。本站目录把 ControlNet 按“其他”分类并标明家族;模型页则标明控制类型。

参考

名称
类型
含义
OpenPose
control type
身体、手和脸的关键点,画成简笔骨架。用于姿势转移、编舞、一致角色。手部表现较弱,除非启用了手部模型。
Depth (MiDaS, Zoe, Depth Anything)
control type
灰度深度图。保持空间布局和相机视角,同时允许完全重塑风格。照片转插画时最宽容的控制。
Canny / Lineart / SoftEdge (HED)
control type
边缘线稿。Canny 严格且锐利,Lineart 适合绘画,SoftEdge 较松散。适合产品形状、建筑、标志。
Scribble
control type
你自己画的粗略笔触变成构图。强度低(0.5-0.7),否则结果会像涂鸦。
Tile
control type
指导放大或细节处理时保持对低分辨率输入的忠实。大多数“终极放大”流程的核心。
IP-Adapter / Redux / reference
image conditioning
不是 ControlNet:基于图像的风格或脸部条件,而非结构。可与 ControlNet 结合使用,兼顾两者。
Strength / weight
0.4-1.0
结构被强制执行的力度。姿势和深度用 0.8,边缘和涂鸦用 0.5-0.7。
Start / end percent
0.0-1.0
控制作用于去噪过程的哪一部分。结束于 0.6-0.8 让模型自由完成细节,去除“描摹”感。
Family files
SD 1.5
: lllyasviel control_v11 |
SDXL
: diffusers / xinsir Union |
Flux
:
Flux
Depth/Canny, Shakker Union, InstantX
每个家族需要自己的 ControlNet;大小在 0.7-2.5 GB。Union 文件打包多种类型。
AD
浏览器里的姿势和深度控制
BitVector Prism 包含 SDXL 和 Flux 模型的姿势和深度控制:上传参考图,选控制类型,输入提示词。无需安装预处理器。

分步操作

  1. 选合适的控制类型:人物用姿势,场景和重塑用深度,硬边形状用 Canny 或 Lineart,想法用涂鸦,放大用 Tile。
  2. 下载对应你检查点家族的 ControlNet 到 models/controlnet(
    ComfyUI
    )或 models/ControlNet(A1111、
    Forge
    )。用 Union 文件能节省空间,如果你用多种类型。
  3. 加载原图并运行对应的预处理器(ComfyUI 用 controlnet_aux 节点;A1111 用 ControlNet 扩展内联处理)。预览控制图,骨架漏肢体要修正。
  4. ComfyUI:在 CLIP Text Encode 和 KSampler 之间用 ControlNet (Advanced),接入控制图和 ControlNet 模型,强度 0.8,开始 0,结束 0.8。
  5. A1111 / Forge:启用 ControlNet 单元 0,选同类型的预处理器和模型,权重 0.8,结束控制步骤 0.8,开启像素完美。
  6. 写你想看到的提示词,不用写姿势(姿势由 ControlNet 处理)。生成四个种子。
  7. 如果图像看起来像描摹或平淡,降低强度或结束百分比;结构漂移则调高。对难搞的构图叠加第二个单元(姿势 + 深度)。
  8. 云端上,
    PirateDiffusion
    在你回复带 /render 和控制标志的原图时应用 ControlNet;
    BitVector
    在其图像工具里提供姿势和深度控制。

示例

ComfyUI 中的姿势转移(SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

用深度做照片转水彩(A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

技巧

  • 深度比 Canny 更适合照片转插画,因为它保留纹理自由;Canny 比深度更适合标志和产品,因为它保持边缘精确。
  • 结束百分比是大多数人从不调的设置,也是解决塑料感、描摹感的关键。
  • 把控制图像调整到生成尺寸且保持相同长宽比;形状不匹配会裁剪骨架。
  • 用 OpenPose 从你自己的照片生成,是最快获得角色一致姿势库的方法。
  • Flux 里,Black Forest Labs 的 Depth 和 Canny LoRA 比完整控制模型轻量,足够大多数任务。
  • 指令编辑器(Qwen Image Edit、Kontext)常常替代 ControlNet 处理“同场景不同主体”的编辑;参见 Qwen Image Edit 指南。

问题排查

ControlNet 没反应

原因
家族不匹配(SD 1.5 ControlNet 用在 SDXL 上),或者用了原始照片而非预处理图。

修复方法
匹配家族;运行预处理器并预览输出。

结果看起来像描摹且平淡

原因
强度 1.0 且结束百分比 1.0。

修复方法
强度调到 0.7,结束 0.7;让模型自由完成。

骨架漏手或肢体

原因
预处理器在杂乱照片上检测不佳。

修复方法
用启用手部的 DWPose,裁剪原图,或在 OpenPose 编辑器节点里修骨架。

两个单元时内存不足

原因
每个 ControlNet 最大 2.5 GB。

修复方法
用 Union 模型覆盖多类型,或用 fp8 ControlNet;参见显存指南。

Flux ControlNet 出噪点

原因
用错条件节点或在指导蒸馏模型上
CFG
超过 1。

修复方法
用模型页指定的节点,CFG 设为 1,按页说明使用指导。

AD
PirateDiffusion
通过回复照片使用 ControlNet
在 PirateDiffusion,你只需在 Telegram 回复任意图片,带上 /render 和控制标志,服务器端就会应用对应模型的 ControlNet。固定价无限渲染。

常见问题

ControlNet 是 LoRA 吗?

不是。它是独立网络,读取图像;LoRA 是从文本调整模型权重。Flux 的 Depth 和 Canny “LoRA”是例外:控制模型以 LoRA 形式发布。

ControlNet 能用在视频上吗?

能:
Wan
VACE 和 Wan Fun ControlNets 支持姿势或深度序列;本站的视频指南有介绍。

需要安装预处理模型吗?

需要,首次使用时会自动下载(ComfyUI 的 controlnet_aux,A1111 的扩展)。它们很小。

IP-Adapter 和 ControlNet 哪个更好?

用途不同:IP-Adapter 复制图像的外观或身份,ControlNet 复制结构。很多流程两者都用。

云端能用吗?

PirateDiffusion 和 BitVector 都装有 ControlNet;你只需提供原图和控制类型。

链接与来源

本指南涉及的模型

作者
Captain

相关指南

模型
Checkpoint、LoRA、embedding 和 ControlNet:各文件的作用
你会遇到的六种模型文件,每种文件改变的内容、大小、存放位置和使用时机:检查点和微调,LoRA 及其 LyCORIS 亲属,文本反转嵌入,ControlNet 和 IP-Adapter,VAE 和放大器。
作者:Quartermaster
2025-10-08
提示词
img2img、修补和扩展基础:修复手部、更换物体和延展画面
从已有图片生成的三种方式,而不是从噪声开始:img2img 用去噪值进行风格重塑,修补只重绘遮罩区域(修复手和脸的标准方法),扩展则是延展画布;包括 SD 1.5、SDXL、Flux Fill 和 Qwen Image Edit 的去噪、填充和模型选择。
作者:Captain
2025-12-03
提示词
Qwen-Image-Edit 指南:指令提示、多图编辑及提升效果的 LoRA
如何用 Qwen-Image-Edit 获得干净的编辑效果:写指令而不是描述,保持身份和布局,多图输入,文字替换,姿势和深度控制,4步编辑的 lightning LoRA,以及 Qwen2 家族中流行的 anything-to-real 和滑块 LoRA。
作者:Captain
2026-05-26
ComfyUI
什么是 ComfyUI?新手指南:节点、工作流程和第一个图表
为从 Automatic1111、Fooocus 或网页应用过来的人解释 ComfyUI:为什么它是一个图表,默认工作流程中的七个节点及其作用,如何从图片加载工作流程,模型放在哪里,缺失节点的管理器,以及什么时候用更简单的工具或云端更合适。
作者:Lookout
2025-12-17
模型
AI图像放大:ESRGAN模型、hires-fix、切片扩散及各自适用场景
三种放大方式及其用途:快速像素放大器(4x-UltraSharp、Real-ESRGAN、SwinIR、DAT)用于干净放大,hires-fix在生成时添加细节,切片扩散(Ultimate SD Upscale、SUPIR、基于Flux)用于将1024渲染图变成细节丰富的4K打印;包括去噪值、切片大小和推荐下载的模型。
作者:Quartermaster
2026-03-04

更多指南

云服务
固定费用 vs 代币:为什么像 Graydient.ai 这样的无限计划是 2026 年 AI 创作者的最佳选择
一份排名成本对比,价格截至 2026 年 10 月 8 日,比较了 Graydient.ai 这类固定费用无限计划与 Midjourney、Leonardo、fal.ai、Replicate、Runway 和 Kling 的代币和积分定价:每月 1,000 张图片和 1,000 个视频在各平台的真实花费,以及为什么一个固定费用覆盖无限图片、视频、音频、Grok LLM 聊天和网页应用,对反复创作的创作者来说最划算。
作者:Captain
2026-10-08
模型
FLUX.1 Dev:如何提示,最佳设置和创意点子
Black Forest Labs 的 FLUX.1 Dev 实用指南:自然语言提示、引导和步数设置、LoRA 叠加、文本渲染以及发挥其优势的提示创意。
作者:Captain
2026-09-30
模型
Stable Diffusion XL 1.0:提示词、设置及其优势
如何充分利用官方的 SDXL 1.0 基础模型:原生分辨率、CFG 和采样器设置、精修器、负面提示词以及 SDXL 仍然擅长的风格创意。
作者:Captain
2026-10-01
模型
Stable Diffusion 1.5:经典模型,正确提示使用
Stable Diffusion 1.5 依然值得了解:合适的分辨率、CFG 和采样器,如何使用它庞大的 LoRA 和嵌入库,以及适合 512 像素模型的创意提示思路。
作者:Captain
2026-10-02
模型
FLUX.2 Dev:使用最新的 Black Forest Labs 模型进行提示
FLUX.2 Dev 支持更长的提示词、更好的文本、更强的真实感和多参考编辑。这个指南介绍了 turbo 工作流程、引导和分辨率设置、提示结构以及利用其新优势的思路。
作者:Captain
2026-10-03
模型
Qwen-Image:长提示词、完美文字和双语海报
Qwen-Image 是当画面中文字很重要时的首选模型。学习如何写它的长描述提示词,准确渲染英文和中文文本,设置 CFG 和步数,并探索以布局为主的创意想法。
作者:Captain
2026-09-29