Model
Trends
.ai
Model
Trends
.ai
os melhores modelos de IA de código aberto

ControlNet explicado: pose, profundidade, bordas e imagens de referência para SD 1.5, SDXL e Flux

Tema: Prompting
Por Captain
Publicado em 2026-02-18
Como o ControlNet faz o modelo seguir uma pose, um mapa de profundidade, um desenho de borda ou um rabisco em vez de adivinhar a composição pelo prompt: os tipos comuns de controle e quando usar cada um, a etapa do pré-processador, configurações de força e porcentagem final, os arquivos específicos de cada família e as alternativas da era Flux (Flux Depth, Canny, Kontext).

Visão geral

Um prompt diz o que desenhar; o ControlNet diz onde. É uma rede lateral, treinada por família, que lê uma imagem de controle (uma pose de boneco-palito, um mapa de profundidade, um desenho de borda, um rabisco, um mapa de segmentação) e direciona o denoiser para que o resultado combine com essa estrutura. O prompt ainda decide o assunto, estilo e luz; a imagem de controle fixa a composição. É assim que as pessoas conseguem a mesma pose em dez personagens, transformam uma renderização 3D em uma foto ou mantêm a forma exata de um produto.
Sempre acontecem dois passos. Primeiro um pré-processador transforma sua foto original na imagem de controle (OpenPose desenha o esqueleto, MiDaS ou Depth Anything estimam a profundidade, Canny encontra bordas, Lineart traça contornos). Depois o modelo ControlNet da sua família usa essa imagem durante a geração. Usar a foto original em vez do mapa pré-processado é o erro número um dos iniciantes; o segundo é usar um ControlNet
SD 1.5
em um
checkpoint
SDXL
.
Flux
e os modelos de 2025 mudaram o cenário: Black Forest Labs oferece Flux Depth e Flux Canny como modelos completos e
LoRAs
, Union ControlNets juntam vários tipos em um arquivo para SDXL e Flux, e editores de instrução (
Qwen Image
Edit, Kontext) fazem muitos trabalhos de "manter isso, mudar aquilo" sem precisar de uma imagem de controle. O catálogo neste site marca os ControlNets em "outros" com sua família; a página do modelo nomeia o tipo de controle.

Referência

Nome
Tipo
O que é
OpenPose
control type
Pontos-chave do corpo, mãos e rosto como um boneco-palito. Transferência de pose, coreografia, personagens consistentes. Fraco nas mãos a menos que o modelo de mão esteja ativado.
Depth (MiDaS, Zoe, Depth Anything)
control type
Mapa de profundidade em tons de cinza. Mantém o layout espacial e a câmera enquanto permite uma reformulação completa. O controle mais tolerante para foto para ilustração.
Canny / Lineart / SoftEdge (HED)
control type
Desenhos de borda. Canny é rígido e nítido, Lineart para desenhos, SoftEdge mais solto. Formas de produtos, arquitetura, logos.
Scribble
control type
Traços grosseiros que você mesmo desenha viram a composição. Força baixa (0.5-0.7) ou o resultado fica parecido com o rabisco.
Tile
control type
Guia um upscale ou uma passagem de detalhes para manter a fidelidade à entrada de baixa resolução. O motor por trás da maioria dos fluxos de trabalho de "upscale definitivo".
IP-Adapter / Redux / reference
image conditioning
Não é um ControlNet: condiciona o estilo ou rosto de uma imagem em vez da estrutura. Combine com um ControlNet para ter os dois.
Strength / weight
0.4-1.0
Quão forte a estrutura é aplicada. 0.8 para pose e profundidade, 0.5-0.7 para bordas e rabisco.
Start / end percent
0.0-1.0
Em qual parte da remoção de ruído o controle é aplicado. Terminar em 0.6-0.8 deixa o modelo finalizar os detalhes livremente e remove o visual "riscado".
Family files
SD 1.5: lllyasviel control_v11 | SDXL: diffusers / xinsir Union | Flux: Flux Depth/Canny, Shakker Union, InstantX
Cada família precisa do seu próprio ControlNet; tamanhos de 0.7 a 2.5 GB. Arquivos Union juntam vários tipos.
AD
Controle de pose e profundidade no navegador
BitVector Prism inclui controle de pose e profundidade para seus modelos SDXL e Flux: envie uma referência, escolha o controle, digite o prompt. Sem pré-processadores para instalar.

Passo a passo

  1. Escolha o tipo de controle para o trabalho: pose para pessoas, profundidade para cenas e reformulação, Canny ou Lineart para formas rígidas, rabisco para ideias, tile para
    upscaling
    .
  2. Baixe o ControlNet da família do seu checkpoint para models/controlnet (
    ComfyUI
    ) ou models/ControlNet (A1111,
    Forge
    ). Arquivos Union economizam espaço se usar vários tipos.
  3. Carregue sua imagem original e rode o pré-processador correspondente (ComfyUI: os nós controlnet_aux; A1111: a extensão ControlNet faz isso direto). Veja a imagem de controle; corrija se o esqueleto perdeu um membro.
  4. ComfyUI: Aplique ControlNet (Avançado) entre CLIP Text Encode e KSampler, conecte a imagem de controle e o modelo ControlNet, força 0.8, início 0, fim 0.8.
  5. A1111 / Forge: ative a unidade ControlNet 0, escolha pré-processador e modelo do mesmo tipo, peso 0.8, passo final do controle 0.8, pixel perfect ligado.
  6. Escreva o prompt para o que quer ver, não para a pose (a pose é controlada). Gere quatro seeds.
  7. Diminua a força ou a porcentagem final se a imagem parecer riscada ou sem profundidade; aumente se a estrutura fugir. Use uma segunda unidade (pose + profundidade) para composições difíceis.
  8. Na nuvem,
    PirateDiffusion
    aplica ControlNet quando você responde a uma imagem original com /render e uma flag de controle;
    BitVector
    oferece pose e profundidade nas suas ferramentas de imagem.

Exemplos

Transferência de pose no ComfyUI (SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

Foto para aquarela com profundidade (A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

Dicas

  • Profundidade é melhor que Canny para foto para ilustração porque deixa a textura livre; Canny é melhor que profundidade para logos e produtos porque mantém as bordas exatas.
  • A porcentagem final é a configuração que a maioria das pessoas nunca mexe e que resolve o visual plástico e riscado.
  • Redimensione a imagem de controle para o tamanho da geração mantendo a mesma proporção; formatos diferentes cortam o esqueleto.
  • OpenPose a partir de uma foto sua é a forma mais rápida de criar uma biblioteca de poses consistente para um personagem.
  • Para Flux, os LoRAs Depth e Canny da Black Forest Labs são mais leves que os modelos completos de controle e bons para a maioria dos trabalhos.
  • Editores de instrução (Qwen Image Edit, Kontext) muitas vezes substituem uma passagem ControlNet para edições de "mesma cena, assunto diferente"; veja o guia do Qwen Image Edit.

Solução de problemas

ControlNet não faz nada

Por que acontece
Incompatibilidade de família (ControlNet SD 1.5 em SDXL), ou a foto original foi usada em vez do mapa pré-processado.

Como corrigir
Use a família correta; rode o pré-processador e confira a saída.

Resultado parece riscado e sem profundidade

Por que acontece
Força 1.0 com porcentagem final 1.0.

Como corrigir
Força 0.7, fim 0.7; deixe o modelo finalizar sozinho.

Esqueleto perde mãos ou membro

Por que acontece
Pré-processador detectou mal numa foto bagunçada.

Como corrigir
Use DWPose com mãos ativadas, corte a fonte ou edite o esqueleto num nó editor OpenPose.

Falta memória com duas unidades

Por que acontece
Cada ControlNet pode ter até 2.5 GB.

Como corrigir
Use um modelo Union para ambos os tipos, ou ControlNets fp8; veja o guia de
VRAM
.

ControlNet Flux gera ruído

Por que acontece
Nó de condicionamento errado ou
CFG
acima de 1 num modelo com distilação de orientação.

Como corrigir
Use o nó indicado na página do modelo e CFG 1 com orientação conforme a página.

AD
PirateDiffusion
ControlNet respondendo a uma foto
No PirateDiffusion você responde a qualquer imagem no Telegram com /render e uma flag de controle e o ControlNet certo para o modelo é aplicado no servidor. Renderizações ilimitadas por preço fixo.

Perguntas

ControlNet é um LoRA?

Não. É uma rede separada que lê uma imagem; um LoRA muda os pesos do modelo a partir do texto. As "LoRAs" Depth e Canny do Flux são exceção: modelos de controle entregues em forma de LoRA.

Posso usar ControlNet com vídeo?

Sim:
Wan
VACE e os Wan Fun ControlNets aceitam sequências de pose ou profundidade; os guias de vídeo neste site cobrem eles.

Preciso instalar os modelos pré-processadores?

Sim, eles baixam na primeira vez que usar (controlnet_aux no ComfyUI, a extensão no A1111). São pequenos.

Qual é melhor, IP-Adapter ou ControlNet?

Para trabalhos diferentes: IP-Adapter copia o visual ou identidade de uma imagem, ControlNet copia a estrutura. Muitos fluxos usam os dois.

Isso funciona na nuvem?

PirateDiffusion e BitVector têm os ControlNets instalados para seus modelos; você fornece a imagem original e o tipo de controle.

Links e fontes

Modelos deste guia

Escrito por
Captain

Guias relacionados

Modelos
Checkpoint vs LoRA vs embedding vs ControlNet: qual arquivo faz o quê
Os seis tipos de arquivos de modelo que você vai encontrar, o que cada um muda, o tamanho, onde colocar e quando usar: checkpoints e fine-tunes, LoRAs e seus primos LyCORIS, embeddings de inversão textual, ControlNets e IP-Adapters, VAEs e upscalers.
Por Quartermaster
2025-10-08
Prompting
img2img, inpainting e outpainting básicos: corrigindo mãos, trocando objetos e estendendo uma imagem
As três formas de gerar a partir de uma imagem existente em vez de partir do ruído: img2img para restilizar com um valor de denoise, inpainting para repintar apenas uma área mascarada (a correção padrão para mãos e rostos) e outpainting para estender a tela; com as escolhas de denoise, padding e modelo para SD 1.5, SDXL, Flux Fill e Qwen Image Edit.
Por Captain
2025-12-03
Prompting
Guia Qwen-Image-Edit: prompts de instrução, edição multi-imagem e os LoRAs que melhoram isso
Como conseguir edições limpas com o Qwen-Image-Edit: escrevendo instruções em vez de descrições, mantendo a identidade e o layout, entradas multi-imagem, substituição de texto, controle de pose e profundidade, os LoRAs lightning para edições de 4 passos e os LoRAs anything-to-real e slider que estão em alta na família Qwen2.
Por Captain
2026-05-26
ComfyUI
O que é ComfyUI? Um guia para iniciantes sobre nós, fluxos de trabalho e o primeiro gráfico
ComfyUI explicado para quem vem do Automatic1111, Fooocus ou um app web: por que é um gráfico, os sete nós no fluxo de trabalho padrão e o que cada um faz, como carregar um fluxo de trabalho a partir de uma imagem, onde ficam os modelos, o Gerenciador para nós faltantes, e quando uma ferramenta mais simples ou a nuvem é a melhor escolha.
Por Lookout
2025-12-17
Modelos
Aumentando a resolução de imagens com IA: modelos ESRGAN, hires-fix, difusão em blocos e quando usar cada um
As três famílias de upscaling e para que servem: upscalers rápidos de pixels (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) para ampliação limpa, hires-fix para adicionar detalhes na geração, e difusão em blocos (Ultimate SD Upscale, SUPIR, baseado em Flux) para transformar uma renderização 1024 em uma impressão 4K detalhada; com valores de denoise, tamanhos de blocos e os modelos que vale a pena baixar.
Por Quartermaster
2026-03-04

Mais guias

Modelos
FLUX.1 Dev: como criar prompts, melhores configurações e ideias criativas
Um guia prático para FLUX.1 Dev da Black Forest Labs: como criar prompts em linguagem natural, configurações de orientação e passos, empilhamento de LoRA, renderização de texto e ideias de prompt que aproveitam seus pontos fortes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configurações e no que ele ainda é melhor
Como tirar o máximo proveito do modelo base oficial SDXL 1.0: resoluções nativas, configurações de CFG e sampler, o refinador, prompts negativos e ideias de estilos onde o SDXL ainda se destaca.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: o modelo clássico, usado do jeito certo
Stable Diffusion 1.5 ainda vale a pena conhecer: a resolução certa, CFG e sampler, como usar sua enorme biblioteca de LoRAs e embeddings, e ideias criativas de prompt para um modelo de 512 pixels.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: criando prompts para o modelo mais novo da Black Forest Labs
FLUX.2 Dev traz prompts maiores, texto melhor, realismo mais forte e edição com múltiplas referências. Este guia cobre o fluxo turbo, configurações de orientação e resolução, estrutura do prompt e ideias que aproveitam suas novas forças.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts longos, texto perfeito e pôsteres bilíngues
Qwen-Image é o modelo ideal quando as palavras na imagem importam. Aprenda a escrever seus prompts longos e descritivos, renderizar texto em inglês e chinês com precisão, ajustar CFG e passos, e explorar ideias criativas com muitos elementos no layout.
Por Captain
2026-09-29
Modelos
SDXL-Lightning: geração em quatro passos em qualquer checkpoint SDXL
O LoRA SDXL-Lightning da ByteDance transforma uma renderização SDXL de 30 passos em uma de 4 passos. Saiba a quantidade de passos, o CFG que você deve usar, o sampler e como combinar com seus checkpoints e LoRAs de estilo favoritos.
Por Captain
2026-09-30