Model
Trends
.ai
Model
Trends
.ai
los mejores modelos de IA de código abierto

ControlNet explicado: pose, profundidad, bordes e imágenes de referencia para SD 1.5, SDXL y Flux

Tema: Prompting
Por Captain
Publicado el 2026-02-18
Cómo ControlNet hace que un modelo siga una pose, un mapa de profundidad, un dibujo de bordes o un garabato en lugar de adivinar la composición a partir del prompt: los tipos comunes de control y cuándo usar cada uno, el paso del preprocesador, los ajustes de fuerza y porcentaje final, los archivos específicos de cada familia y las alternativas de la era Flux (Flux Depth, Canny, Kontext).

Resumen

Un prompt dice qué dibujar; ControlNet dice dónde. Es una red lateral, entrenada por familia, que lee una imagen de control (una pose de figura de palo, un mapa de profundidad, un dibujo de bordes, un garabato, un mapa de segmentación) y guía el denoiser para que el resultado coincida con esa estructura. El prompt sigue decidiendo el sujeto, estilo y luz; la imagen de control fija la composición. Así es como la gente consigue la misma pose en diez personajes, convierte un render 3D en una foto o mantiene la forma exacta de un producto.
Siempre pasan dos pasos. Primero un preprocesador convierte tu foto original en la imagen de control (OpenPose dibuja el esqueleto, MiDaS o Depth Anything estiman la profundidad, Canny encuentra bordes, Lineart traza contornos). Luego el modelo ControlNet para tu familia usa esa imagen durante la generación. Usar la foto original en lugar del mapa preprocesado es el error número uno de principiantes; el segundo es usar un ControlNet de
SD 1.5
en un
checkpoint
SDXL
.
Flux
y los modelos de 2025 cambiaron el panorama: Black Forest Labs ofrece Flux Depth y Flux Canny como modelos completos y
LoRAs
, los Union ControlNets cubren varios tipos en un solo archivo para SDXL y Flux, y los editores de instrucciones (
Qwen Image
Edit, Kontext) manejan muchos trabajos de "mantener esto, cambiar aquello" sin imagen de control. El catálogo en este sitio etiqueta los ControlNets bajo "otros" con su familia; la página del modelo nombra el tipo de control.

Referencia

Nombre
Tipo
Qué es
OpenPose
control type
Puntos clave del cuerpo, manos y cara como figura de palo. Transferencia de pose, coreografía, personajes consistentes. Débil en manos a menos que el modelo de manos esté activado.
Depth (MiDaS, Zoe, Depth Anything)
control type
Mapa de profundidad en escala de grises. Mantiene la disposición espacial y la cámara mientras permite un cambio total de estilo. El control más permisivo para foto a ilustración.
Canny / Lineart / SoftEdge (HED)
control type
Dibujos de bordes. Canny es estricto y nítido, Lineart para dibujos, SoftEdge más suelto. Formas de productos, arquitectura, logos.
Scribble
control type
Trazos toscos que dibujas tú mismo y se convierten en composición. Fuerza baja (0.5-0.7) o el resultado se parece al garabato.
Tile
control type
Guía un reescalado o un pase de detalle para mantenerse fiel a la entrada de baja resolución. El motor detrás de la mayoría de los flujos de trabajo de "reescalado definitivo".
IP-Adapter / Redux / reference
image conditioning
No es un ControlNet: condiciona el estilo o la cara de una imagen en lugar de su estructura. Combínalo con un ControlNet para tener ambos.
Strength / weight
0.4-1.0
Qué tan fuerte se aplica la estructura. 0.8 para pose y profundidad, 0.5-0.7 para bordes y garabatos.
Start / end percent
0.0-1.0
En qué parte del denoising se aplica el control. Terminar en 0.6-0.8 deja que el modelo termine detalles libremente y elimina el aspecto "calco".
Family files
SD 1.5: lllyasviel control_v11 | SDXL: diffusers / xinsir Union | Flux: Flux Depth/Canny, Shakker Union, InstantX
Cada familia necesita su propio ControlNet; tamaños de 0.7 a 2.5 GB. Los archivos Union agrupan varios tipos.
AD
Control de pose y profundidad en el navegador
BitVector Prism incluye control de pose y profundidad para sus modelos SDXL y Flux: sube una referencia, elige el control, escribe el prompt. No hay preprocesadores que instalar.

Paso a paso

  1. Elige el tipo de control para el trabajo: pose para personas, profundidad para escenas y cambio de estilo, Canny o Lineart para formas definidas, garabato para ideas, tile para reescalado.
  2. Descarga el ControlNet para la familia de tu checkpoint en models/controlnet (
    ComfyUI
    ) o models/ControlNet (A1111,
    Forge
    ). Los archivos Union ahorran espacio si usas varios tipos.
  3. Carga tu imagen original y ejecuta el preprocesador correspondiente (ComfyUI: nodos controlnet_aux; A1111: la extensión ControlNet lo hace en línea). Previsualiza la imagen de control; corrígela si el esqueleto perdió alguna extremidad.
  4. ComfyUI: Aplica ControlNet (Avanzado) entre CLIP Text Encode y KSampler, conecta la imagen de control y el modelo ControlNet, fuerza 0.8, inicio 0, fin 0.8.
  5. A1111 / Forge: activa la unidad ControlNet 0, elige preprocesador y modelo del mismo tipo, peso 0.8, paso de control final 0.8, pixel perfect activado.
  6. Escribe el prompt para lo que quieres ver, no para la pose (la pose se maneja). Genera cuatro semillas.
  7. Baja la fuerza o el porcentaje final si la imagen parece calco o plana; súbelos si la estructura se desvía. Añade una segunda unidad (pose + profundidad) para composiciones difíciles.
  8. En la nube,
    PirateDiffusion
    aplica ControlNet cuando respondes a una imagen fuente con /render y una bandera de control;
    BitVector
    ofrece pose y profundidad en sus herramientas de imagen.

Ejemplos

Transferencia de pose en ComfyUI (SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

Foto a acuarela con profundidad (A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

Consejos

  • La profundidad es mejor que Canny para foto a ilustración porque deja libre la textura; Canny es mejor que profundidad para logos y productos porque mantiene los bordes exactos.
  • El porcentaje final es el ajuste que la mayoría nunca toca y el que arregla el aspecto plástico y calco.
  • Redimensiona la imagen de control al tamaño de generación con la misma relación de aspecto; formas desajustadas recortan el esqueleto.
  • OpenPose desde una foto tuya es la forma más rápida de conseguir una biblioteca de poses consistente para un personaje.
  • Para Flux, los LoRAs Depth y Canny de Black Forest Labs son más ligeros que los modelos completos de control y suficientes para la mayoría de trabajos.
  • Los editores de instrucciones (Qwen Image Edit, Kontext) a menudo reemplazan un pase de ControlNet para ediciones de "misma escena, sujeto diferente"; mira la guía de Qwen Image Edit.

Solución de problemas

ControlNet no hace nada

Por qué ocurre
Incompatibilidad de familia (ControlNet SD 1.5 en SDXL), o se usó la foto original en lugar del mapa preprocesado.

Cómo arreglarlo
Usa la familia correcta; ejecuta el preprocesador y revisa su salida.

El resultado parece calco y plano

Por qué ocurre
Fuerza 1.0 con porcentaje final 1.0.

Cómo arreglarlo
Fuerza 0.7, porcentaje final 0.7; deja que el modelo termine solo.

El esqueleto pierde manos o una extremidad

Por qué ocurre
El preprocesador detectó mal en una foto con mucho desorden.

Cómo arreglarlo
Usa DWPose con manos activadas, recorta la fuente o edita el esqueleto en un nodo editor OpenPose.

Se queda sin memoria con dos unidades

Por qué ocurre
Cada ControlNet ocupa hasta 2.5 GB.

Cómo arreglarlo
Usa un modelo Union para ambos tipos, o ControlNets fp8; mira la guía de
VRAM
.

ControlNet Flux genera ruido

Por qué ocurre
Nodo de condicionamiento incorrecto o
CFG
mayor a 1 en un modelo con guía destilada.

Cómo arreglarlo
Usa el nodo que indica la página del modelo y CFG 1 con guía según la página.

AD
PirateDiffusion
ControlNet respondiendo a una foto
En PirateDiffusion respondes a cualquier imagen en Telegram con /render y una bandera de control y se aplica el ControlNet correcto para el modelo en el servidor. Renderizados ilimitados a precio fijo.

Preguntas

¿ControlNet es un LoRA?

No. Es una red separada que lee una imagen; un LoRA cambia los pesos del modelo desde texto. Las "LoRAs" Depth y Canny de Flux son una excepción: modelos de control distribuidos en forma de LoRA.

¿Puedo usar ControlNet con video?

Sí:
Wan
VACE y los Wan Fun ControlNets toman secuencias de pose o profundidad; las guías de video en este sitio los cubren.

¿Necesito tener instalados los modelos preprocesadores?

Sí, se descargan en el primer uso (controlnet_aux en ComfyUI, la extensión en A1111). Son pequeños.

¿Cuál es mejor, IP-Adapter o ControlNet?

Para trabajos diferentes: IP-Adapter copia el aspecto o identidad de una imagen, ControlNet copia la estructura. Muchos flujos usan ambos.

¿Esto funciona en la nube?

PirateDiffusion y BitVector tienen los ControlNets instalados para sus modelos; tú proporcionas la imagen fuente y el tipo de control.

Enlaces y fuentes

Modelos de esta guía

Escrito por
Captain

Guías relacionadas

Modelos
Checkpoint vs LoRA vs embedding vs ControlNet: qué hace cada archivo
Los seis tipos de archivos de modelo que vas a encontrar, qué cambia cada uno, qué tamaño tienen, dónde van y cuándo usarlos: checkpoints y fine-tunes, LoRAs y sus primos LyCORIS, embeddings de inversión textual, ControlNets y IP-Adapters, VAEs y upscalers.
Por Quartermaster
2025-10-08
Prompting
img2img, retoque y ampliación básicos: arreglar manos, cambiar objetos y extender una imagen
Las tres formas de generar a partir de una imagen existente en lugar de desde ruido: img2img para cambiar el estilo con un valor de denoise, retoque para repintar solo un área enmascarada (la solución estándar para manos y caras), y ampliación para extender el lienzo; con las opciones de denoise, padding y modelos para SD 1.5, SDXL, Flux Fill y Qwen Image Edit.
Por Captain
2025-12-03
Prompting
Guía de Qwen-Image-Edit: instrucciones, edición con varias imágenes y los LoRAs que la mejoran
Cómo conseguir ediciones limpias con Qwen-Image-Edit: escribir instrucciones en vez de descripciones, mantener identidad y composición, entradas con varias imágenes, reemplazo de texto, control de pose y profundidad, los LoRAs lightning para ediciones de 4 pasos y los LoRAs anything-to-real y slider que están de moda en la familia Qwen2.
Por Captain
2026-05-26
ComfyUI
¿Qué es ComfyUI? Guía para principiantes sobre nodos, flujos de trabajo y el primer gráfico
ComfyUI explicado para quienes vienen de Automatic1111, Fooocus o una app web: por qué es un gráfico, los siete nodos del flujo de trabajo por defecto y qué hace cada uno, cómo cargar un flujo de trabajo desde una imagen, dónde van los modelos, el Manager para nodos faltantes y cuándo es mejor usar una herramienta más simple o la nube.
Por Lookout
2025-12-17
Modelos
Mejorar imágenes con IA: modelos ESRGAN, hires-fix, difusión en mosaico y cuándo usar cada uno
Las tres familias de mejora y para qué sirven: mejoradores rápidos de píxeles (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) para ampliaciones limpias, hires-fix para añadir detalle durante la generación, y difusión en mosaico (Ultimate SD Upscale, SUPIR, basado en Flux) para convertir un render de 1024 en una impresión 4K detallada; con valores de denoise, tamaños de mosaico y modelos recomendados para descargar.
Por Quartermaster
2026-03-04

Más guías

Modelos
FLUX.1 Dev: cómo usar prompts, mejores ajustes e ideas creativas
Una guía práctica de FLUX.1 Dev de Black Forest Labs: cómo usar prompts en lenguaje natural, ajustes de guía y pasos, apilamiento de LoRA, renderizado de texto e ideas para aprovechar sus puntos fuertes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configuraciones y en qué sigue destacando
Cómo sacar el máximo provecho del modelo base oficial SDXL 1.0: resoluciones nativas, configuraciones de CFG y sampler, el refinador, prompts negativos e ideas para estilos donde SDXL todavía brilla.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: el modelo clásico, usado correctamente
Stable Diffusion 1.5 sigue siendo importante: la resolución adecuada, CFG y sampler, cómo usar su enorme biblioteca de LoRAs y embeddings, y ideas creativas para prompts adaptadas a un modelo de 512 píxeles.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: cómo usar el modelo más nuevo de Black Forest Labs
FLUX.2 Dev trae prompts más largos, mejor texto, realismo más fuerte y edición con múltiples referencias. Esta guía cubre el flujo turbo, ajustes de guía y resolución, estructura del prompt e ideas que aprovechan sus nuevas fortalezas.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts largos, texto perfecto y carteles bilingües
Qwen-Image es el modelo al que acudir cuando las palabras en la imagen importan. Aprende a escribir sus prompts largos y descriptivos, a renderizar texto en inglés y chino con precisión, a configurar CFG y pasos, y a explorar ideas creativas con mucho diseño.
Por Captain
2026-09-29
Modelos
SDXL-Lightning: generación en cuatro pasos en cualquier checkpoint SDXL
El LoRA SDXL-Lightning de ByteDance convierte un render SDXL de 30 pasos en uno de 4 pasos. Aprende cuántos pasos usar, el CFG que necesitas, el sampler y cómo combinarlo con tus checkpoints y LoRAs de estilo favoritos.
Por Captain
2026-09-30