Model
Trends
.ai
Model
Trends
.ai
cele mai bune modele AI open source

ControlNet explicat: poziție, adâncime, margini și imagini de referință pentru SD 1.5, SDXL și Flux

Subiect: Prompting
De Captain
Publicat 2026-02-18
Cum face ControlNet ca un model să urmeze o poziție, o hartă de adâncime, un desen de margini sau un schițaj în loc să ghicească compoziția din prompt: tipurile comune de control și când să folosești fiecare, pasul de preprocesare, setările de intensitate și procentul de final, fișierele specifice familiei și alternativele din era Flux (Flux Depth, Canny, Kontext).

Prezentare generală

Un prompt spune ce să deseneze; ControlNet spune unde. Este o rețea laterală, antrenată pe fiecare familie, care citește o imagine de control (o poziție cu schelet de bețe, o hartă de adâncime, un desen de margini, un schițaj, o hartă de segmentare) și direcționează denoiser-ul ca să se potrivească cu acea structură. Promptul decide în continuare subiectul, stilul și
lumina
; imaginea de control fixează compoziția. Așa obții aceeași poziție pentru zece personaje, transformi o randare 3D într-o fotografie sau păstrezi forma exactă a unui produs.
Sunt două pași care se întâmplă mereu. Mai întâi un preprocesor transformă fotografia ta sursă în imaginea de control (OpenPose desenează scheletul, MiDaS sau Depth Anything estimează adâncimea, Canny găsește marginile, Lineart trasează contururile). Apoi modelul ControlNet pentru familia ta folosește acea imagine în timpul generării. Să dai fotografia brută în loc de harta preprocesată e greșeala numărul unu pentru începători; a doua e să folosești un ControlNet
SD 1.5
pe un
checkpoint
SDXL
.
Flux
și modelele din 2025 au schimbat tot peisajul: Black Forest Labs oferă Flux Depth și Flux Canny ca modele complete și LoRA-uri, Union ControlNets acoperă mai multe tipuri într-un singur fișier pentru SDXL și Flux, iar editorii de instrucțiuni (
Qwen Image
Edit, Kontext) fac multe treabă de „păstrează asta, schimbă aia” fără o imagine de control. Catalogul de pe acest site etichetează ControlNet-urile la „alte” cu familia lor; pagina modelului spune tipul de control.

Referință

Nume
Tip
Ce este
OpenPose
control type
Puncte cheie pentru corp, mâini și față desenate ca un schelet de bețe. Transfer de poziție, coregrafie, personaje consistente. Slab la mâini dacă modelul pentru mâini nu e activat.
Depth (MiDaS, Zoe, Depth Anything)
control type
Hartă de adâncime gri. Păstrează aranjamentul spațial și camera, dar permite schimbări totale de stil. Cel mai permisiv control pentru foto spre ilustrație.
Canny / Lineart / SoftEdge (HED)
control type
Desene de margini. Canny e strict și ascuțit, Lineart pentru desene, SoftEdge e mai lejer. Forme de produse, arhitectură, logo-uri.
Scribble
control type
Trasee grosiere pe care le desenezi tu devin compoziția. Intensitate mică (0.5-0.7) altfel rezultatul arată ca schițajul.
Tile
control type
Ghidează un
upscaling
sau un pas de detaliu să rămână fidel inputului de rezoluție mică. Motorul din spatele majorității fluxurilor „ultimate upscale”.
IP-Adapter / Redux / reference
image conditioning
Nu e ControlNet: condiționează stilul sau fața unei imagini, nu structura. Se combină cu ControlNet ca să ai ambele.
Strength / weight
0.4-1.0
Cât de tare se aplică structura. 0.8 pentru poziție și adâncime, 0.5-0.7 pentru margini și schițaj.
Start / end percent
0.0-1.0
Partea din denoising la care se aplică controlul. Să se termine la 0.6-0.8 lasă modelul să termine detaliile liber și elimină aspectul „trasat”.
Family files
SD 1.5: lllyasviel control_v11 | SDXL: diffusers / xinsir Union | Flux: Flux Depth/Canny, Shakker Union, InstantX
Fiecare familie are nevoie de propriul ControlNet; dimensiuni între 0.7-2.5 GB. Fișierele Union grupează mai multe tipuri.
AD
Control de poziție și adâncime în browser
BitVector Prism include control de poziție și adâncime pentru modelele SDXL și Flux: încarcă o referință, alege controlul, scrie promptul. Nu trebuie să instalezi preprocesori.

Pas cu pas

  1. Alege tipul de control pentru treaba ta: poziție pentru oameni, adâncime pentru scene și restilizare, Canny sau Lineart pentru forme clare, schițaj pentru idei, tile pentru upscaling.
  2. Descarcă ControlNet-ul pentru familia checkpoint-ului tău în models/controlnet (
    ComfyUI
    ) sau models/ControlNet (A1111,
    Forge
    ). Fișierele Union economisesc spațiu dacă folosești mai multe tipuri.
  3. Încarcă imaginea sursă și rulează preprocesorul potrivit (ComfyUI: nodurile controlnet_aux; A1111: extensia ControlNet o face inline). Vezi imaginea de control; corecteaz-o dacă scheletul a ratat un membru.
  4. ComfyUI: Aplică ControlNet (Advanced) între CLIP Text Encode și KSampler, conectează imaginea de control și modelul ControlNet, intensitate 0.8, start 0, sfârșit 0.8.
  5. A1111 / Forge: activează unitatea ControlNet 0, alege preprocesorul și modelul de același tip, greutate 0.8, pasul de control final 0.8, pixel perfect activat.
  6. Scrie promptul pentru ce vrei să vezi, nu pentru poziție (poziția e gestionată). Generează patru seed-uri.
  7. Scade intensitatea sau procentul de final dacă imaginea arată trasată sau plată; crește-le dacă structura se abate. Adaugă o a doua unitate (poziție + adâncime) pentru compoziții încăpățânate.
  8. În cloud,
    PirateDiffusion
    aplică ControlNet când răspunzi la o imagine sursă cu /render și un flag de control;
    BitVector
    oferă poziție și adâncime în uneltele sale de imagine.

Exemple

Transfer de poziție în ComfyUI (SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

Foto spre acuarelă cu adâncime (A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

Sfaturi

  • Adâncimea e mai bună decât Canny pentru foto spre ilustrație pentru că lasă textura liberă; Canny e mai bun pentru logo-uri și produse pentru că păstrează marginile exacte.
  • Procentul de final e setarea pe care majoritatea oamenilor nu o ating niciodată și care repară aspectul plastic, trasat.
  • Redimensionează imaginea de control la dimensiunea de generare cu același raport de aspect; formele nepotrivite taie scheletul.
  • OpenPose dintr-o fotografie cu tine e cea mai rapidă cale să ai o bibliotecă de poziții consistente pentru un personaj.
  • Pentru Flux, LoRA-urile Depth și Canny de la Black Forest Labs sunt mai ușoare decât modelele complete de control și suficiente pentru majoritatea treburilor.
  • Editorii de instrucțiuni (Qwen Image Edit, Kontext) înlocuiesc adesea o trecere ControlNet pentru editări „aceeași scenă, subiect diferit”; vezi ghidul Qwen Image Edit.

Depanare

ControlNet nu face nimic

De ce se întâmplă
Nepotrivire de familie (ControlNet SD 1.5 pe SDXL), sau s-a folosit fotografia brută în loc de harta preprocesată.

Cum se repară
Potrivește familia; rulează preprocesorul și verifică ieșirea.

Rezultatul arată trasat și plat

De ce se întâmplă
Intensitate 1.0 cu procent de final 1.0.

Cum se repară
Intensitate 0.7, procent final 0.7; lasă modelul să termine singur.

Scheletul ratează mâinile sau un membru

De ce se întâmplă
Preprocesorul a detectat prost pe o fotografie aglomerată.

Cum se repară
Folosește DWPose cu mâinile activate, decupează sursa sau editează scheletul într-un nod editor OpenPose.

Memorie insuficientă cu două unități

De ce se întâmplă
Fiecare ControlNet poate avea până la 2.5 GB.

Cum se repară
Folosește un model Union pentru ambele tipuri sau ControlNet-uri fp8; vezi ghidul
VRAM
.

ControlNet Flux dă zgomot

De ce se întâmplă
Nod de condiționare greșit sau
CFG
peste 1 pe un model cu ghidaj distilat.

Cum se repară
Folosește nodul specificat pe pagina modelului și CFG 1 conform instrucțiunilor.

AD
PirateDiffusion
ControlNet prin răspuns la o fotografie
Pe PirateDiffusion răspunzi la orice imagine din Telegram cu /render și un flag de control și ControlNet-ul potrivit se aplică pe server. Randări nelimitate la preț fix.

Întrebări

ControlNet e un LoRA?

Nu. E o rețea separată care citește o imagine; un
LoRA
schimbă greutățile modelului din text. Excepția Flux: Depth și Canny „LoRA”-urile sunt modele de control livrate ca LoRA.

Pot folosi ControlNet cu video?

Da:
Wan
VACE și Wan Fun ControlNet-urile iau secvențe de poziții sau adâncime; ghidurile video de pe site le acoperă.

Trebuie să am instalate modelele preprocesor?

Da, se descarcă la prima folosire (controlnet_aux în ComfyUI, extensia în A1111). Sunt mici.

Care e mai bun, IP-Adapter sau ControlNet?

Depinde de treabă: IP-Adapter copiază look-ul sau identitatea dintr-o imagine, ControlNet copiază structura. Multe fluxuri folosesc ambele.

Merge asta în cloud?

PirateDiffusion și BitVector au ControlNet-urile instalate pentru modelele lor; tu dai imaginea sursă și tipul de control.

Linkuri și surse

Modele din acest ghid

Scris de
Captain

Ghiduri conexe

Modele
Checkpoint vs LoRA vs embedding vs ControlNet: ce face fiecare fișier
Cele șase tipuri de fișiere de model pe care le vei întâlni, ce schimbă fiecare, cât de mare este, unde se pune și când să le folosești: checkpoint-uri și fine-tune-uri, LoRA-uri și rudele lor LyCORIS, embedding-uri de inversare textuală, ControlNet-uri și IP-Adaptere, VAE-uri și upscalere.
De Quartermaster
2025-10-08
Prompting
Bazele img2img, inpainting și outpainting: corectarea mâinilor, schimbarea obiectelor și extinderea unei imagini
Cele trei metode de a genera pornind de la o imagine existentă în loc de zgomot: img2img pentru restilizare cu o valoare de denoise, inpainting pentru redesenarea doar a unei zone mascate (soluția standard pentru mâini și fețe) și outpainting pentru extinderea pânzei; cu opțiunile de denoise, padding și alegerea modelului pentru SD 1.5, SDXL, Flux Fill și Qwen Image Edit.
De Captain
2025-12-03
Prompting
Ghid Qwen-Image-Edit: instrucțiuni pentru prompturi, editare multi-imagine și LoRA-urile care o îmbunătățesc
Cum să obții editări curate cu Qwen-Image-Edit: scrierea instrucțiunilor în loc de descrieri, păstrarea identității și a aranjamentului, inputuri multi-imagine, înlocuirea textului, controlul poziției și adâncimii, LoRA-urile lightning pentru editări în 4 pași și LoRA-urile anything-to-real și slider care sunt în trend în familia Qwen2.
De Captain
2026-05-26
ComfyUI
Ce este ComfyUI? Un ghid pentru începători despre noduri, fluxuri de lucru și primul grafic
ComfyUI explicat pentru cei care vin de la Automatic1111, Fooocus sau o aplicație web: de ce este un graf, cele șapte noduri din fluxul de lucru implicit și ce face fiecare, cum să încarci un flux de lucru dintr-o imagine, unde se pun modelele, Managerul pentru noduri lipsă și când un instrument mai simplu sau cloud-ul sunt o alegere mai bună.
De Lookout
2025-12-17
Modele
Mărirea imaginilor AI: modele ESRGAN, hires-fix, difuzie pe plăci și când să folosești fiecare
Cele trei familii de mărire și la ce folosesc: măriri rapide pe pixeli (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) pentru mărire curată, hires-fix pentru adăugarea de detalii în timpul generării și difuzia pe plăci (Ultimate SD Upscale, SUPIR, bazat pe Flux) pentru transformarea unui render 1024 într-un print 4K detaliat; cu valori de denoise, dimensiuni de plăci și modelele care merită descărcate.
De Quartermaster
2026-03-04

Mai multe ghiduri

Modele
FLUX.1 Dev: cum să-l folosești, cele mai bune setări și idei creative
Un ghid practic pentru FLUX.1 Dev de la Black Forest Labs: cum să dai comenzi în limbaj natural, setările pentru ghidare și pași, cum să combini LoRA-uri, redarea textului și idei de prompturi care îi pun în valoare punctele forte.
De Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompturi, setări și ce face încă cel mai bine
Cum să profiți la maximum de modelul oficial SDXL 1.0 de bază: rezoluții native, setări CFG și sampler, refinerul, prompturi negative și idei pentru stiluri unde SDXL încă strălucește.
De Captain
2026-10-01
Modele
Stable Diffusion 1.5: modelul clasic, folosit corect
Stable Diffusion 1.5 merită să fie cunoscut în continuare: rezoluția potrivită, CFG și sampler-ul, cum să folosești biblioteca uriașă de LoRA și embeddings, plus idei creative de prompturi potrivite pentru un model de 512 pixeli.
De Captain
2026-10-02
Modele
FLUX.2 Dev: cum să folosești cel mai nou model Black Forest Labs
FLUX.2 Dev aduce prompturi mai lungi, text mai bun, realism mai puternic și editare cu referințe multiple. Acest ghid acoperă fluxul turbo, setările de ghidare și rezoluție, structura promptului și idei care folosesc noile sale puncte forte.
De Captain
2026-10-03
Modele
Qwen-Image: prompturi lungi, text perfect și postere bilingve
Qwen-Image e modelul la care apelezi când contează cuvintele din imagine. Învață cum să scrii prompturi lungi și descriptive, să redai text în engleză și chineză corect, să setezi CFG și pașii, și să explorezi idei creative cu layout complex.
De Captain
2026-09-29
Modele
SDXL-Lightning: generare în patru pași pe orice checkpoint SDXL
LoRA SDXL-Lightning de la ByteDance transformă o randare SDXL de 30 de pași într-una de 4 pași. Află câți pași trebuie să folosești, ce CFG să setezi, ce sampler să alegi și cum să îl combini cu checkpoint-urile și LoRA-urile tale preferate de stil.
De Captain
2026-09-30