ControlNet explicat: poziție, adâncime, margini și imagini de referință pentru SD 1.5, SDXL și Flux
Subiect: Prompting
De Captain
Publicat 2026-02-18
Cum face ControlNet ca un model să urmeze o poziție, o hartă de adâncime, un desen de margini sau un schițaj în loc să ghicească compoziția din prompt: tipurile comune de control și când să folosești fiecare, pasul de preprocesare, setările de intensitate și procentul de final, fișierele specifice familiei și alternativele din era Flux (Flux Depth, Canny, Kontext).
Prezentare generală
Un prompt spune ce să deseneze; ControlNet spune unde. Este o rețea laterală, antrenată pe fiecare familie, care citește o imagine de control (o poziție cu schelet de bețe, o hartă de adâncime, un desen de margini, un schițaj, o hartă de segmentare) și direcționează denoiser-ul ca să se potrivească cu acea structură. Promptul decide în continuare subiectul, stilul și
lumina
; imaginea de control fixează compoziția. Așa obții aceeași poziție pentru zece personaje, transformi o randare 3D într-o fotografie sau păstrezi forma exactă a unui produs.
Sunt două pași care se întâmplă mereu. Mai întâi un preprocesor transformă fotografia ta sursă în imaginea de control (OpenPose desenează scheletul, MiDaS sau Depth Anything estimează adâncimea, Canny găsește marginile, Lineart trasează contururile). Apoi modelul ControlNet pentru familia ta folosește acea imagine în timpul generării. Să dai fotografia brută în loc de harta preprocesată e greșeala numărul unu pentru începători; a doua e să folosești un ControlNet
SD 1.5
pe un
checkpoint
SDXL
.
Flux
și modelele din 2025 au schimbat tot peisajul: Black Forest Labs oferă Flux Depth și Flux Canny ca modele complete și LoRA-uri, Union ControlNets acoperă mai multe tipuri într-un singur fișier pentru SDXL și Flux, iar editorii de instrucțiuni (
Qwen Image
Edit, Kontext) fac multe treabă de „păstrează asta, schimbă aia” fără o imagine de control. Catalogul de pe acest site etichetează ControlNet-urile la „alte” cu familia lor; pagina modelului spune tipul de control.
Referință
Nume | Tip | Ce este |
|---|---|---|
OpenPose | control type | Puncte cheie pentru corp, mâini și față desenate ca un schelet de bețe. Transfer de poziție, coregrafie, personaje consistente. Slab la mâini dacă modelul pentru mâini nu e activat. |
Depth (MiDaS, Zoe, Depth Anything) | control type | Hartă de adâncime gri. Păstrează aranjamentul spațial și camera, dar permite schimbări totale de stil. Cel mai permisiv control pentru foto spre ilustrație. |
Canny / Lineart / SoftEdge (HED) | control type | Desene de margini. Canny e strict și ascuțit, Lineart pentru desene, SoftEdge e mai lejer. Forme de produse, arhitectură, logo-uri. |
Scribble | control type | Trasee grosiere pe care le desenezi tu devin compoziția. Intensitate mică (0.5-0.7) altfel rezultatul arată ca schițajul. |
Tile | control type | Ghidează un upscaling sau un pas de detaliu să rămână fidel inputului de rezoluție mică. Motorul din spatele majorității fluxurilor „ultimate upscale”. |
IP-Adapter / Redux / reference | image conditioning | Nu e ControlNet: condiționează stilul sau fața unei imagini, nu structura. Se combină cu ControlNet ca să ai ambele. |
Strength / weight | 0.4-1.0 | Cât de tare se aplică structura. 0.8 pentru poziție și adâncime, 0.5-0.7 pentru margini și schițaj. |
Start / end percent | 0.0-1.0 | Partea din denoising la care se aplică controlul. Să se termine la 0.6-0.8 lasă modelul să termine detaliile liber și elimină aspectul „trasat”. |
Family files | SD 1.5: lllyasviel control_v11 | SDXL: diffusers / xinsir Union | Flux: Flux Depth/Canny, Shakker Union, InstantX | Fiecare familie are nevoie de propriul ControlNet; dimensiuni între 0.7-2.5 GB. Fișierele Union grupează mai multe tipuri. |
AD

Control de poziție și adâncime în browser
BitVector Prism include control de poziție și adâncime pentru modelele SDXL și Flux: încarcă o referință, alege controlul, scrie promptul. Nu trebuie să instalezi preprocesori.
Pas cu pas
- Alege tipul de control pentru treaba ta: poziție pentru oameni, adâncime pentru scene și restilizare, Canny sau Lineart pentru forme clare, schițaj pentru idei, tile pentru upscaling.
- Încarcă imaginea sursă și rulează preprocesorul potrivit (ComfyUI: nodurile controlnet_aux; A1111: extensia ControlNet o face inline). Vezi imaginea de control; corecteaz-o dacă scheletul a ratat un membru.
- ComfyUI: Aplică ControlNet (Advanced) între CLIP Text Encode și KSampler, conectează imaginea de control și modelul ControlNet, intensitate 0.8, start 0, sfârșit 0.8.
- A1111 / Forge: activează unitatea ControlNet 0, alege preprocesorul și modelul de același tip, greutate 0.8, pasul de control final 0.8, pixel perfect activat.
- Scrie promptul pentru ce vrei să vezi, nu pentru poziție (poziția e gestionată). Generează patru seed-uri.
- Scade intensitatea sau procentul de final dacă imaginea arată trasată sau plată; crește-le dacă structura se abate. Adaugă o a doua unitate (poziție + adâncime) pentru compoziții încăpățânate.
- În cloud,PirateDiffusionaplică ControlNet când răspunzi la o imagine sursă cu /render și un flag de control;BitVectoroferă poziție și adâncime în uneltele sale de imagine.
Exemple
Transfer de poziție în ComfyUI (SDXL)
Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm
Foto spre acuarelă cu adâncime (A1111 / Forge)
ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light
Flux Canny LoRA
Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)
Sfaturi
- Adâncimea e mai bună decât Canny pentru foto spre ilustrație pentru că lasă textura liberă; Canny e mai bun pentru logo-uri și produse pentru că păstrează marginile exacte.
- Procentul de final e setarea pe care majoritatea oamenilor nu o ating niciodată și care repară aspectul plastic, trasat.
- Redimensionează imaginea de control la dimensiunea de generare cu același raport de aspect; formele nepotrivite taie scheletul.
- OpenPose dintr-o fotografie cu tine e cea mai rapidă cale să ai o bibliotecă de poziții consistente pentru un personaj.
- Pentru Flux, LoRA-urile Depth și Canny de la Black Forest Labs sunt mai ușoare decât modelele complete de control și suficiente pentru majoritatea treburilor.
- Editorii de instrucțiuni (Qwen Image Edit, Kontext) înlocuiesc adesea o trecere ControlNet pentru editări „aceeași scenă, subiect diferit”; vezi ghidul Qwen Image Edit.
Depanare
ControlNet nu face nimic
De ce se întâmplă
Nepotrivire de familie (ControlNet SD 1.5 pe SDXL), sau s-a folosit fotografia brută în loc de harta preprocesată.
Cum se repară
Potrivește familia; rulează preprocesorul și verifică ieșirea.
Rezultatul arată trasat și plat
De ce se întâmplă
Intensitate 1.0 cu procent de final 1.0.
Cum se repară
Intensitate 0.7, procent final 0.7; lasă modelul să termine singur.
Scheletul ratează mâinile sau un membru
De ce se întâmplă
Preprocesorul a detectat prost pe o fotografie aglomerată.
Cum se repară
Folosește DWPose cu mâinile activate, decupează sursa sau editează scheletul într-un nod editor OpenPose.
Memorie insuficientă cu două unități
De ce se întâmplă
Fiecare ControlNet poate avea până la 2.5 GB.
Cum se repară
ControlNet Flux dă zgomot
De ce se întâmplă
Cum se repară
Folosește nodul specificat pe pagina modelului și CFG 1 conform instrucțiunilor.
AD

ControlNet prin răspuns la o fotografie
Pe PirateDiffusion răspunzi la orice imagine din Telegram cu /render și un flag de control și ControlNet-ul potrivit se aplică pe server. Randări nelimitate la preț fix.
Întrebări
ControlNet e un LoRA?
Nu. E o rețea separată care citește o imagine; un
LoRA
schimbă greutățile modelului din text. Excepția Flux: Depth și Canny „LoRA”-urile sunt modele de control livrate ca LoRA.
Pot folosi ControlNet cu video?
Da:
Wan
VACE și Wan Fun ControlNet-urile iau secvențe de poziții sau adâncime; ghidurile video de pe site le acoperă.
Trebuie să am instalate modelele preprocesor?
Da, se descarcă la prima folosire (controlnet_aux în ComfyUI, extensia în A1111). Sunt mici.
Care e mai bun, IP-Adapter sau ControlNet?
Depinde de treabă: IP-Adapter copiază look-ul sau identitatea dintr-o imagine, ControlNet copiază structura. Multe fluxuri folosesc ambele.
Merge asta în cloud?
PirateDiffusion și BitVector au ControlNet-urile instalate pentru modelele lor; tu dai imaginea sursă și tipul de control.
Linkuri și surse
- ControlNet paper (Zhang et al., 2023)
- ControlNet 1.1 models (lllyasviel)
- ComfyUI controlnet_aux preprocessors
- SDXL family page
- Flux family page
- PirateDiffusion
Modele din acest ghid
Scris de
Captain
Ghiduri conexe
Modele
Checkpoint vs LoRA vs embedding vs ControlNet: ce face fiecare fișier
Cele șase tipuri de fișiere de model pe care le vei întâlni, ce schimbă fiecare, cât de mare este, unde se pune și când să le folosești: checkpoint-uri și fine-tune-uri, LoRA-uri și rudele lor LyCORIS, embedding-uri de inversare textuală, ControlNet-uri și IP-Adaptere, VAE-uri și upscalere.
De Quartermaster
2025-10-08
Prompting
Bazele img2img, inpainting și outpainting: corectarea mâinilor, schimbarea obiectelor și extinderea unei imagini
Cele trei metode de a genera pornind de la o imagine existentă în loc de zgomot: img2img pentru restilizare cu o valoare de denoise, inpainting pentru redesenarea doar a unei zone mascate (soluția standard pentru mâini și fețe) și outpainting pentru extinderea pânzei; cu opțiunile de denoise, padding și alegerea modelului pentru SD 1.5, SDXL, Flux Fill și Qwen Image Edit.
De Captain
2025-12-03
Prompting
Ghid Qwen-Image-Edit: instrucțiuni pentru prompturi, editare multi-imagine și LoRA-urile care o îmbunătățesc
Cum să obții editări curate cu Qwen-Image-Edit: scrierea instrucțiunilor în loc de descrieri, păstrarea identității și a aranjamentului, inputuri multi-imagine, înlocuirea textului, controlul poziției și adâncimii, LoRA-urile lightning pentru editări în 4 pași și LoRA-urile anything-to-real și slider care sunt în trend în familia Qwen2.
De Captain
2026-05-26
ComfyUI
Ce este ComfyUI? Un ghid pentru începători despre noduri, fluxuri de lucru și primul grafic
ComfyUI explicat pentru cei care vin de la Automatic1111, Fooocus sau o aplicație web: de ce este un graf, cele șapte noduri din fluxul de lucru implicit și ce face fiecare, cum să încarci un flux de lucru dintr-o imagine, unde se pun modelele, Managerul pentru noduri lipsă și când un instrument mai simplu sau cloud-ul sunt o alegere mai bună.
De Lookout
2025-12-17
Modele
Mărirea imaginilor AI: modele ESRGAN, hires-fix, difuzie pe plăci și când să folosești fiecare
Cele trei familii de mărire și la ce folosesc: măriri rapide pe pixeli (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) pentru mărire curată, hires-fix pentru adăugarea de detalii în timpul generării și difuzia pe plăci (Ultimate SD Upscale, SUPIR, bazat pe Flux) pentru transformarea unui render 1024 într-un print 4K detaliat; cu valori de denoise, dimensiuni de plăci și modelele care merită descărcate.
De Quartermaster
2026-03-04
Mai multe ghiduri
Modele
FLUX.1 Dev: cum să-l folosești, cele mai bune setări și idei creative
Un ghid practic pentru FLUX.1 Dev de la Black Forest Labs: cum să dai comenzi în limbaj natural, setările pentru ghidare și pași, cum să combini LoRA-uri, redarea textului și idei de prompturi care îi pun în valoare punctele forte.
De Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompturi, setări și ce face încă cel mai bine
Cum să profiți la maximum de modelul oficial SDXL 1.0 de bază: rezoluții native, setări CFG și sampler, refinerul, prompturi negative și idei pentru stiluri unde SDXL încă strălucește.
De Captain
2026-10-01
Modele
Stable Diffusion 1.5: modelul clasic, folosit corect
Stable Diffusion 1.5 merită să fie cunoscut în continuare: rezoluția potrivită, CFG și sampler-ul, cum să folosești biblioteca uriașă de LoRA și embeddings, plus idei creative de prompturi potrivite pentru un model de 512 pixeli.
De Captain
2026-10-02
Modele
FLUX.2 Dev: cum să folosești cel mai nou model Black Forest Labs
FLUX.2 Dev aduce prompturi mai lungi, text mai bun, realism mai puternic și editare cu referințe multiple. Acest ghid acoperă fluxul turbo, setările de ghidare și rezoluție, structura promptului și idei care folosesc noile sale puncte forte.
De Captain
2026-10-03
Modele
Qwen-Image: prompturi lungi, text perfect și postere bilingve
Qwen-Image e modelul la care apelezi când contează cuvintele din imagine. Învață cum să scrii prompturi lungi și descriptive, să redai text în engleză și chineză corect, să setezi CFG și pașii, și să explorezi idei creative cu layout complex.
De Captain
2026-09-29
Modele
SDXL-Lightning: generare în patru pași pe orice checkpoint SDXL
LoRA SDXL-Lightning de la ByteDance transformă o randare SDXL de 30 de pași într-una de 4 pași. Află câți pași trebuie să folosești, ce CFG să setezi, ce sampler să alegi și cum să îl combini cu checkpoint-urile și LoRA-urile tale preferate de stil.
De Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Realizat în Japonia
|
© 2026