Paliwanag ng ControlNet: pose, depth, edges at reference images para sa SD 1.5, SDXL at Flux
Paksa: Prompting
Ni Captain
Inilathala 2026-02-18
Paano pinapagawa ng ControlNet sa isang modelo na sundan ang pose, depth map, edge drawing o scribble sa halip na hulaan ang komposisyon mula sa prompt: ang mga karaniwang uri ng control at kung kailan gagamitin ang bawat isa, ang preprocessor step, strength at end-percent settings, mga family-specific na file, at ang mga alternatibo sa panahon ng Flux (Flux Depth, Canny, Kontext).
Pangkalahatang-ideya
Sinasabi ng prompt kung ano ang iguguhit; sinasabi naman ng ControlNet kung saan. Isa itong side network, na tinrain para sa bawat family, na nagbabasa ng control image (stick-figure pose, depth map, edge drawing, scribble, segmentation map) at ginagabayan ang denoiser para tugma ang resulta sa istrukturang iyon. Ang prompt pa rin ang nagpapasya ng subject, estilo at ilaw; ang control image ang nag-aayos ng komposisyon. Ito ang paraan para makuha ang parehong pose sa sampung karakter, gawing larawan ang 3D render, o panatilihin ang eksaktong hugis ng produkto.
Laging may dalawang hakbang. Una, ang preprocessor ang nagko-convert ng source photo mo sa control image (OpenPose ang gumuguhit ng skeleton, MiDaS o Depth Anything ang nagtatantiya ng depth, Canny ang naghahanap ng edges, Lineart ang nagti-trace ng outlines). Pagkatapos, ang ControlNet model para sa family mo ang gagamitin ang imaheng iyon habang nagge-generate. Ang pinaka-karaniwang pagkakamali ng mga baguhan ay ang paggamit ng raw photo sa halip na preprocessed map; pangalawa ay ang paggamit ng
SD 1.5
ControlNet sa
SDXL
checkpoint
.
Binago ng
Flux
at mga modelong 2025 ang landscape: Naglalabas ang Black Forest Labs ng Flux Depth at Flux Canny bilang full models at
LoRAs
, tinatakpan ng Union ControlNets ang ilang uri sa isang file para sa SDXL at Flux, at ang mga instruction editors (
Qwen Image
Edit, Kontext) ang humahawak ng maraming "panatilihin ito, palitan iyon" na trabaho nang walang control image. Sa katalogo ng site na ito, tinatandaan ang ControlNets sa ilalim ng "iba pa" kasama ang kanilang family; sa model page naman nakalagay ang uri ng control.
Sanggunian
Pangalan | Uri | Ano ito |
|---|---|---|
OpenPose | control type | Mga keypoint ng katawan, kamay at mukha bilang stick figure. Para sa pose transfer, choreography, at consistent na mga karakter. Mahina sa kamay maliban kung naka-on ang hand model. |
Depth (MiDaS, Zoe, Depth Anything) | control type | Grey depth map. Pinapanatili ang spatial layout at camera habang pinapayagan ang buong restyling. Pinakamaluwag na control para sa photo to illustration. |
Canny / Lineart / SoftEdge (HED) | control type | Mga guhit ng edges. Strikto at matalim ang Canny, para sa mga guhit ang Lineart, maluwag naman ang SoftEdge. Para sa hugis ng produkto, arkitektura, logo. |
Scribble | control type | Mga magaspang na stroke na ikaw mismo ang gumuhit na nagiging komposisyon. Mababa ang lakas (0.5-0.7) o magmumukha itong scribble ang resulta. |
Tile | control type | Gabay para sa upscale o detail pass para manatiling tapat sa low-resolution input. Ang engine sa likod ng karamihan ng "ultimate upscale" workflows. |
IP-Adapter / Redux / reference | image conditioning | Hindi ControlNet: nagko-condition sa estilo o mukha ng imahe sa halip na sa istruktura nito. Pwedeng pagsamahin sa ControlNet para makuha ang dalawa. |
Strength / weight | 0.4-1.0 | Gaano kalakas ang pagpapatupad ng istruktura. 0.8 para sa pose at depth, 0.5-0.7 para sa edges at scribble. |
Start / end percent | 0.0-1.0 | Alin na bahagi ng denoising ang pinapagana ng control. Ang pagtatapos sa 0.6-0.8 ay nagpapahintulot sa modelo na tapusin ang mga detalye nang malaya at inaalis ang "traced" na itsura. |
Family files | SD 1.5: lllyasviel control_v11 | SDXL: diffusers / xinsir Union | Flux: Flux Depth/Canny, Shakker Union, InstantX | Bawat family ay nangangailangan ng sariling ControlNet; laki mula 0.7 hanggang 2.5 GB. Ang Union files ay nagbubuklod ng ilang uri. |
AD

Pose at depth control sa browser
Kasama sa BitVector Prism ang pose at depth control para sa SDXL at Flux models nito: mag-upload ng reference, pumili ng control, i-type ang prompt. Walang kailangang preprocessor na i-install.
Hakbang-hakbang
- Pumili ng control type para sa trabaho: pose para sa mga tao, depth para sa mga tanawin at restyling, Canny o Lineart para sa matitigas na hugis, scribble para sa mga ideya, tile para saupscaling.
- I-load ang source image mo at patakbuhin ang katugmang preprocessor (ComfyUI: controlnet_aux nodes; A1111: inline na ginagawa ng ControlNet extension). I-preview ang control image; ayusin kung may kulang na bahagi sa skeleton.
- ComfyUI: Ilagay ang ControlNet (Advanced) sa pagitan ng CLIP Text Encode at KSampler, i-wire ang control image at ControlNet model, lakas 0.8, start 0, end 0.8.
- A1111 / Forge: i-enable ang ControlNet unit 0, piliin ang preprocessor at model na pareho ang uri, weight 0.8, end control step 0.8, pixel perfect on.
- Isulat ang prompt para sa gusto mong makita, hindi para sa pose (ang pose ay hawak na). Mag-generate ng apat na seeds.
- Bawasan ang lakas o end percent kung mukhang traced o flat ang imahe; taasan kung lumilihis ang istruktura. Mag-stack ng pangalawang unit (pose + depth) para sa matitigas na komposisyon.
- Sa cloud, ginagamit ngPirateDiffusionang ControlNet kapag nag-reply ka sa source image gamit ang /render at control flag; nag-aalok naman angBitVectorng pose at depth sa mga image tools nito.
Mga halimbawa
Paglipat ng pose sa ComfyUI (SDXL)
Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm
Photo to watercolour gamit ang depth (A1111 / Forge)
ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light
Flux Canny LoRA
Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)
Mga tip
- Mas maganda ang depth kaysa Canny para sa photo-to-illustration dahil pinapalaya nito ang texture; mas maganda ang Canny kaysa depth para sa mga logo at produkto dahil pinananatili nito ang eksaktong edges.
- Ang end percent ang setting na karamihan ay hindi inaayos at ito ang nag-aayos ng plastic, traced na itsura.
- I-resize ang control image sa generation size na may parehong aspect ratio; kapag hindi tugma ang hugis, napuputol ang skeleton.
- Ang OpenPose mula sa larawan mo ay ang pinakamabilis na paraan para makakuha ng consistent na pose library para sa isang karakter.
- Para sa Flux, ang Depth at Canny LoRAs mula sa Black Forest Labs ay mas magaang kaysa full control models at sapat na para sa karamihan ng trabaho.
- Ang mga instruction editors (Qwen Image Edit, Kontext) ay madalas pumalit sa ControlNet pass para sa "parehong eksena, ibang subject" na mga edit; tingnan ang Qwen Image Edit guide.
Pag-aayos ng problema
Walang nangyayari ang ControlNet
Bakit ito nangyayari
Hindi tugma ang family (SD 1.5 ControlNet sa SDXL), o raw photo ang ginamit sa halip na preprocessed map.
Paano ayusin
Itugma ang family; patakbuhin ang preprocessor at i-preview ang output nito.
Mukhang traced at flat ang resulta
Bakit ito nangyayari
Strength 1.0 na may end percent 1.0.
Paano ayusin
Gamitin ang strength 0.7, end 0.7; hayaan ang modelo na tapusin nang sarili.
May kulang na kamay o bahagi ang skeleton
Bakit ito nangyayari
Hindi maayos na na-detect ng preprocessor sa magulong larawan.
Paano ayusin
Gamitin ang DWPose na naka-enable ang kamay, i-crop ang source, o i-edit ang skeleton sa OpenPose editor node.
Kulang sa memorya kapag may dalawang unit
Bakit ito nangyayari
Bawat ControlNet ay hanggang 2.5 GB ang laki.
Paano ayusin
Nagkakaroon ng noise ang Flux ControlNet
Bakit ito nangyayari
Paano ayusin
Gamitin ang node na sinasabi sa model page at CFG 1 ayon sa gabay.
AD

ControlNet sa pag-reply sa larawan
Sa PirateDiffusion, mag-reply ka lang sa anumang larawan sa Telegram gamit ang /render at control flag at awtomatikong ia-apply ang tamang ControlNet para sa modelo server-side. Unlimited na render sa fixed price.
Mga tanong
ControlNet ba ay isang LoRA?
Hindi. Isa itong hiwalay na network na nagbabasa ng imahe; ang LoRA ay nagbabago ng weights ng modelo mula sa teksto. Ang Depth at Canny "LoRAs" ng Flux ay exception: mga control model na inilabas bilang LoRA.
Pwede bang gamitin ang ControlNet sa video?
Oo: tinatanggap ng
Wan
VACE at Wan Fun ControlNets ang pose o depth sequences; sakop ng video guides sa site na ito ang mga iyon.
Kailangan ko ba ng preprocessor models na naka-install?
Oo, dinadownload ito sa unang gamit (controlnet_aux sa ComfyUI, extension sa A1111). Maliit lang sila.
Alin ang mas maganda, IP-Adapter o ControlNet?
Iba ang gamit: kinokopya ng IP-Adapter ang itsura o pagkakakilanlan mula sa imahe, kinokopya naman ng ControlNet ang istruktura. Maraming workflow ang gumagamit ng dalawa.
Gumagana ba ito sa cloud?
May ControlNets ang PirateDiffusion at BitVector para sa kanilang mga modelo; ikaw ang nagbibigay ng source image at control type.
Mga link at pinagmulan
- ControlNet paper (Zhang et al., 2023)
- ControlNet 1.1 models (lllyasviel)
- ComfyUI controlnet_aux preprocessors
- SDXL family page
- Flux family page
- PirateDiffusion
Mga model sa gabay na ito
Isinulat ni
Captain
Mga kaugnay na gabay
Mga model
Checkpoint vs LoRA vs embedding vs ControlNet: ano ang ginagawa ng bawat file
Anim na klase ng model files na makikilala mo, ano ang binabago ng bawat isa, gaano ito kalaki, saan ito nilalagay, at kailan ito ginagamit: checkpoints at fine-tunes, LoRAs at ang mga LyCORIS na kamag-anak nila, textual inversion embeddings, ControlNets at IP-Adapters, VAEs at upscalers.
Ni Quartermaster
2025-10-08
Prompting
img2img, inpainting at outpainting na mga batayan: pag-aayos ng mga kamay, pagpapalit ng mga bagay at pagpapalawak ng larawan
Tatlong paraan para gumawa mula sa existing na larawan imbes na mula sa noise: img2img para sa restyling gamit ang denoise value, inpainting para muling pagpipinta lang sa masked na bahagi (karaniwang ayos para sa mga kamay at mukha), at outpainting para palawakin ang canvas; kasama ang denoise, padding at pagpili ng modelo para sa SD 1.5, SDXL, Flux Fill at Qwen Image Edit.
Ni Captain
2025-12-03
Prompting
Qwen-Image-Edit gabay: mga instruction prompt, multi-image editing at mga LoRA na nagpapahusay dito
Paano makakuha ng malinis na edits gamit ang Qwen-Image-Edit: pagsulat ng mga instruction kaysa paglalarawan, pagpapanatili ng pagkakakilanlan at layout, multi-image inputs, pagpapalit ng teksto, kontrol sa pose at depth, ang lightning LoRAs para sa 4-step edits at ang anything-to-real at slider LoRAs na uso sa pamilya ng Qwen2.
Ni Captain
2026-05-26
ComfyUI
Ano ang ComfyUI? Isang gabay para sa mga baguhan tungkol sa mga node, workflow, at ang unang graph
Ipinaliwanag ang ComfyUI para sa mga galing sa Automatic1111, Fooocus o isang web app: bakit ito ay isang graph, ang pitong node sa default na workflow at ang ginagawa ng bawat isa, paano mag-load ng workflow mula sa isang imahe, saan inilalagay ang mga modelo, ang Manager para sa mga nawawalang node, at kung kailan mas mainam gumamit ng mas simpleng tool o cloud.
Ni Lookout
2025-12-17
Mga model
Pagpapalaki ng AI na mga larawan: ESRGAN models, hires-fix, tiled diffusion at kung kailan angkop ang bawat isa
Ang tatlong uri ng pagpapalaki at kung para saan sila: mabilis na pixel upscalers (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) para sa malinis na pagpapalaki, hires-fix para magdagdag ng detalye habang ginagawa ang imahe, at tiled diffusion (Ultimate SD Upscale, SUPIR, Flux-based) para gawing detalyadong 4K print ang 1024 na render; kasama ang mga halaga ng denoise, sukat ng tile at mga modelong sulit i-download.
Ni Quartermaster
2026-03-04
Higit pang gabay
Mga model
FLUX.1 Dev: paano ito i-prompt, pinakamahusay na mga setting at mga ideya sa paglikha
Isang praktikal na gabay sa FLUX.1 Dev mula sa Black Forest Labs: natural-language prompting, mga setting ng guidance at steps, LoRA stacking, text rendering at mga ideya sa prompt na nagpapalakas sa mga kakayahan nito.
Ni Captain
2026-09-30
Mga model
Stable Diffusion XL 1.0: mga prompt, settings at kung ano pa rin ang pinakamagaling nito
Paano masulit ang official SDXL 1.0 base model: native na resolusyon, CFG at sampler settings, ang refiner, negative prompts at mga ideya para sa mga estilo kung saan pa rin namumukod-tangi ang SDXL.
Ni Captain
2026-10-01
Mga model
Stable Diffusion 1.5: ang klasikong modelo, tamang paggamit ng prompt
Worth pa rin malaman ang Stable Diffusion 1.5: tamang resolution, CFG at sampler, paano gamitin ang malaking library ng LoRAs at embeddings nito, at mga creative na ideya sa prompt na bagay sa 512-pixel na modelo.
Ni Captain
2026-10-02
Mga model
FLUX.2 Dev: paggamit ng pinakabagong modelo ng Black Forest Labs
Ang FLUX.2 Dev ay may mas mahahabang prompt, mas magandang teksto, mas matibay na realism, at multi-reference editing. Saklaw ng gabay na ito ang turbo workflow, guidance at resolution settings, istruktura ng prompt, at mga ideya na gumagamit ng mga bagong lakas nito.
Ni Captain
2026-10-03
Mga model
Qwen-Image: mahahabang prompt, perpektong teksto at bilingual na poster
Ang Qwen-Image ang modelong dapat gamitin kapag mahalaga ang mga salita sa larawan. Alamin kung paano gumawa ng mahahabang deskriptibong prompt, mag-render ng English at Chinese na teksto nang tama, mag-set ng CFG at steps, at tuklasin ang mga ideya na maraming layout.
Ni Captain
2026-09-29
Mga model
SDXL-Lightning: apat na hakbang na pagbuo sa kahit anong SDXL checkpoint
Pinapabilis ng ByteDance na SDXL-Lightning LoRA ang 30-hakbang na SDXL render sa 4 na hakbang lang. Alamin ang bilang ng hakbang, ang CFG na dapat gamitin, ang sampler, at kung paano ito pagsamahin sa paborito mong checkpoints at style LoRAs.
Ni Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Gawa sa Japan
|
© 2026