Model
Trends
.ai
Model
Trends
.ai
de bästa AI-modellerna med öppen källkod

ControlNet förklarat: pose, djup, kanter och referensbilder för SD 1.5, SDXL och Flux

Ämne: Promptning
Av Captain
Publicerad 2026-02-18
Share

Översikt

En prompt säger vad som ska ritas; ControlNet säger var. Det är ett sidonätverk, tränat per familj, som läser en kontrollbild (en pinnefigurpose, en djupkarta, en kantteckning, ett klotter, en segmenteringskarta) och styr brusreduceraren så att resultatet matchar den strukturen. Prompten bestämmer fortfarande motiv, stil och ljus; kontrollbilden fixar kompositionen. Det är så folk får samma pose på tio karaktärer, förvandlar en 3D-rendering till ett foto eller behåller en produkts exakta form.
Två steg händer alltid. Först gör en förbehandlare om ditt källfoto till kontrollbilden (OpenPose ritar skelettet, MiDaS eller Depth Anything uppskattar djup, Canny hittar kanter, Lineart spårar konturer). Sedan använder ControlNet-modellen för din familj den bilden under genereringen. Att mata in råfotot istället för den förbehandlade kartan är det vanligaste nybörjarfelet; det andra är att använda en
SD 1.5
ControlNet på en SDXL-checkpoint.
Flux
och modellerna från 2025 ändrade landskapet: Black Forest Labs levererar Flux Depth och Flux Canny som fulla modeller och
LoRAs
, Union ControlNets täcker flera typer i en fil för
SDXL
och Flux, och instruktionredigerare (
Qwen Image
Edit, Kontext) hanterar många "behåll detta, ändra det"-jobb utan kontrollbild. Katalogen på den här sidan taggar ControlNets under "other" med deras familj; modellens sida namnger kontrolltypen.

Referens

Namn
Typ
Vad det är
OpenPose
control type
Kropps-, hand- och ansiktspunkter som en pinnefigur. Poseöverföring, koreografi, konsekventa karaktärer. Svagt på händer om inte handmodellen är på.
Depth (MiDaS, Zoe, Depth Anything)
control type
Grå djupkarta. Behåller rumslayout och kamera samtidigt som full omstylning tillåts. Den mest förlåtande kontrollen för foto till illustration.
Canny / Lineart / SoftEdge (HED)
control type
Kantteckningar. Canny är strikt och skarp, Lineart för teckningar, SoftEdge lös. Produktformer, arkitektur, logotyper.
Scribble
control type
Grova streck du ritar själv blir en komposition. Låg styrka (0.5-0.7) annars ser resultatet ut som klottret.
Tile
control type
Vägledare för en uppskalning eller detaljpass för att hålla sig trogen lågupplöst input. Motorn bakom de flesta "ultimata uppskalnings"-arbetsflöden.
IP-Adapter / Redux / reference
image conditioning
Inte en ControlNet: konditionerar på en bilds stil eller ansikte istället för dess struktur. Kombinera med en ControlNet för att få båda.
Strength / weight
0.4-1.0
Hur hårt strukturen tvingas igenom. 0.8 för pose och djup, 0.5-0.7 för kanter och klotter.
Start / end percent
0.0-1.0
Vilken del av brusreduceringen kontrollen gäller för. Att sluta vid 0.6-0.8 låter modellen avsluta detaljer fritt och tar bort det "spårade" utseendet.
Family files
SD 1.5
: lllyasviel control_v11 |
SDXL
: diffusers / xinsir Union |
Flux
:
Flux
Depth/Canny, Shakker Union, InstantX
Varje familj behöver sin egen ControlNet; storlekar 0.7-2.5 GB. Union-filer samlar flera typer.
AD
Pose- och djupkontroll i webbläsaren
BitVector Prism inkluderar pose- och djupkontroll för sina SDXL- och Flux-modeller: ladda upp en referens, välj kontroll, skriv prompten. Inga förbehandlare att installera.

Steg för steg

  1. Välj kontrolltypen för jobbet: pose för människor, djup för scener och omstylning, Canny eller Lineart för hårda former, klotter för idéer, tile för uppskalning.
  2. Ladda ner ControlNet för din checkpoint-familj till models/controlnet (
    ComfyUI
    ) eller models/ControlNet (A1111,
    Forge
    ). Union-filer sparar plats om du använder flera typer.
  3. Ladda din källbild och kör rätt förbehandlare (ComfyUI: controlnet_aux-noderna; A1111: ControlNet-extensionen gör det inline). Förhandsgranska kontrollbilden; fixa den om skelettet missade en lem.
  4. ComfyUI: Applicera ControlNet (Advanced) mellan CLIP Text Encode och KSampler, koppla kontrollbilden och ControlNet-modellen, styrka 0.8, start 0, slut 0.8.
  5. A1111 / Forge: aktivera ControlNet enhet 0, välj förbehandlare och modell av samma typ, vikt 0.8, avslutande kontrollsteg 0.8, pixel perfect på.
  6. Skriv prompten för vad du vill se, inte för posen (posen hanteras). Generera fyra seeds.
  7. Sänk styrkan eller slutprocenten om bilden ser spårad eller platt ut; höj dem om strukturen glider. Lägg till en andra enhet (pose + djup) för envisa kompositioner.
  8. I molnet applicerar
    PirateDiffusion
    ControlNet när du svarar på en källbild med /render och en kontrollflagga;
    BitVector
    erbjuder pose och djup i sina bildverktyg.

Exempel

Poseöverföring i ComfyUI (SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

Foto till akvarell med djup (A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

Tips

  • Djup slår Canny för foto-till-illustration eftersom det lämnar texturen fri; Canny slår djup för logotyper och produkter eftersom det håller kanterna exakta.
  • Slutprocent är inställningen som de flesta aldrig rör och den som fixar det plastiga, spårade utseendet.
  • Ändra storlek på kontrollbilden till genereringsstorleken med samma bildförhållande; felaktiga former beskär skelettet.
  • OpenPose från ett foto på dig själv är det snabbaste sättet att få ett konsekvent posebibliotek för en karaktär.
  • För Flux är Depth och Canny LoRAs från Black Forest Labs lättare än fulla kontrollmodeller och tillräckligt bra för de flesta jobb.
  • Instruktionsredigerare (Qwen Image Edit, Kontext) ersätter ofta en ControlNet-pass för "samma scen, annat motiv"-redigeringar; se Qwen Image Edit-guiden.

Felsökning

ControlNet gör ingenting

Varför det händer
Familjefel (SD 1.5 ControlNet på SDXL), eller att råfotot matades in istället för den förbehandlade kartan.

Så löser du det
Matcha familjen; kör förbehandlaren och förhandsgranska dess output.

Resultatet ser spårat och platt ut

Varför det händer
Styrka 1.0 med slutprocent 1.0.

Så löser du det
Styrka 0.7, slut 0.7; låt modellen avsluta själv.

Skelettet saknar händer eller en lem

Varför det händer
Förbehandlaren upptäckte dåligt på ett rörigt foto.

Så löser du det
Använd DWPose med händer på, beskära källan eller redigera skelettet i en OpenPose-editor nod.

Slut på minne med två enheter

Varför det händer
Varje ControlNet är upp till 2.5 GB.

Så löser du det
Använd en Union-modell för båda typerna, eller fp8 ControlNets; se VRAM-guiden.

Flux ControlNet ger brus

Varför det händer
Fel konditioneringsnod eller
CFG
över 1 på en guidance-distillerad modell.

Så löser du det
Använd noden som modellens sida anger och CFG 1 med guidance enligt sidan.

AD
PirateDiffusion
ControlNet genom att svara på ett foto
På PirateDiffusion svarar du på vilken bild som helst i Telegram med /render och en kontrollflagga och rätt ControlNet för modellen appliceras server-side. Obegränsade renderingar till fast pris.

Frågor

Är ControlNet en LoRA?

Nej. Det är ett separat nätverk som läser en bild; en LoRA ändrar modellens vikter från text. Fluxs Depth och Canny "LoRAs" är ett undantag: kontrollmodeller levererade som LoRA.

Kan jag använda ControlNet med video?

Ja:
Wan
VACE och Wan Fun ControlNets tar pose- eller djupsekvenser; videoguider på den här sidan täcker dem.

Behöver jag förbehandlarmodellerna installerade?

Ja, de laddas ner vid första användning (controlnet_aux i ComfyUI, extension i A1111). De är små.

Vilken är bättre, IP-Adapter eller ControlNet?

Olika jobb: IP-Adapter kopierar utseende eller identitet från en bild, ControlNet kopierar struktur. Många arbetsflöden använder båda.

Fungerar detta i molnet?

PirateDiffusion och BitVector har ControlNets för sina modeller installerade; du tillhandahåller källbild och kontrolltyp.

Länkar och källor

Modeller i den här guiden

Skriven av
Captain

Relaterade guider

Modeller
Checkpoint vs LoRA vs embedding vs ControlNet: vilken fil gör vad
De sex typerna av modelfiler du kommer stöta på, vad varje ändrar, hur stor den är, var den ska ligga och när du ska använda den: checkpoints och fine-tunes, LoRAs och deras LyCORIS-kusiner, textual inversion embeddings, ControlNets och IP-Adapters, VAEs och upscalers.
Av Quartermaster
2025-10-08
Promptning
img2img, inpainting och outpainting grunder: fixa händer, byta objekt och förlänga en bild
De tre sätten att generera från en befintlig bild istället för från brus: img2img för att ändra stil med ett denoise-värde, inpainting för att måla om bara ett maskerat område (standardfixen för händer och ansikten), och outpainting för att förlänga duken; med val av denoise, padding och modell för SD 1.5, SDXL, Flux Fill och Qwen Image Edit.
Av Captain
2025-12-03
Promptning
Qwen-Image-Edit guide: instruktioner, redigering av flera bilder och LoRAs som förbättrar det
Hur du får rena redigeringar med Qwen-Image-Edit: skriv instruktioner istället för beskrivningar, behåll identitet och layout, använd flera bilder, textutbyte, kontroll av pose och djup, lightning-LoRAs för 4-stegsredigeringar och anything-to-real och slider-LoRAs som är populära i Qwen2-familjen.
Av Captain
2026-05-26
ComfyUI
Vad är ComfyUI? En nybörjarguide till noder, arbetsflöden och den första grafen
ComfyUI förklarat för dig som kommer från Automatic1111, Fooocus eller en webbapp: varför det är en graf, de sju noderna i standardarbetsflödet och vad varje gör, hur du laddar ett arbetsflöde från en bild, var modeller ska ligga, Manager för saknade noder, och när ett enklare verktyg eller molnet är bättre.
Av Lookout
2025-12-17
Modeller
Förstoring av AI-bilder: ESRGAN-modeller, hires-fix, tiled diffusion och när man ska använda vad
De tre typerna av förstoring och vad de är till för: snabba pixel-förstorare (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) för ren förstoring, hires-fix för att lägga till detaljer under genereringen, och tiled diffusion (Ultimate SD Upscale, SUPIR, Flux-baserade) för att göra en 1024-rendering till en detaljerad 4K-utskrift; med värden för brusreducering, kakstorlekar och modeller värda att ladda ner.
Av Quartermaster
2026-03-04

Fler guider

Molntjänster
Fast avgift vs tokens: varför obegränsade planer som Graydient.ai är bäst värde för AI-skapare 2026
En rankad kostnadsjämförelse, med priser kontrollerade den 8 oktober 2026, av fast avgift obegränsade planer som Graydient.ai mot token- och kreditpriser från Midjourney, Leonardo, fal.ai, Replicate, Runway och Kling: vad 1 000 bilder och 1 000 videor i månaden verkligen kostar på varje, och varför en fast avgift för obegränsade bilder, video, ljud, Grok LLM-chatt och webbappar är bäst för skapare som itererar.
Av Captain
2026-10-08
Modeller
FLUX.1 Dev: hur du promptar det, bästa inställningarna och kreativa idéer
En praktisk guide till FLUX.1 Dev från Black Forest Labs: naturligt språk för prompts, styrning och steginställningar, LoRA-stapling, textrendering och promptidéer som spelar på dess styrkor.
Av Captain
2026-09-30
Modeller
Stable Diffusion XL 1.0: prompts, inställningar och vad den fortfarande är bäst på
Hur du får ut mest av den officiella SDXL 1.0 basmodellen: inbyggda upplösningar, CFG- och sampler-inställningar, refiner, negativa prompts och idéer för stilar där SDXL fortfarande glänser.
Av Captain
2026-10-01
Modeller
Stable Diffusion 1.5: den klassiska modellen, rätt promptad
Stable Diffusion 1.5 är fortfarande värd att känna till: rätt upplösning, CFG och sampler, hur du använder dess stora bibliotek av LoRAs och embeddings, och kreativa promptidéer som passar en 512-pixelmodell.
Av Captain
2026-10-02
Modeller
FLUX.2 Dev: promptning av den senaste modellen från Black Forest Labs
FLUX.2 Dev ger längre prompts, bättre text, starkare realism och redigering med flera referenser. Den här guiden täcker turboarbetsflödet, styrning och upplösningsinställningar, promptstruktur och idéer som använder dess nya styrkor.
Av Captain
2026-10-03
Modeller
Qwen-Image: långa prompts, perfekt text och tvåspråkiga affischer
Qwen-Image är modellen du ska använda när orden i bilden är viktiga. Lär dig hur du skriver långa beskrivande prompts, återger engelska och kinesiska texter korrekt, ställer in CFG och steg, och utforskar kreativa idéer med mycket layout.
Av Captain
2026-09-29