Model
Trends
.ai
Model
Trends
.ai
najlepsze otwarte modele AI

ControlNet wyjaśniony: pozowanie, głębia, krawędzie i obrazy referencyjne dla SD 1.5, SDXL i Flux

Temat: Promptowanie
Autor: Captain
Opublikowano 2026-02-18
Jak ControlNet sprawia, że model podąża za pozą, mapą głębi, rysunkiem krawędzi lub szkicem zamiast zgadywać kompozycję na podstawie promptu: popularne typy kontroli i kiedy ich używać, krok preprocessora, ustawienia siły i końcowego procentu, pliki specyficzne dla rodziny oraz alternatywy z ery Flux (Flux Depth, Canny, Kontext).

Przegląd

Prompt mówi, co narysować; ControlNet mówi, gdzie. To boczna sieć, trenowana dla każdej rodziny, która czyta obraz kontrolny (pozę w formie patyczaka, mapę głębi, rysunek krawędzi, szkic, mapę segmentacji) i kieruje denoiserem, żeby efekt pasował do tej struktury. Prompt dalej decyduje o temacie, stylu i świetle; obraz kontrolny ustala kompozycję. Dzięki temu można mieć tę samą pozę u dziesięciu postaci, zamienić render 3D w zdjęcie albo zachować dokładny kształt produktu.
Zawsze dzieją się dwa kroki. Najpierw preprocessor zamienia twoje źródłowe zdjęcie w obraz kontrolny (OpenPose rysuje szkielet, MiDaS lub Depth Anything szacują głębię, Canny wykrywa krawędzie, Lineart obrysowuje kontury). Potem model ControlNet dla twojej rodziny używa tego obrazu podczas generowania. Podstawowy błąd początkujących to podawanie surowego zdjęcia zamiast mapy po preprocessingu; drugi to używanie ControlNet z
SD 1.5
na
checkpoint
SDXL
.
Flux
i modele z 2025 roku zmieniły zasady gry: Black Forest Labs dostarcza Flux Depth i Flux Canny jako pełne modele i
LoRA
, Union ControlNets łączą kilka typów w jednym pliku dla SDXL i Flux, a edytory instrukcji (
Qwen Image
Edit, Kontext) radzą sobie z wieloma zadaniami "zachowaj to, zmień tamto" bez obrazu kontrolnego. Katalog na tej stronie oznacza ControlNety jako "inne" z podaniem rodziny; strona modelu podaje typ kontroli.

Odniesienie

Nazwa
Typ
Co to jest
OpenPose
control type
Kluczowe punkty ciała, dłoni i twarzy jako patyczak. Transfer poz, choreografia, spójne postaci. Słabo radzi sobie z rękami, chyba że jest model dłoni.
Depth (MiDaS, Zoe, Depth Anything)
control type
Szara mapa głębi. Zachowuje układ przestrzenny i kamerę, pozwala na pełną zmianę stylu. Najbardziej wyrozumiała kontrola przy przejściu ze zdjęcia do ilustracji.
Canny / Lineart / SoftEdge (HED)
control type
Rysunki krawędzi. Canny jest surowy i ostry, Lineart do rysunków, SoftEdge luźny. Kształty produktów, architektura, loga.
Scribble
control type
Szkice, które sam rysujesz, stają się kompozycją. Niska siła (0.5-0.7), inaczej efekt wygląda jak szkic.
Tile
control type
Steruje powiększeniem lub detalem, żeby wiernie odwzorować niskoresolucyjne wejście. Silnik większości workflow "ultimate upscale".
IP-Adapter / Redux / reference
image conditioning
To nie ControlNet: warunkuje styl lub twarz obrazu, nie strukturę. Można łączyć z ControlNet, żeby mieć oba efekty.
Strength / weight
0.4-1.0
Jak mocno wymuszana jest struktura. 0.8 dla pozy i głębi, 0.5-0.7 dla krawędzi i szkicu.
Start / end percent
0.0-1.0
Na jakim etapie denoisingu działa kontrola. Kończenie na 0.6-0.8 pozwala modelowi swobodnie dokończyć detale i usuwa efekt "przerysowania".
Family files
SD 1.5: lllyasviel control_v11 | SDXL: diffusers / xinsir Union | Flux: Flux Depth/Canny, Shakker Union, InstantX
Każda rodzina potrzebuje swojego ControlNet; rozmiary 0.7-2.5 GB. Pliki Union łączą kilka typów.
AD
Kontrola pozy i głębi w przeglądarce
BitVector Prism ma kontrolę pozy i głębi dla modeli SDXL i Flux: wrzuć referencję, wybierz kontrolę, wpisz prompt. Bez potrzeby instalowania preprocessorów.

Krok po kroku

  1. Wybierz typ kontroli do zadania: pozę dla ludzi, głębię dla scen i zmiany stylu, Canny lub Lineart dla ostrych kształtów, szkic dla pomysłów, tile do powiększania.
  2. Pobierz ControlNet dla rodziny twojego checkpointa do models/controlnet (
    ComfyUI
    ) lub models/ControlNet (A1111,
    Forge
    ). Pliki Union oszczędzają miejsce, jeśli używasz kilku typów.
  3. Wczytaj swoje źródłowe zdjęcie i uruchom odpowiedni preprocessor (ComfyUI: węzły controlnet_aux; A1111: rozszerzenie ControlNet robi to od razu). Podejrzyj obraz kontrolny; popraw, jeśli szkielet nie złapał kończyny.
  4. ComfyUI: Wstaw ControlNet (Advanced) między CLIP Text Encode a KSampler, podłącz obraz kontrolny i model ControlNet, siła 0.8, start 0, koniec 0.8.
  5. A1111 / Forge: włącz jednostkę ControlNet 0, wybierz preprocessor i model tego samego typu, waga 0.8, końcowy krok kontroli 0.8, pixel perfect włączony.
  6. Napisz prompt na to, co chcesz zobaczyć, nie na pozę (poza jest obsługiwana). Wygeneruj cztery ziarna.
  7. Obniż siłę lub końcowy procent, jeśli obraz wygląda na przerysowany lub płaski; podnieś je, jeśli struktura się rozmywa. Dodaj drugą jednostkę (poza + głębia) dla opornych kompozycji.
  8. W chmurze
    PirateDiffusion
    stosuje ControlNet, gdy odpowiadasz na zdjęcie komendą /render z flagą kontroli;
    BitVector
    oferuje pozę i głębię w swoich narzędziach do obrazów.

Przykłady

Transfer pozy w ComfyUI (SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

Zdjęcie na akwarelę z głębią (A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

Porady

  • Głębia jest lepsza niż Canny do przejścia ze zdjęcia do ilustracji, bo zostawia teksturę wolną; Canny jest lepszy niż głębia do logotypów i produktów, bo zachowuje krawędzie dokładnie.
  • Końcowy procent to ustawienie, którego większość ludzi nigdy nie rusza, a które usuwa plastikowy, przerysowany wygląd.
  • Zmień rozmiar obrazu kontrolnego do rozmiaru generacji z tym samym proporcjami; różne kształty przycinają szkielet.
  • OpenPose ze zdjęcia siebie to najszybszy sposób na zrobienie spójnej biblioteki poz dla postaci.
  • Dla Flux LoRA Depth i Canny od Black Forest Labs są lżejsze niż pełne modele kontrolne i wystarczające do większości zadań.
  • Edytory instrukcji (Qwen Image Edit, Kontext) często zastępują przejście ControlNet przy edycjach "ta sama scena, inny temat"; zobacz przewodnik Qwen Image Edit.

Rozwiązywanie problemów

ControlNet nic nie robi

Dlaczego tak się dzieje
Niepasująca rodzina (ControlNet SD 1.5 na SDXL) lub podano surowe zdjęcie zamiast mapy po preprocessingu.

Jak to naprawić
Dopasuj rodzinę; uruchom preprocessor i sprawdź jego wynik.

Efekt wygląda na przerysowany i płaski

Dlaczego tak się dzieje
Siła 1.0 z końcowym procentem 1.0.

Jak to naprawić
Siła 0.7, koniec 0.7; pozwól modelowi dokończyć sam.

Szkielet nie ma rąk lub kończyny

Dlaczego tak się dzieje
Preprocessor źle wykrył na zagraconym zdjęciu.

Jak to naprawić
Użyj DWPose z włączonymi rękami, przytnij źródło lub edytuj szkielet w węźle edytora OpenPose.

Brak pamięci przy dwóch jednostkach

Dlaczego tak się dzieje
Każdy ControlNet zajmuje do 2.5 GB.

Jak to naprawić
Użyj modelu Union dla obu typów lub ControlNetów fp8; zobacz przewodnik
VRAM
.

Flux ControlNet generuje szum

Dlaczego tak się dzieje
Zły węzeł warunkujący lub
CFG
powyżej 1 na modelu z guidance-distillation.

Jak to naprawić
Użyj węzła podanego na stronie modelu i CFG 1 zgodnie z instrukcjami.

AD
PirateDiffusion
ControlNet przez odpowiedź na zdjęcie
Na PirateDiffusion odpowiadasz na dowolne zdjęcie w Telegramie komendą /render z flagą kontroli i odpowiednim ControlNetem, który jest stosowany po stronie serwera. Nieograniczone renderowanie za stałą cenę.

Pytania

Czy ControlNet to LoRA?

Nie. To osobna sieć, która czyta obraz; LoRA zmienia wagi modelu na podstawie tekstu. Wyjątkiem są LoRA Depth i Canny Fluxa: modele kontrolne dostarczone w formie LoRA.

Czy mogę używać ControlNet z wideo?

Tak:
Wan
VACE i Wan Fun ControlNety obsługują sekwencje poz lub głębi; poradniki wideo na tej stronie o tym mówią.

Czy muszę mieć zainstalowane modele preprocessora?

Tak, pobierają się przy pierwszym użyciu (controlnet_aux w ComfyUI, rozszerzenie w A1111). Są małe.

Co jest lepsze, IP-Adapter czy ControlNet?

Do różnych zadań: IP-Adapter kopiuje wygląd lub tożsamość z obrazu, ControlNet kopiuje strukturę. Wiele workflow łączy oba.

Czy to działa w chmurze?

PirateDiffusion i BitVector mają ControlNety dla swoich modeli; podajesz zdjęcie źródłowe i typ kontroli.

Linki i źródła

Modele w tym poradniku

Autor
Captain

Powiązane poradniki

Modele
Checkpoint vs LoRA vs embedding vs ControlNet: co robi który plik
Sześć rodzajów plików modelu, które spotkasz, co każdy zmienia, jak duży jest, gdzie go umieścić i kiedy używać: checkpointy i fine-tune’y, LoRA i ich kuzyni LyCORIS, tekstowe embeddingi, ControlNet i IP-Adaptery, VAE i upscalery.
Autor: Quartermaster
2025-10-08
Promptowanie
podstawy img2img, inpaintingu i outpaintingu: poprawianie rąk, zamiana obiektów i rozszerzanie obrazu
Trzy sposoby generowania na podstawie istniejącego obrazu zamiast od szumu: img2img do zmiany stylu z wartością denoise, inpainting do przemalowywania tylko zaznaczonego obszaru (standardowa metoda na poprawę rąk i twarzy) oraz outpainting do rozszerzania płótna; z ustawieniami denoise, paddingu i wyboru modelu dla SD 1.5, SDXL, Flux Fill i Qwen Image Edit.
Autor: Captain
2025-12-03
Promptowanie
Qwen-Image-Edit poradnik: instrukcje, edycja wielu obrazów i LoRA, które to ulepszają
Jak uzyskać czyste edycje z Qwen-Image-Edit: pisanie instrukcji zamiast opisów, zachowanie tożsamości i układu, wejścia z wieloma obrazami, zamiana tekstu, kontrola pozy i głębi, lightning LoRA do edycji w 4 krokach oraz anything-to-real i suwaki LoRA popularne w rodzinie Qwen2.
Autor: Captain
2026-05-26
ComfyUI
Co to jest ComfyUI? Przewodnik dla początkujących po węzłach, przepływach i pierwszym grafie
ComfyUI wyjaśnione dla osób znających Automatic1111, Fooocus lub aplikacje webowe: dlaczego to jest graf, siedem węzłów w domyślnym przepływie i co każdy robi, jak załadować przepływ z obrazka, gdzie trafiają modele, Menedżer do brakujących węzłów i kiedy lepszy jest prostszy program albo chmura.
Autor: Lookout
2025-12-17
Modele
Skalowanie obrazów AI: modele ESRGAN, hires-fix, dyfuzja kafelkowa i kiedy używać każdego z nich
Trzy rodziny skalowania i do czego służą: szybkie skalery pikselowe (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) do czystego powiększania, hires-fix do dodawania detali podczas generowania oraz dyfuzja kafelkowa (Ultimate SD Upscale, SUPIR, oparta na Flux) do zamiany renderu 1024 na szczegółowy wydruk 4K; z wartościami denoise, rozmiarami kafelków i modelami, które warto pobrać.
Autor: Quartermaster
2026-03-04

Więcej poradników

Modele
FLUX.1 Dev: jak go promptować, najlepsze ustawienia i pomysły kreatywne
Praktyczny przewodnik po FLUX.1 Dev od Black Forest Labs: naturalne promptowanie, ustawienia guidance i kroków, nakładanie LoRA, renderowanie tekstu i pomysły na prompt, które wykorzystują jego mocne strony.
Autor: Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompt, ustawienia i co nadal robi najlepiej
Jak wyciągnąć najwięcej z oficjalnego modelu bazowego SDXL 1.0: natywne rozdzielczości, ustawienia CFG i samplerów, refiner, negatywne prompt i pomysły na style, w których SDXL nadal błyszczy.
Autor: Captain
2026-10-01
Modele
Stable Diffusion 1.5: klasyczny model, używany właściwie
Stable Diffusion 1.5 wciąż warto znać: odpowiednia rozdzielczość, CFG i sampler, jak korzystać z ogromnej biblioteki LoRAs i embeddingów oraz pomysły na kreatywne prompta dopasowane do modelu 512-pikselowego.
Autor: Captain
2026-10-02
Modele
FLUX.2 Dev: jak korzystać z najnowszego modelu Black Forest Labs
FLUX.2 Dev obsługuje dłuższe prompt’y, lepszy tekst, silniejszy realizm i edycję z wieloma odniesieniami. Ten przewodnik pokazuje turbo workflow, ustawienia guidance i rozdzielczości, strukturę prompta oraz pomysły wykorzystujące nowe możliwości.
Autor: Captain
2026-10-03
Modele
Qwen-Image: długie prompt’y, idealny tekst i dwujęzyczne plakaty
Qwen-Image to model, do którego sięgasz, gdy liczą się słowa na obrazku. Naucz się pisać jego długie, opisowe prompt’y, dokładnie odwzorowywać tekst po angielsku i chińsku, ustawiać CFG i kroki oraz odkrywać pomysły na kreatywne projekty z dużą ilością układu.
Autor: Captain
2026-09-29
Modele
SDXL-Lightning: generowanie w czterech krokach na dowolnym checkpointcie SDXL
LoRA SDXL-Lightning od ByteDance zmienia renderowanie SDXL z 30 kroków na 4 kroki. Dowiedz się, ile kroków używać, jaką wartość CFG ustawić, jaki sampler wybrać i jak połączyć to z ulubionymi checkpointami i style LoRA.
Autor: Captain
2026-09-30