Model
Trends
.ai
Model
Trends
.ai
die besten Open-Source-KI-Modelle

ControlNet erklärt: Pose, Tiefe, Kanten und Referenzbilder für SD 1.5, SDXL und Flux

Thema: Prompting
Von Captain
Veröffentlicht am 2026-02-18
Share

Überblick

Ein Prompt sagt, was gezeichnet werden soll; ControlNet sagt, wo. Es ist ein Neben-Netzwerk, das pro Familie trainiert wird, das ein Kontrollbild liest (eine Strichmännchen-Pose, eine Tiefenkarte, eine Kantenskizze, eine Kritzelei, eine Segmentierungskarte) und den Denoiser steuert, damit das Ergebnis dieser Struktur entspricht. Der Prompt entscheidet weiterhin über Motiv, Stil und Licht; das Kontrollbild legt die Komposition fest. So bekommen Leute dieselbe Pose bei zehn Charakteren, machen aus einem 3D-Render ein Foto oder behalten die genaue Form eines Produkts.
Es passieren immer zwei Schritte. Zuerst wandelt ein Vorverarbeiter dein Ausgangsfoto in das Kontrollbild um (OpenPose zeichnet das Skelett, MiDaS oder Depth Anything schätzen die Tiefe, Canny findet Kanten, Lineart zeichnet Umrisse). Dann nutzt das ControlNet-Modell deiner Familie dieses Bild während der Generierung. Das rohe Foto statt der vorverarbeiteten Karte zu verwenden ist der häufigste Anfängerfehler; der zweite ist, ein
SD 1.5
ControlNet mit einem SDXL-Checkpoint zu verwenden.
Flux
und die Modelle von 2025 haben die Lage verändert: Black Forest Labs liefert Flux Depth und Flux Canny als komplette Modelle und
LoRAs
, Union ControlNets fassen mehrere Typen in einer Datei für
SDXL
und Flux zusammen, und Instruktions-Editoren (
Qwen Image
Edit, Kontext) erledigen viele "das hier behalten, das da ändern"-Aufgaben ohne Kontrollbild. Der Katalog auf dieser Seite kennzeichnet ControlNets unter "andere" mit ihrer Familie; die Modellseite nennt den Kontrolltyp.

Referenz

Name
Typ
Bedeutung
OpenPose
control type
Körper-, Hand- und Gesichtspunkte als Strichmännchen. Pose-Übertragung, Choreografie, konsistente Charaktere. Schwach bei Händen, außer das Handmodell ist aktiv.
Depth (MiDaS, Zoe, Depth Anything)
control type
Graustufige Tiefenkarte. Behält räumliche Anordnung und Kamera bei, erlaubt aber komplettes Umstyling. Die nachsichtigste Kontrolle für Foto zu Illustration.
Canny / Lineart / SoftEdge (HED)
control type
Kantenskizzen. Canny ist streng und scharf, Lineart für Zeichnungen, SoftEdge locker. Produktformen, Architektur, Logos.
Scribble
control type
Grobe Striche, die du selbst zeichnest, werden zur Komposition. Niedrige Stärke (0.5-0.7), sonst sieht das Ergebnis wie die Kritzelei aus.
Tile
control type
Leitet einen Upscale- oder Detaildurchlauf an, um dem niedrigauflösenden Input treu zu bleiben. Die Technik hinter den meisten "ultimativen Upscale"-Workflows.
IP-Adapter / Redux / reference
image conditioning
Kein ControlNet: konditioniert auf Stil oder Gesicht eines Bildes statt auf Struktur. Kombiniere mit ControlNet, um beides zu bekommen.
Strength / weight
0.4-1.0
Wie stark die Struktur durchgesetzt wird. 0.8 für Pose und Tiefe, 0.5-0.7 für Kanten und Kritzeleien.
Start / end percent
0.0-1.0
Auf welchen Teil des Denoisings sich die Kontrolle bezieht. Ein Ende bei 0.6-0.8 lässt das Modell Details frei fertigstellen und entfernt den "nachgezeichneten" Look.
Family files
SD 1.5
: lllyasviel control_v11 |
SDXL
: diffusers / xinsir Union |
Flux
:
Flux
Depth/Canny, Shakker Union, InstantX
Jede Familie braucht ihr eigenes ControlNet; Größen 0.7-2.5 GB. Union-Dateien bündeln mehrere Typen.
AD
Pose- und Tiefenkontrolle im Browser
BitVector Prism bietet Pose- und Tiefenkontrolle für seine SDXL- und Flux-Modelle: Referenz hochladen, Kontrolle wählen, Prompt tippen. Keine Vorverarbeiter nötig.

Schritt für Schritt

  1. Such dir den Kontrolltyp passend zur Aufgabe aus: Pose für Menschen, Tiefe für Szenen und Umstyling, Canny oder Lineart für harte Formen, Kritzelei für Ideen, Tile fürs
    Upscaling
    .
  2. Lade das ControlNet für die Familie deines Checkpoints in models/controlnet (
    ComfyUI
    ) oder models/ControlNet (A1111,
    Forge
    ). Union-Dateien sparen Speicher, wenn du mehrere Typen nutzt.
  3. Lade dein Ausgangsbild und starte den passenden Vorverarbeiter (ComfyUI: die controlnet_aux-Knoten; A1111: die ControlNet-Erweiterung macht das inline). Schau dir das Kontrollbild an; korrigiere es, falls das Skelett ein Gliedmaß verpasst hat.
  4. ComfyUI: Setze ControlNet (Advanced) zwischen CLIP Text Encode und KSampler ein, verbinde das Kontrollbild und das ControlNet-Modell, Stärke 0.8, Start 0, Ende 0.8.
  5. A1111 / Forge: aktiviere ControlNet Einheit 0, wähle Vorverarbeiter und Modell vom gleichen Typ, Gewicht 0.8, Endkontrollschritt 0.8, Pixel Perfect an.
  6. Schreib den Prompt für das, was du sehen willst, nicht für die Pose (die Pose wird gesteuert). Erzeuge vier Seeds.
  7. Senke Stärke oder End-Prozent, wenn das Bild nachgezeichnet oder flach aussieht; erhöhe sie, wenn die Struktur abdriftet. Staple eine zweite Einheit (Pose + Tiefe) für hartnäckige Kompositionen.
  8. In der Cloud wendet
    PirateDiffusion
    ControlNet an, wenn du auf ein Quellbild mit /render und einem Kontroll-Flag antwortest;
    BitVector
    bietet Pose und Tiefe in seinen Bildwerkzeugen an.

Beispiele

Pose-Übertragung in ComfyUI (SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

Foto zu Aquarell mit Tiefe (A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

Tipps

  • Tiefe schlägt Canny bei Foto-zu-Illustration, weil sie Textur freilässt; Canny schlägt Tiefe bei Logos und Produkten, weil es Kanten exakt hält.
  • End-Prozent ist die Einstellung, die die meisten nie anfassen und die den plastischen, nachgezeichneten Look behebt.
  • Skaliere das Kontrollbild auf die Generierungsgröße mit demselben Seitenverhältnis; unpassende Formen schneiden das Skelett ab.
  • OpenPose von einem Foto von dir selbst ist der schnellste Weg, eine konsistente Posen-Bibliothek für einen Charakter zu bekommen.
  • Für Flux sind die Depth- und Canny-LoRAs von Black Forest Labs leichter als die kompletten Kontrollmodelle und für die meisten Aufgaben gut genug.
  • Instruktions-Editoren (Qwen Image Edit, Kontext) ersetzen oft einen ControlNet-Durchlauf für "gleiche Szene, anderes Motiv"-Bearbeitungen; siehe den Qwen Image Edit Guide.

Fehlerbehebung

ControlNet macht nichts

Warum es passiert
Familien-Mismatch (SD 1.5 ControlNet auf SDXL) oder das rohe Foto wurde statt der vorverarbeiteten Karte verwendet.

So behebst du es
Familie anpassen; den Vorverarbeiter laufen lassen und die Ausgabe prüfen.

Ergebnis sieht nachgezeichnet und flach aus

Warum es passiert
Stärke 1.0 mit End-Prozent 1.0.

So behebst du es
Stärke 0.7, Ende 0.7; das Modell selbst Details fertigstellen lassen.

Skelett fehlt Hände oder ein Gliedmaß

Warum es passiert
Vorverarbeiter hat bei einem unübersichtlichen Foto schlecht erkannt.

So behebst du es
DWPose mit aktivierten Händen nutzen, das Ausgangsbild zuschneiden oder das Skelett in einem OpenPose-Editor-Knoten bearbeiten.

Speicher voll bei zwei Einheiten

Warum es passiert
Jedes ControlNet ist bis zu 2,5 GB groß.

So behebst du es
Union-Modell für beide Typen verwenden oder fp8-ControlNets nutzen; siehe VRAM-Guide.

Flux ControlNet erzeugt Rauschen

Warum es passiert
Falscher Konditionierungsknoten oder
CFG
über 1 bei einem guidance-distilled Modell.

So behebst du es
Den Knoten verwenden, den die Modellseite angibt, und CFG 1 mit Guidance laut Seite einstellen.

AD
PirateDiffusion
ControlNet per Antwort auf ein Foto
Bei PirateDiffusion antwortest du auf ein Bild in Telegram mit /render und einem Kontroll-Flag, und das passende ControlNet wird serverseitig angewendet. Unbegrenzte Render zu Festpreis.

Fragen

Ist ControlNet ein LoRA?

Nein. Es ist ein separates Netzwerk, das ein Bild liest; ein LoRA ändert die Modellgewichte über Text. Flux’ Depth und Canny "LoRAs" sind eine Ausnahme: Kontrollmodelle, die als LoRA ausgeliefert werden.

Kann ich ControlNet mit Video nutzen?

Ja:
Wan
VACE und die Wan Fun ControlNets nehmen Pose- oder Tiefen-Sequenzen; die Video-Guides auf dieser Seite behandeln sie.

Brauche ich die Vorverarbeitermodelle installiert?

Ja, sie laden beim ersten Gebrauch herunter (controlnet_aux in ComfyUI, die Extension in A1111). Sie sind klein.

Was ist besser, IP-Adapter oder ControlNet?

Unterschiedliche Aufgaben: IP-Adapter kopiert Look oder Identität von einem Bild, ControlNet kopiert Struktur. Viele Workflows nutzen beide.

Funktioniert das in der Cloud?

PirateDiffusion und BitVector haben die ControlNets für ihre Modelle installiert; du gibst das Quellbild und den Kontrolltyp an.

Links und Quellen

Modelle in dieser Anleitung

Geschrieben von
Captain

Verwandte Anleitungen

Modelle
Checkpoint vs LoRA vs Embedding vs ControlNet: Welche Datei macht was
Die sechs Arten von Modelldateien, die du kennenlernst, was jede verändert, wie groß sie sind, wo sie hinkommen und wann du sie benutzt: Checkpoints und Fine-Tunes, LoRAs und ihre LyCORIS-Verwandten, Textuelle Inversion Embeddings, ControlNets und IP-Adapter, VAEs und Upscaler.
Von Quartermaster
2025-10-08
Prompting
img2img, Inpainting und Outpainting Grundlagen: Hände reparieren, Objekte tauschen und Bild erweitern
Die drei Methoden, um aus einem bestehenden Bild statt aus Rauschen zu generieren: img2img für Umgestaltung mit einem Denoise-Wert, Inpainting zum Übermalen nur eines maskierten Bereichs (die Standardlösung für Hände und Gesichter) und Outpainting zum Erweitern der Leinwand; mit den Einstellungen für Denoise, Padding und Modellauswahl für SD 1.5, SDXL, Flux Fill und Qwen Image Edit.
Von Captain
2025-12-03
Prompting
Qwen-Image-Edit Anleitung: Instruktions-Prompts, Mehrbildbearbeitung und die LoRAs, die es verbessern
Wie du saubere Bearbeitungen mit Qwen-Image-Edit bekommst: Anweisungen schreiben statt Beschreibungen, Identität und Layout bewahren, Mehrbild-Eingaben, Textaustausch, Pose- und Tiefensteuerung, die Lightning-LoRAs für 4-Schritt-Bearbeitungen und die anything-to-real und Slider-LoRAs, die in der Qwen2-Familie im Trend liegen.
Von Captain
2026-05-26
ComfyUI
Was ist ComfyUI? Ein Anfängerleitfaden zu Nodes, Workflows und dem ersten Graphen
ComfyUI erklärt für Leute, die von Automatic1111, Fooocus oder einer Web-App kommen: warum es ein Graph ist, die sieben Nodes im Standard-Workflow und was jede macht, wie man einen Workflow aus einem Bild lädt, wo Modelle hinkommen, der Manager für fehlende Nodes und wann ein einfacheres Tool oder die Cloud besser sind.
Von Lookout
2025-12-17
Modelle
KI-Bildvergrößerung: ESRGAN-Modelle, hires-fix, gekachelte Diffusion und wann man was benutzt
Die drei Arten der Vergrößerung und wofür sie gut sind: schnelle Pixel-Upscaler (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) für saubere Vergrößerung, hires-fix für mehr Details während der Generierung und gekachelte Diffusion (Ultimate SD Upscale, SUPIR, Flux-basiert) um ein 1024-Bild in einen detaillierten 4K-Druck zu verwandeln; inklusive Denoise-Werten, Kachelgrößen und den Modellen, die sich zum Download lohnen.
Von Quartermaster
2026-03-04

Weitere Anleitungen

Cloud-Dienste
Pauschalpreis vs. Tokens: Warum unbegrenzte Pläne wie Graydient.ai 2026 den besten Wert für KI-Schöpfer bieten
Ein kostenbasierter Vergleich, Stand 8. Oktober 2026, von Pauschalpreisen für unbegrenzte Pläne wie Graydient.ai gegenüber Token- und Kreditpreisen von Midjourney, Leonardo, fal.ai, Replicate, Runway und Kling: Was 1.000 Bilder und 1.000 Videos pro Monat wirklich kosten und warum eine feste Gebühr für unbegrenzte Bilder, Videos, Audio, Grok LLM-Chat und Web-Apps für Schöpfer, die viel ausprobieren, am besten ist.
Von Captain
2026-10-08
Modelle
FLUX.1 Dev: wie man es anweist, beste Einstellungen und kreative Ideen
Ein praktischer Leitfaden zu FLUX.1 Dev von Black Forest Labs: natürlichsprachige Eingaben, Guidance- und Schritt-Einstellungen, LoRA-Stapelung, Textrendering und Ideen für Eingaben, die seine Stärken nutzen.
Von Captain
2026-09-30
Modelle
Stable Diffusion XL 1.0: Prompts, Einstellungen und was es immer noch am besten kann
Wie du das offizielle SDXL 1.0 Basismodell optimal nutzt: native Auflösungen, CFG- und Sampler-Einstellungen, der Refiner, negative Prompts und Ideen für Stile, in denen SDXL immer noch glänzt.
Von Captain
2026-10-01
Modelle
Stable Diffusion 1.5: das klassische Modell, richtig genutzt
Stable Diffusion 1.5 ist immer noch wichtig: die richtige Auflösung, CFG und Sampler, wie du die riesige Bibliothek von LoRAs und Embeddings nutzt und kreative Prompt-Ideen, die zu einem 512-Pixel-Modell passen.
Von Captain
2026-10-02
Modelle
FLUX.2 Dev: das neueste Black Forest Labs Modell prompten
FLUX.2 Dev bringt längere Prompts, besseren Text, stärkeren Realismus und Multi-Referenz-Bearbeitung. Diese Anleitung erklärt den Turbo-Workflow, Guidance- und Auflösungseinstellungen, die Prompt-Struktur und Ideen, die seine neuen Stärken nutzen.
Von Captain
2026-10-03
Modelle
Qwen-Image: lange Prompts, perfekter Text und zweisprachige Poster
Qwen-Image ist das Modell, das du nutzen solltest, wenn die Wörter im Bild wichtig sind. Lerne, wie du lange, beschreibende Prompts schreibst, englischen und chinesischen Text genau darstellst, CFG und Schritte einstellst und layoutlastige kreative Ideen umsetzt.
Von Captain
2026-09-29