Model
Trends
.ai
Model
Trends
.ai
die besten Open-Source-KI-Modelle

Wie generative KI-Bildmodelle funktionieren: Diffusion, Latents und Text-Encoder einfach erklärt

Thema: Modelle
Von Quartermaster
Veröffentlicht am 2025-08-28
Share

Überblick

Jedes aktuelle Bildmodell ist ein Rauschunterdrücker. Während des Trainings werden ihm Millionen Bilder mit zunehmendem zufälligem Rauschen gezeigt, zusammen mit der Bildunterschrift, und es lernt vorherzusagen, welches Rauschen hinzugefügt wurde. Beim Generieren läuft der Prozess rückwärts: man startet mit reinem Rauschen, fragt das Modell, welches Rauschen darin ist, basierend auf deinem Prompt, entfernt ein bisschen davon, wiederholt das zwanzig oder dreißig Mal, und ein Bild, das zur Bildunterschrift passt, entsteht. Das ist der ganze Trick; „Diffusion“ ist der Name für diesen schrittweisen Prozess von Rauschen hinzufügen und entfernen.
Die Arbeit mit Pixeln in voller Größe wäre viel zu langsam, deshalb passiert das Rauschunterdrücken seit Stable Diffusion 1.x in einem komprimierten Raum, dem sogenannten Latent. Ein separates kleines Netzwerk, der VAE, drückt ein 1024x1024 Bild in ein 128x128 Zahlenraster zusammen und erweitert es am Ende wieder. Der Rauschunterdrücker (ein U-Net in
SD 1.5
und
SDXL
, ein Transformer in
Flux
,
Qwen
,
Z-Image
und den Videomodellen) sieht nie Pixel. Deshalb müssen Bildgrößen Vielfache von 8 oder 16 sein und der VAE-Dekodierschritt am Ende kann allein schon den Speicher überlasten.
Der Prompt geht durch einen Text-Encoder, der Wörter in eine Liste von Zahlen umwandelt, auf die der Rauschunterdrücker reagieren kann. SD 1.5 nutzt einen CLIP-Encoder mit 77 Token Limit, SDXL zwei, Flux fügt ein großes T5-Sprachmodell hinzu, und die Modelle von 2025 und 2026 (
Qwen Image
,
FLUX.2
, Z-Image,
Wan 2.2
) verwenden komplette LLMs als Encoder. Diese eine Änderung erklärt den größten Unterschied darin, wie Prompts geschrieben werden: Tag-Listen für CLIP-basierte Modelle, natürliche Sätze für LLM-basierte. Ein
LoRA
ist schließlich eine kleine Korrekturmenge für die Gewichte des Rauschunterdrückers (und manchmal des Encoders), die steuert, was gezeichnet wird; es fügt kein neues Wissen hinzu, sondern gewichtet das, was das Basismodell schon gelernt hat, neu.

Referenz

Name
Typ
Bedeutung
Denoiser (U-Net / DiT)
component
Das Hauptnetzwerk. Sagt das Rauschen in einem Latent voraus, basierend auf Prompt und Schritt. U-Net in SD 1.5 und SDXL; Diffusion Transformer (DiT / MMDiT) in Flux, FLUX.2, Qwen, Z-Image,
Wan
,
LTX
, H3.
VAE
component
Komprimiert Bilder zu Latents und zurück. Ein falscher oder fehlender VAE führt zu ausgewaschenen oder violetten Bildern. Flux und neuere Familien bringen eigene 16-Kanal-VAEs mit.
Text encoder
component
CLIP-L, CLIP-G, T5-XXL oder ein LLM (Qwen2.5-VL, Mistral, Gemma). Entscheidet, wie der Prompt verstanden wird und wie lang er sein kann.
Scheduler /
sampler
setting
Der Plan, wie viel Rauschen bei jedem Schritt entfernt wird und die verwendete numerische Methode. Verändert Textur und Konvergenzgeschwindigkeit, nicht den Inhalt.
Steps
setting
Wie viele Rauschunterdrückungsdurchläufe. Destillierte Modelle (Turbo, Lightning, Schnell, Klein) sind darauf trainiert, 1 bis 8 zu brauchen.
CFG
/ guidance
setting
Classifier-free guidance: wie stark die promptbedingte Vorhersage von der unbedingten wegbewegt wird. Zu hoch verbrennt Farben; guidance-distillierte Modelle (
Flux dev
) nehmen stattdessen einen einzelnen Guidance-Wert.
Latent size
setting
Bildgröße geteilt durch 8 (SD) oder 16 (Flux, Wan). Modelle zeichnen am besten nahe der Auflösung, auf der sie trainiert wurden.
Flow matching
training method
Der Ersatz ab 2024 für klassische Diffusions-Rauschpläne (Flux, SD3, Wan, Z-Image). Gleiche Idee, geradlinigerer Weg von Rauschen zum Bild, weniger Schritte nötig.
AD
Theorie in der Praxis sehen, kein Setup nötig
BitVector Prism lässt dich zwischen SDXL, Flux und Qwen-Modellen in einer Web-App wechseln, so kannst du denselben Prompt durch drei Architekturen laufen lassen und die hier beschriebenen Unterschiede in einer Minute sehen.

Schritt für Schritt

  1. Rauschen rein: Der
    Sampler
    erzeugt ein latentes Raster aus Zufallszahlen vom Seed. Ändere den Seed und alles danach ändert sich.
  2. Prompt rein: Der Text-Encoder wandelt deine Worte in Einbettungen um. Bei CLIP-Modellen werden mehr als 77 Token aufgeteilt oder fallen weg; bei LLM-basierten Modellen ist ein ganzer Absatz okay.
  3. Jeder Schritt: Der Rauschunterdrücker wird bei SD und SDXL zweimal ausgeführt (mit und ohne Prompt); die Differenz, skaliert mit CFG, lenkt das Latent zum Prompt. Flux dev läuft einmal mit eingebautem Guidance-Wert.
  4. Der Sampler zieht das vorhergesagte Rauschen gemäß dem Plan ab (Karras, exponentiell, einfach, Beta). Nach dem letzten Schritt ist das Latent ein sauberes Bild in komprimierter Form.
  5. Dekodieren: Der VAE erweitert das Latent zu Pixeln. Tiled VAE Decode gibt es, weil dieser Schritt allein bei großen Größen den Speicher einer 8-GB-Karte übersteigen kann.
  6. Optionale zweite Durchläufe: hires-fix fügt dem Ergebnis etwas Rauschen hinzu und rauscht bei größerer Größe neu;
    img2img
    startet von einem bestehenden Bild statt reinem Rauschen; Inpainting beschränkt die Änderung auf eine Maske.
  7. Videomodelle fügen dem Latent eine Zeitachse hinzu (ein 5-Sekunden-Clip ist ein 3D-Latent) und laufen ansonsten in der gleichen Schleife, weshalb sie zehnmal so viel Speicher brauchen.

Beispiele

Der gleiche Prompt durch drei Architekturen

SD 1.5 (CLIP, 77 tokens): "portrait of an old sailor, grey beard, wool cap, harbour background, film photo"
SDXL (two CLIPs): same words, 1024x1024, CFG 6, 28 steps
Flux dev (CLIP-L + T5): "A weathered old sailor with a grey beard and a navy wool cap stands at a harbour railing at dusk; shallow depth of field, Kodak Portra look." guidance 3.5, 24 steps

ComfyUI-Knoten zu den Komponenten zugeordnet

Load Checkpoint -> MODEL (denoiser), CLIP (text encoder), VAE
CLIP Text Encode (prompt) -> KSampler (sampler, steps, CFG, seed) -> VAE Decode -> Save Image

Tipps

  • Ein Modell kann nicht zeichnen, was nicht in seinen Trainingsdaten war. Deshalb kennen Anime-Fine-Tunes tausende Charaktere und Fotomodelle nicht, und es gibt für fast jede Lücke einen LoRA.
  • Fine-Tunes (DreamShaper, Juggernaut,
    Illustrious
    , Pony) haben dieselbe Architektur wie ihr Basis-Modell, nur andere Gewichte; ein LoRA für das Basis-Modell funktioniert meist auch beim Fine-Tune, ein LoRA für ein sehr anderes Fine-Tune (Pony) oft nicht.
  • Destillierte Modelle tauschen Flexibilität gegen Geschwindigkeit. SDXL Lightning mit 4 Schritten reicht für Entwürfe; das volle Modell mit 28 Schritten ist besser für Endversionen.
  • Der Text-Encoder ist oft die größte Datei. Flux mit T5-XXL fp16 braucht 9 GB nur für den Encoder, deshalb gibt es fp8- und GGUF-Versionen.
  • Guidance Distillation (Flux dev) und CFG sind nicht dasselbe. Ein CFG von 7 bei Flux dev führt zu verbrannten Bildern; nutze die Einstellungen auf der Modellseite.
  • Alles hier läuft bei den Cloud-Partnern genauso wie lokal; der Unterschied ist nur, wem die GPU gehört.

Fehlerbehebung

Bilder kommen grau, ausgewaschen oder mit violettem Stich raus

Warum es passiert
Fehlender oder falscher VAE, oder ein fp16 VAE Overflow bei SDXL.

So behebst du es
Lade den VAE, der zur Familie gehört; bei SDXL den fp16-fix VAE verwenden.

Langer Prompt wird teilweise ignoriert

Warum es passiert
CLIP-Token-Limit bei SD 1.5 und SDXL.

So behebst du es
Wichtige Wörter zuerst setzen oder zu einem Flux-, Qwen- oder Z-Image-Modell mit LLM-Encoder wechseln.

Farben sind verbrannt und Kontrast extrem

Warum es passiert
CFG zu hoch für das Modell oder CFG bei einem guidance-distillierten Modell verwendet.

So behebst du es
CFG bei SDXL auf 5 bis 7 senken; bei Flux dev Guidance 3 bis 4 und CFG 1 verwenden.

Kachelung oder doppelte Motive bei großen Größen

Warum es passiert
Latent viel größer als die Trainingsauflösung; das Modell wiederholt sich.

So behebst du es
In nativer Größe generieren und hochskalieren oder hires-fix mit 0.4 Denoise verwenden.

Speicherüberlauf nur ganz am Ende

Warum es passiert
VAE-Dekodierschritt in voller Größe.

So behebst du es
Tiled VAE Decode verwenden oder kleinere Ausgabegröße und danach
Upscaler
.

AD
PirateDiffusion
Alle Architekturen auf einem GPU-Cluster
PirateDiffusion hostet SD 1.5, SDXL, Flux, FLUX.2, Qwen, Z-Image und die Videomodelle nebeneinander auf Telegram, mit unbegrenzter Generierung zu einem Festpreis. Kein VRAM-Rechnen, keine VAE-Dateien suchen.

Fragen

Kopiert das Modell Bilder aus seinem Trainingssatz?

Es speichert Gewichte, keine Bilder, und kann kein Trainingsbild abrufen. Nahe Duplikate sehr häufiger Trainingsbilder können auftauchen (berühmte Gemälde, Logos), was ein Grund ist, sie nicht abzufragen.

Warum brauchen neue Modelle mehr Speicher, wenn die Idee gleich ist?

Größere Rauschunterdrücker (12 Milliarden Parameter bei Flux gegenüber 0,9 bei SD 1.5), größere Text-Encoder und größere Latents. Quantisierte fp8- und GGUF-Versionen bringen das wieder runter.

Was ist der Unterschied zwischen einem Checkpoint und einem Modell?

Ein
Checkpoint
ist die gespeicherte Datei eines Modells (Rauschunterdrücker, oft mit Encoder und VAE gebündelt). Die Begriffe werden oft synonym verwendet.

Warum liefert derselbe Seed auf einem anderen PC ein anderes Bild?

Andere GPU, Präzision (fp16 vs bf16) oder Sampler-Implementierung; das Rauschen ist gleich, aber die Rechenwege unterscheiden sich leicht. Gleiche Maschine, gleiche Einstellungen, gleiches Bild.

Hilft eine höhere Schrittzahl immer?

Nein. Die meisten Sampler konvergieren bei 25 bis 30 Schritten; darüber hinaus verschwendet man Zeit. Destillierte Modelle werden mit mehr Schritten schlechter.

Links und Quellen

Modelle in dieser Anleitung

Geschrieben von
Quartermaster

Verwandte Anleitungen

Cloud-Dienste
Erste Schritte mit KI-Bilderzeugung: Dein erstes Bild in zehn Minuten
Eine einfache Einführung für absolute Anfänger: Was ein Modell ist, die drei Möglichkeiten, es zu nutzen (Web-App, Chatbot, eigener PC), wie man den ersten Prompt schreibt, was die Einstellungen bedeuten und wie man ein gutes Ergebnis von einem Glückstreffer unterscheidet.
Von Captain
2025-08-14
Prompting
Schritte, CFG, Sampler, Scheduler und Seeds: Die Generationseinstellungen mit sicheren Standardwerten erklärt
Was jede Einstellung im Generierungsfenster verändert, welche Werte für die jeweiligen Modellfamilien (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan) funktionieren, welche Sampler wichtig sind, warum distillierte Modelle andere Regeln haben und wie du Seeds nutzt, um immer nur eine Sache zu ändern.
Von Quartermaster
2025-11-19
Modelle
Checkpoint vs LoRA vs Embedding vs ControlNet: Welche Datei macht was
Die sechs Arten von Modelldateien, die du kennenlernst, was jede verändert, wie groß sie sind, wo sie hinkommen und wann du sie benutzt: Checkpoints und Fine-Tunes, LoRAs und ihre LyCORIS-Verwandten, Textuelle Inversion Embeddings, ControlNets und IP-Adapter, VAEs und Upscaler.
Von Quartermaster
2025-10-08
Modelle
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: Welche Modellfamilie 2026 verwenden?
Ein praktischer Vergleich der offenen Bildmodellfamilien: Prompt-Verständnis, Realismus, Anime und Illustration, Texterstellung, Geschwindigkeit, VRAM, LoRA-Ökosystem und Lizenz, mit Empfehlungen für jede Art von Arbeit und Hardware.
Von Captain
2026-05-22

Weitere Anleitungen

Cloud-Dienste
Pauschalpreis vs. Tokens: Warum unbegrenzte Pläne wie Graydient.ai 2026 den besten Wert für KI-Schöpfer bieten
Ein kostenbasierter Vergleich, Stand 8. Oktober 2026, von Pauschalpreisen für unbegrenzte Pläne wie Graydient.ai gegenüber Token- und Kreditpreisen von Midjourney, Leonardo, fal.ai, Replicate, Runway und Kling: Was 1.000 Bilder und 1.000 Videos pro Monat wirklich kosten und warum eine feste Gebühr für unbegrenzte Bilder, Videos, Audio, Grok LLM-Chat und Web-Apps für Schöpfer, die viel ausprobieren, am besten ist.
Von Captain
2026-10-08
Modelle
FLUX.1 Dev: wie man es anweist, beste Einstellungen und kreative Ideen
Ein praktischer Leitfaden zu FLUX.1 Dev von Black Forest Labs: natürlichsprachige Eingaben, Guidance- und Schritt-Einstellungen, LoRA-Stapelung, Textrendering und Ideen für Eingaben, die seine Stärken nutzen.
Von Captain
2026-09-30
Modelle
Stable Diffusion XL 1.0: Prompts, Einstellungen und was es immer noch am besten kann
Wie du das offizielle SDXL 1.0 Basismodell optimal nutzt: native Auflösungen, CFG- und Sampler-Einstellungen, der Refiner, negative Prompts und Ideen für Stile, in denen SDXL immer noch glänzt.
Von Captain
2026-10-01
Modelle
Stable Diffusion 1.5: das klassische Modell, richtig genutzt
Stable Diffusion 1.5 ist immer noch wichtig: die richtige Auflösung, CFG und Sampler, wie du die riesige Bibliothek von LoRAs und Embeddings nutzt und kreative Prompt-Ideen, die zu einem 512-Pixel-Modell passen.
Von Captain
2026-10-02
Modelle
FLUX.2 Dev: das neueste Black Forest Labs Modell prompten
FLUX.2 Dev bringt längere Prompts, besseren Text, stärkeren Realismus und Multi-Referenz-Bearbeitung. Diese Anleitung erklärt den Turbo-Workflow, Guidance- und Auflösungseinstellungen, die Prompt-Struktur und Ideen, die seine neuen Stärken nutzen.
Von Captain
2026-10-03
Modelle
Qwen-Image: lange Prompts, perfekter Text und zweisprachige Poster
Qwen-Image ist das Modell, das du nutzen solltest, wenn die Wörter im Bild wichtig sind. Lerne, wie du lange, beschreibende Prompts schreibst, englischen und chinesischen Text genau darstellst, CFG und Schritte einstellst und layoutlastige kreative Ideen umsetzt.
Von Captain
2026-09-29