VRAM-Anforderungen für alle beliebten KI-Bild- und Videomodelle (2026): Volle Präzision, FP8 und GGUF
Thema: Fehler & Lösungen
Von P.I. Panda
Veröffentlicht am 2026-10-06
Wie viel VRAM du für SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein und Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 und LTX-2 brauchst – in voller Präzision, FP8 und 4-Bit GGUF, mit der passenden Karte und Lizenz für jedes Modell, was jede GPU-Größe von 8 bis 48 GB schafft und in welcher Reihenfolge du Anpassungen machst, wenn ein Modell nicht passt.
Überblick
Kurz gesagt: 8 GB
VRAM
laufen
SDXL
und die kleinen schnellen Modelle wie
Z-Image Turbo
und
FLUX.2 Klein 4B
. 12 GB schaffen
FLUX.1
und
Qwen-Image
, sobald sie quantisiert sind. 24 GB laufen fast alle Bildmodelle plus
Wan 2.2
Video in FP8. Die neuesten großen Modelle,
FLUX.2 Dev
und
LTX-2
in voller Qualität, brauchen 32 GB oder mehr.
Die Tabelle unten listet alle beliebten offenen Modelle mit dem Speicherbedarf in voller Präzision, FP8 und als 4-Bit GGUF-Datei, bei etwa 1024x1024 Pixeln. Verschiedene Tester rechnen den Text-Encoder unterschiedlich, also sieh jede Zahl eher als Bereich, nicht als harte Grenze. Drei Dinge, die die Tabelle nicht zeigt: SDXL ist immer noch das günstigste Modell, das gut läuft (die Basis passt in 8 GB, aber
LoRAs
,
ControlNet
und
Upscaling
brauchen mehr, deshalb sind 12 GB komfortabel); FLUX.2 Klein 4B passt aktuell am besten auf kleine Karten (etwa 13 GB in voller Präzision, ungefähr halb so viel in FP8, Apache 2.0); und FLUX.2 Dev ist kein Modell für zu Hause in voller Präzision (ein ComfyUI-Nutzer hat FP8 auf einer 12 GB RTX 3060 laufen lassen, brauchte aber etwa 70 GB System-RAM dafür).
Präzision ändert alles. BF16/FP16 ist volle Qualität und volle Größe, etwa 2 GB VRAM pro Milliarde Parameter. FP8 halbiert das, etwa 1 GB pro Milliarde, und die meisten merken keinen Unterschied zur vollen Präzision. GGUF-Dateien (Q8, Q5, Q4 und niedriger) schrumpfen Modelle noch mehr: Q8 ist fast volle Qualität, Q4 tauscht Details gegen eine viel kleinere Größe, darunter fällt die Qualität schnell ab. Das Modell ist nicht das Einzige im Speicher: Text-Encoder (T5 für FLUX.1, ein Sprachmodell für Qwen-Image und
FLUX.2
), VAE, LoRAs, ControlNet und das Bild selbst brauchen auch Platz.
ComfyUI
verschiebt einige davon automatisch in den System-RAM, deshalb berichten zwei Leute mit derselben Karte von unterschiedlichen Zahlen. Zahlen geprüft am 6. Oktober 2026 anhand von Modellkarten und Community-Tests; monatlich aktualisiert.
Referenz
Model
Full precision
FP8
4-bit / GGUF
Comfortable card
Stable Diffusion 1.5
0.9B
CreativeML OpenRAIL-M. Läuft auf fast allem.
Full precision
4 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
6-8 GB
SDXL und Fine-Tunes: Pony, Illustrious, NoobAI
3.5B
OpenRAIL++ (Fine-Tunes variieren). 12 GB lassen Platz für LoRAs, ControlNet und Upscaling im gleichen Workflow.
Full precision
6-8 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
12 GB
SD 3.5 Large
8.1B
Stability Community License.
Full precision
16-24 GB
FP8
niedriger
als volle Präzision
4-bit / GGUF
niedriger
als FP8
Comfortable card
24 GB
Z-Image Turbo
6B
Apache 2.0. 8 Schritte; das schnelle Modell für kleine Karten.
Full precision
~16 GB
FP8
~8 GB
4-bit / GGUF
~6 GB
Comfortable card
8-12 GB
FLUX.2 Klein 4B
4B
Apache 2.0, kommerzielle Nutzung erlaubt. Beste Passform für 8-GB-Karten 2026.
Full precision
~13 GB
FP8
~8 GB
4-bit / GGUF
~4-5 GB
Comfortable card
8-12 GB
FLUX.2 Klein 9B
9B
FLUX Nicht-kommerzielle Lizenz (Ausgaben kommerziell nutzbar).
Full precision
~29 GB
FP8
~17 GB
4-bit / GGUF
~8-9 GB
Comfortable card
16-24 GB
FLUX.1 Schnell
12B
Apache 2.0. 4 Schritte.
Full precision
~24 GB
FP8
~12 GB
4-bit / GGUF
~6-8 GB
Comfortable card
12-16 GB
FLUX.1 Dev
12B
Nicht-kommerzielle Lizenz. Der FP8 T5-Encoder spart etwa 4 GB allein.
Full precision
~24 GB
mehr mit geladenem Text-Encoder
FP8
~12-18 GB
4-bit / GGUF
~7 GB
Comfortable card
16-24 GB
Qwen-Image
20B
Apache 2.0. Starke Textdarstellung; braucht seinen Qwen2.5-VL-Encoder in FP8 auf allem unter 32 GB.
Full precision
~41 GB
FP8
~20 GB
4-bit / GGUF
~12-13 GB
Comfortable card
24 GB
FLUX.2 Dev
32B
Nicht-kommerzielle Lizenz. Ohne 32-GB-Karte langsame Generierung erwarten.
Full precision
~90 GB
mit Text-Encoder
FP8
32 GB
passt auf eine 32-GB-Karte
4-bit / GGUF
12-16 GB
starke Auslagerung
Comfortable card
32 GB+
HunyuanImage 3.0
80B MoE
Tencent Community License. Nur Rechenzentrum; nutze es über einen gehosteten Dienst.
Full precision
multi-GPU
bei jeder Präzision
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
Rechenzentrum
Wan 2.1 T2V 1.3B
1.3B
Video 480p
Apache 2.0.
Full precision
8.19 GB
offiziell
FP8
8 GB
in der Praxis
4-bit / GGUF
n/a
Comfortable card
12 GB
Wan 2.2 TI2V 5B
5B
Video 720p
Apache 2.0.
Full precision
Consumer-GPU
offiziell, getestet auf einer RTX 4090
FP8
n/a
4-bit / GGUF
8 GB
GGUF Q8
Comfortable card
24 GB
Wan 2.2 A14B T2V/I2V
2 x 14B
Video 720p
Apache 2.0. Zwei 14B-Experten, einer zur Zeit im VRAM, deshalb schaffen 24-GB-Karten das. Wan 2.5-3.0 sind nur API.
Full precision
80 GB
offiziell, Single-GPU
FP8
~14 GB
pro Experte
4-bit / GGUF
12-16 GB
GGUF
Comfortable card
24-32 GB
HunyuanVideo 1.5
8.3B
Video 720p, 1080p mit Upscaler
Tencent Community License.
Full precision
14 GB
offiziell, mit Auslagerung
FP8
14 GB
in der Praxis
4-bit / GGUF
n/a
Comfortable card
24 GB+
80 GB für beste Qualität
LTX-2 / LTX-2.3
19B / 22B
Video bis 4K
LTX-2 Community License. Synchroner Ton.
Full precision
32 GB+
offiziell
FP8
n/a
4-bit / GGUF
24 GB
FP4
Comfortable card
32 GB
AD

Jede Tabellenzeile, kein VRAM nötig
BitVector Prism läuft SDXL, Z-Image, FLUX.1, FLUX.2 und Qwen-Image in voller Präzision auf eigenen GPUs. Wähle ein Modell von dieser Seite, gib einen Prompt ein, generiere im Browser. Nichts zum Download.
Schritt für Schritt
- Finde deinen VRAM (Task-Manager > Leistung > GPU oder nvidia-smi) und ordne ihn einer der unten stehenden Stufen zu; dann wähle Modelle, deren "komfortable Karte"-Spalte gleich oder kleiner ist.
- 12 GB (RTX 3060 12GB, 4070, 5070): alles oben, schneller, mit Platz für ControlNet und Upscaling;FLUX.1 Devund Schnell in FP8 oder GGUF; Qwen-Image in GGUF Q4;FLUX.2 Klein 9Bin GGUF; Wan 2.2 A14B in GGUF Q4 mit Auslagerung bei niedriger Auflösung und kurzen Clips.
- 16 GB (RTX 4060 Ti 16GB, 4070 Ti Super, 5070 Ti, 5080): FLUX.1 Dev in FP8 mit Reserven; Z-Image Turbo und Klein 4B in voller Präzision; Qwen-Image in GGUF Q4-Q5;HunyuanVideo1.5 mit Auslagerung; Wan 2.2 A14B in GGUF Q5 bei 720p (Community-Berichte).
- 24 GB (RTX 3090, 4090): fast alle Bildmodelle außer FLUX.2 Dev in voller Präzision; Qwen-Image in FP8 oder Q8; Wan 2.2 A14B in FP8 und Wan 2.2 5B in voller Präzision; LTX-2 in FP4; die meisten LoRA-Trainings für SDXL und Flux.
- 32 GB (RTX 5090): FLUX.2 Dev in FP8; LTX-2 undLTX-2.3in FP8; Wan 2.2 A14B bei 720p ohne Speicherprobleme während eines Clips.
- 48 GB und mehr (RTX 6000 Ada, A100, H100): Qwen-Image, LTX-2 und FLUX.2 Dev in voller Präzision mit Reserven; lange oder hochauflösende Videos, Batch-Generierung und ernsthaftes Training.
- Lade die Präzision für deine Stufe von der Modellseite auf dieser Seite (dort steht jede Variante mit Dateigröße), lade Text-Encoder in FP8 und halte 32 GB System-RAM (64 GB für die größten Modelle) für Auslagerung bereit.
Beispiele
FLUX.1 Dev auf einer 12-GB-Karte (ComfyUI)
Load Diffusion Model: flux1-dev-fp8-e4m3fn (11.9 GB) or UnetLoaderGGUF flux1-dev-Q6_K (9.8 GB) | DualCLIPLoader: clip_l + t5xxl_fp8_e4m3fn_scaled | Load VAE: ae
1024x1024, 20 steps, euler, simple, guidance 3.5 | VAE Decode (Tiled) if the last step fails
Qwen-Image auf 16 GB
UnetLoaderGGUF: qwen_image_Q4_K_M.gguf (~12.5 GB) | CLIPLoader: qwen_2.5_vl_7b_fp8_scaled, device cpu | Load VAE: qwen_image_vae
1328x1328 native; start at 1024x1024, 20 steps, cfg 2.5
Die gleichen Modelle ganz ohne Karte
/render <flux-dev> a studio photo of a vintage camera on a walnut desk, soft window light /size:1024x1024 (PirateDiffusion, Telegram)
Tipps
- Wenn duCUDA out of memorysiehst, mach das in der Reihenfolge: wechsel zu einer FP8- oder GGUF-Version desselben Modells (die größte Einsparung); reduziere Auflösung oder Clip-Länge (Speicher wächst mit Pixelzahl, von 1536 auf 1024 px spart viel); nutze geteiltes VAE-Decoding; lade den Text-Encoder in FP8 oder halte ihn auf der CPU; schließe andere GPU-Programme (Browser und Spiele brauchen auch VRAM).
- Auslagerung funktioniert, kostet aber Geschwindigkeit und System-RAM: Ein Modell kann auf einer "zu kleinen" Karte laufen, aber viel langsamer, und du brauchst 32-64 GB oder mehr System-RAM.
- Lizenzen in Kürze: Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image undWan2.1/2.2 sind Apache 2.0 (kommerziell nutzbar); FLUX.1 Dev, FLUX.2 Dev und Klein 9B haben Black Forest Labs' nicht-kommerzielle Lizenz, die kommerzielle Nutzung des Modells verbietet, aber die generierten Bilder dürfen kommerziell genutzt werden. Lizenzen ändern sich; die Modellseite verlinkt die aktuelle.
- Eine 32-GB-Karte zu kaufen, um FLUX.2 Dev oder LTX-2 für ein Wochenendprojekt zu nutzen, lohnt sich selten; wenn dein Modell in den 24 GB+ Reihen steht, ist stundenweises Mieten oder ein Flatrate-Cloud-Plan meist günstiger und schneller als Auslagerung auf einer kleinen Karte.
- Regel pro Milliarde Parameter: 2 GB bei BF16, 1 GB bei FP8, etwa 0,6 GB bei Q4, plus 2-5 GB für Encoder, VAE und Latent.
- Für Video zählen Auflösung und Clip-Länge genauso wie das Modell; der Begleit-Guide zu VRAM für KI-Video erklärt das genauer.
Fehlerbehebung
CUDA out of memory auf einer Karte, die laut Tabelle passt
Warum es passiert
Text-Encoder in voller Präzision, ein LoRA-Stack, ControlNet oder eine hohe Auflösung zusätzlich zum Modell.
So behebst du es
FP8-Encoder, ein LoRA, native Auflösung, geteiltes VAE; die CUDA out of memory-Anleitung hat die ausführliche Version.
Generierung ist quälend langsam, obwohl nichts abstürzt
Warum es passiert
Automatische Auslagerung in den System-RAM.
So behebst du es
Wechsle zur nächsten Präzision (FP8 zu Q6, Q6 zu Q4), bis Shared GPU Memory nahe null bleibt.
FLUX.2 Dev "funktioniert" auf 12 GB, braucht aber 70 GB RAM
Warum es passiert
FP8-Gewichte werden aus dem System-RAM ausgelagert.
So behebst du es
Nutze Klein 4B/9B lokal und FLUX.2 Dev in der Cloud oder auf einer 32-GB-Karte.
Kann FP8 nicht von voller Präzision unterscheiden, warum sieht Q4 weich aus?
Warum es passiert
Q4 verliert mehr Details als FP8; unter Q4 fällt die Qualität schnell ab.
So behebst du es
Nutze Q6 oder Q8, wenn sie passen; Q4 für Entwürfe.
Lizenz-Verwirrung bei FLUX
Warum es passiert
Schnell und Klein 4B sind Apache 2.0; Dev, FLUX.2 Dev und Klein 9B sind nicht-kommerziell.
So behebst du es
Check die Lizenz-Spalte und die Modellkarte, bevor du ein Modell in einem Produkt nutzt.
AD

Die 24 GB+ Reihen, vom Handy aus
PirateDiffusion hostet FLUX.2 Dev, Qwen-Image, Wan 2.2 14B und LTX-2 auf Server-Hardware und steuert sie per Telegram-Befehle. Unbegrenzte Generierung zu einem festen Monatspreis; keine Karte, keine Auslagerung, kein 70 GB RAM.
Fragen
Kann ich Flux mit 8 GB VRAM laufen lassen?
Ja, mit einer quantisierten Datei. FLUX.1 in GGUF Q4 braucht etwa 7 GB, und FLUX.2 Klein 4B in FP8 etwa 8 GB. Erwarte langsamere Generierungen als auf einer 12- oder 16-GB-Karte. FLUX.1 in voller Präzision braucht etwa 24 GB.
Reichen 12 GB für SDXL?
Ja. SDXL selbst passt in 8 GB; 12 GB geben dir Platz für LoRAs, ControlNet und Upscaling im gleichen Workflow.
Wie viel VRAM braucht Wan 2.2?
Kommt auf die Version an. Das 5B-Modell läuft auf 8 GB als GGUF-Datei und bequem auf 24 GB. Das A14B-Modell braucht offiziell 80 GB ohne Auslagerung, aber die FP8-Version läuft gut auf 24 GB und GGUF-Versionen laufen auf 12-16 GB mit Auslagerung.
Ist System-RAM wichtig?
Ja, sobald du auslagerst. 32 GB sind ein vernünftiges Minimum für Flux und Wan, und die größten Modelle (FLUX.2 Dev auf einer 12-GB-Karte zum Beispiel) können 64 GB oder mehr brauchen.
Welche Modelle kann ich kommerziell nutzen?
Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image und Wan 2.1/2.2 (Apache 2.0). FLUX.1 Dev, FLUX.2 Dev und Klein 9B sind nicht-kommerziell für das Modell selbst, aber die generierten Bilder dürfen kommerziell genutzt werden. Immer die Modellkarte prüfen.
Gibt es eine neuere Wan-Version, die ich zu Hause laufen lassen kann?
Nein. Wan 2.2 ist die neueste Wan-Version mit herunterladbaren Gewichten; Wan 2.5, 2.6, 2.7 und 3.0 sind nur per API verfügbar.
Links und Quellen
- Wan 2.2 A14B model card
- FLUX.2 Klein 9B licence
- ComfyUI GGUF loaders
- Flux family page
- FLUX.2 family page
- Qwen Image family page
- Z-Image family page
- Wan family page
- PirateDiffusion
- BitVector web app
Modelle in dieser Anleitung
Stable Diffusion 1.5-Modelle
Stable Diffusion XL 1.0-Modelle
Zimage-Modelle
Flux-Modelle
Flux 2 / Klein-Modelle
Qwen-Modelle
Wan-Modelle
Hunyuan-Modelle
Ltx2-Modelle
Geschrieben von
P.I. Panda
Verwandte Anleitungen

Videomodelle
Wie viel VRAM brauchst du für KI-Video? Wan 2.2, HunyuanVideo 1.5 und LTX-2 nach GPU-Größe (2026)
Benötigter VRAM für das lokale Ausführen von Wan 2.2, HunyuanVideo 1.5 und LTX-2, nach GPU-Größe, Auflösung und Clip-Länge: was 8, 12-16, 24, 32 und 48+ GB Karten schaffen, warum Video hundertmal mehr kostet als ein Bild, die Tricks zum Auslagern, die 14B-Modelle auf 24 GB passen lassen, realistische Generierungszeiten und wann Mieten besser ist als Kaufen.
Von P.I. Panda
2026-10-06
Fehler & Lösungen
CUDA-Speicher voll: wie viel VRAM jedes KI-Modell braucht und wie man es passend macht
Eine VRAM-Tabelle für SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 und HunyuanVideo sowie die Techniken, die ein Modell passend machen: fp8- und GGUF-Quantisierung, CPU-Auslagerung, gekacheltes VAE, Auflösungs- und Frame-Limits und wann man aufhören sollte zu kämpfen und es gehostet laufen lässt.
Von Captain
2026-05-18
Fehler & Lösungen
GPU- und VRAM-Leitfaden für KI-Bild- und Video-Modelle: Was jedes Modell braucht und was man kaufen sollte (oder nicht)
Wie viel Grafikspeicher jede Modellfamilie wirklich bei nutzbarer Geschwindigkeit braucht (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), was fp8- und GGUF-Quantisierung bringen, warum auch System-RAM und Festplatte wichtig sind, eine Rangliste von Grafikkarten von 8 bis 32 GB, Hinweise zu Mac und AMD sowie ab wann Mieten günstiger ist als Kaufen.
Von Quartermaster
2026-01-07
Modelle
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: Welche Modellfamilie 2026 verwenden?
Ein praktischer Vergleich der offenen Bildmodellfamilien: Prompt-Verständnis, Realismus, Anime und Illustration, Texterstellung, Geschwindigkeit, VRAM, LoRA-Ökosystem und Lizenz, mit Empfehlungen für jede Art von Arbeit und Hardware.
Von Captain
2026-05-22
Fehler & Lösungen
ComfyUI-Fehler und wie man sie behebt: rote Knoten, fehlende Modelle, CUDA-Speicher voll
Die ComfyUI-Fehlermeldungen, die man zuerst sieht, was jede bedeutet und wie man sie am besten behebt: fehlende benutzerdefinierte Knoten (rote Kästen), „Prompt outputs failed validation“, CUDA-Speicher voll, falscher Modelltyp im Loader, mat1- und mat2-Formfehler, Header-Deserialisierung, torch- und xformers-Inkompatibilitäten.
Von Captain
2026-05-12
Cloud-Dienste
PirateDiffusion: Führe jedes Modell über Telegram aus, keine GPU nötig
Die wichtigsten Befehle im PirateDiffusion Telegram-Bot: /render mit Modell-Triggerwörtern, (( )) und [[ ]] Gewichtung, #recipes, /adetailer, /highdef und /facelift Upscaling, /remix, /inpaint, ComfyUI Workflows mit /wf /run:, und die neuen // Skills, die das Modell für dich auswählen.
Von Captain
2026-10-03
Apps
BitVector: Vector für Discord, Spyglass im Web und Prism-Chat
Wie du gehostete Modelle und ComfyUI-Workflows über Discord mit dem Vector-Bot, aus jedem Browser mit Spyglass und per Chat mit Prism nutzt: Konto verknüpfen, /ai render und /ai workflow, Anfangsmedien für Bild-zu-Bild und Bild-zu-Video, Skills und die Lösungen für die häufigsten Fehler.
Von Captain
2026-10-03
Weitere Anleitungen
Modelle
FLUX.1 Dev: wie man es anweist, beste Einstellungen und kreative Ideen
Ein praktischer Leitfaden zu FLUX.1 Dev von Black Forest Labs: natürlichsprachige Eingaben, Guidance- und Schritt-Einstellungen, LoRA-Stapelung, Textrendering und Ideen für Eingaben, die seine Stärken nutzen.
Von Captain
2026-09-30
Modelle
Stable Diffusion XL 1.0: Prompts, Einstellungen und was es immer noch am besten kann
Wie du das offizielle SDXL 1.0 Basismodell optimal nutzt: native Auflösungen, CFG- und Sampler-Einstellungen, der Refiner, negative Prompts und Ideen für Stile, in denen SDXL immer noch glänzt.
Von Captain
2026-10-01
Modelle
Stable Diffusion 1.5: das klassische Modell, richtig genutzt
Stable Diffusion 1.5 ist immer noch wichtig: die richtige Auflösung, CFG und Sampler, wie du die riesige Bibliothek von LoRAs und Embeddings nutzt und kreative Prompt-Ideen, die zu einem 512-Pixel-Modell passen.
Von Captain
2026-10-02
Modelle
FLUX.2 Dev: das neueste Black Forest Labs Modell prompten
FLUX.2 Dev bringt längere Prompts, besseren Text, stärkeren Realismus und Multi-Referenz-Bearbeitung. Diese Anleitung erklärt den Turbo-Workflow, Guidance- und Auflösungseinstellungen, die Prompt-Struktur und Ideen, die seine neuen Stärken nutzen.
Von Captain
2026-10-03
Modelle
Qwen-Image: lange Prompts, perfekter Text und zweisprachige Poster
Qwen-Image ist das Modell, das du nutzen solltest, wenn die Wörter im Bild wichtig sind. Lerne, wie du lange, beschreibende Prompts schreibst, englischen und chinesischen Text genau darstellst, CFG und Schritte einstellst und layoutlastige kreative Ideen umsetzt.
Von Captain
2026-09-29
Modelle
SDXL-Lightning: Vier-Schritte-Generierung für jeden SDXL-Checkpoint
ByteDance's SDXL-Lightning LoRA verwandelt eine 30-Schritte-SDXL-Generierung in eine mit nur 4 Schritten. Erfahre, welche Schrittzahlen, welchen CFG-Wert und Sampler du verwenden musst und wie du es mit deinen Lieblings-Checkpoints und Style-LoRAs kombinierst.
Von Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Made in Japan
|
© 2026