Model
Trends
.ai
Model
Trends
.ai
de beste open source AI-modellen

VRAM-vereisten voor elke populaire AI-beeld- en videomodel (2026): volledige precisie, FP8 en GGUF

Onderwerp: Fouten en oplossingen
Door P.I. Panda
Gepubliceerd op 2026-10-06
Hoeveel VRAM je nodig hebt voor SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein en Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 en LTX-2, bij volledige precisie, FP8 en 4-bit GGUF, met de comfortabele kaart en licentie voor elk, wat elke GPU-grootte van 8 tot 48 GB kan draaien, en de volgorde van oplossingen als een model niet past.

Overzicht

Kort antwoord: 8 GB
VRAM
draait
SDXL
en de kleine snelle modellen zoals
Z-Image Turbo
en
FLUX.2 Klein 4B
. 12 GB draait
FLUX.1
en
Qwen-Image
zodra ze gequantiseerd zijn. 24 GB draait bijna elk beeldmodel plus
Wan 2.2
video in FP8. De nieuwste grote modellen,
FLUX.2 Dev
en
LTX-2
op volle kwaliteit, willen 32 GB of meer.
De tabel hieronder geeft elk populair open model weer met het geheugen dat het nodig heeft bij volledige precisie, bij FP8 en als een 4-bit GGUF-bestand, genererend op ongeveer 1024x1024. Verschillende testers rekenen de tekstencoder anders, dus zie elk getal als een bereik in plaats van een harde limiet. Drie dingen die de tabel verbergt: SDXL is nog steeds het goedkoopste model om goed te draaien (de basis past in 8 GB, maar
LoRAs
,
ControlNet
en opschaling voegen geheugen toe, daarom is 12 GB het comfortabele getal); FLUX.2 Klein 4B is nu de beste keuze voor kleine kaarten (ongeveer 13 GB bij volledige precisie, ongeveer de helft in FP8, Apache 2.0); en FLUX.2 Dev is geen thuismodel bij volledige precisie (een ComfyUI-gebruiker draaide FP8 op een 12 GB RTX 3060, met ongeveer 70 GB systeem-RAM om dat mogelijk te maken).
Precisie verandert alles. BF16/FP16 is volledige kwaliteit en volledige grootte, ongeveer 2 GB VRAM per miljard parameters. FP8 halveert dat, ongeveer 1 GB per miljard, en de meeste mensen merken geen verschil tussen FP8-uitvoer en volledige precisie. GGUF-bestanden (Q8, Q5, Q4 en lager) verkleinen modellen nog verder: Q8 komt dicht bij volledige kwaliteit, Q4 ruilt wat detail in voor een veel kleinere omvang, en onder Q4 daalt de kwaliteit snel. Het model is ook niet het enige in het geheugen: tekstencoders (T5 voor FLUX.1, een taalmodel voor Qwen-Image en
FLUX.2
), de VAE, LoRAs, ControlNet en het beeld zelf nemen allemaal ruimte in, en
ComfyUI
verplaatst sommige hiervan automatisch naar systeem-RAM, waardoor twee mensen met dezelfde kaart verschillende getallen rapporteren. Cijfers gecontroleerd op 6 oktober 2026 aan de hand van modelkaarten en communitytests; maandelijks bijgewerkt.

Naslag

Model
Full precision
FP8
4-bit / GGUF
Comfortable card
Stable Diffusion 1.5
0.9B
CreativeML OpenRAIL-M. Draait op bijna alles.
Full precision
4 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
6-8 GB
SDXL en fine-tunes: Pony, Illustrious, NoobAI
3.5B
OpenRAIL++ (fine-tunes verschillen). 12 GB geeft ruimte voor LoRAs, ControlNet en opschaling in één workflow.
Full precision
6-8 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
12 GB
SD 3.5 Large
8.1B
Stability Community License.
Full precision
16-24 GB
FP8
lager
dan volledige precisie
4-bit / GGUF
lager
dan FP8
Comfortable card
24 GB
Z-Image Turbo
6B
Apache 2.0. 8 stappen; het snelle model voor kleine kaarten.
Full precision
~16 GB
FP8
~8 GB
4-bit / GGUF
~6 GB
Comfortable card
8-12 GB
FLUX.2 Klein 4B
4B
Apache 2.0, commercieel gebruik toegestaan. Beste keuze voor 8 GB kaarten in 2026.
Full precision
~13 GB
FP8
~8 GB
4-bit / GGUF
~4-5 GB
Comfortable card
8-12 GB
FLUX.2 Klein 9B
9B
FLUX Niet-Commerciële Licentie (uitvoer commercieel bruikbaar).
Full precision
~29 GB
FP8
~17 GB
4-bit / GGUF
~8-9 GB
Comfortable card
16-24 GB
FLUX.1 Schnell
12B
Apache 2.0. 4 stappen.
Full precision
~24 GB
FP8
~12 GB
4-bit / GGUF
~6-8 GB
Comfortable card
12-16 GB
FLUX.1 Dev
12B
Niet-commerciële licentie. De fp8 T5 encoder bespaart ongeveer 4 GB op zichzelf.
Full precision
~24 GB
meer met de tekstencoder geladen
FP8
~12-18 GB
4-bit / GGUF
~7 GB
Comfortable card
16-24 GB
Qwen-Image
20B
Apache 2.0. Sterke tekstweergave; heeft zijn Qwen2.5-VL encoder in FP8 nodig op alles onder 32 GB.
Full precision
~41 GB
FP8
~20 GB
4-bit / GGUF
~12-13 GB
Comfortable card
24 GB
FLUX.2 Dev
32B
Niet-commerciële licentie. Verwacht trage generaties zonder een 32 GB kaart.
Full precision
~90 GB
met zijn tekstencoder
FP8
32 GB
past op een 32 GB kaart
4-bit / GGUF
12-16 GB
zware offloading
Comfortable card
32 GB+
HunyuanImage 3.0
80B MoE
Tencent Community License. Alleen datacenter; gebruik via een gehoste dienst.
Full precision
multi-GPU
bij elke precisie
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
datacenter
Wan 2.1 T2V 1.3B
1.3B
Video 480p
Apache 2.0.
Full precision
8.19 GB
officieel
FP8
8 GB
in de praktijk
4-bit / GGUF
n/a
Comfortable card
12 GB
Wan 2.2 TI2V 5B
5B
Video 720p
Apache 2.0.
Full precision
consument GPU
officieel, getest op een RTX 4090
FP8
n/a
4-bit / GGUF
8 GB
GGUF Q8
Comfortable card
24 GB
Wan 2.2 A14B T2V/I2V
2 x 14B
Video 720p
Apache 2.0. Twee 14B experts, één in VRAM tegelijk, daarom kunnen 24 GB kaarten het aan. Wan 2.5-3.0 zijn alleen API.
Full precision
80 GB
officieel, enkele GPU
FP8
~14 GB
per expert
4-bit / GGUF
12-16 GB
GGUF
Comfortable card
24-32 GB
HunyuanVideo 1.5
8.3B
Video 720p, 1080p met zijn opschaler
Tencent Community License.
Full precision
14 GB
officieel, met offloading
FP8
14 GB
in de praktijk
4-bit / GGUF
n/a
Comfortable card
24 GB+
80 GB voor beste kwaliteit
LTX-2 / LTX-2.3
19B / 22B
Video tot 4K
LTX-2 Community License. Gesynchroniseerde audio.
Full precision
32 GB+
officieel
FP8
n/a
4-bit / GGUF
24 GB
FP4
Comfortable card
32 GB
AD
Elke rij van deze tabel, geen VRAM nodig
BitVector Prism draait SDXL, Z-Image, FLUX.1, FLUX.2 en Qwen-Image bij volledige precisie op zijn eigen GPU's. Kies een model van deze site, typ een prompt, genereer in de browser. Niets te downloaden.

Stap voor stap

  1. Vind je VRAM (Taakbeheer > Prestaties > GPU, of nvidia-smi) en vergelijk het met een niveau hieronder; kies dan modellen waarvan de kolom "comfortabele kaart" gelijk aan of lager is dan jouw VRAM.
  2. 6-8 GB (RTX 3060 Ti, 4060, 2070):
    SD 1.5
    en SDXL inclusief
    Pony
    en Illustrious met een of twee LoRA's; Z-Image Turbo en FLUX.2 Klein 4B in FP8 of GGUF; FLUX.1 in GGUF Q4, langzaam;
    Wan 2.1
    1.3B op 480p en
    Wan 2.2 5B
    in GGUF met offloading.
  3. 12 GB (RTX 3060 12GB, 4070, 5070): alles hierboven, sneller, met ruimte voor ControlNet en opschaling;
    FLUX.1 Dev
    en Schnell in FP8 of GGUF; Qwen-Image in GGUF Q4;
    FLUX.2 Klein 9B
    in GGUF; Wan 2.2 A14B in GGUF Q4 met offloading op lage resolutie en korte clips.
  4. 16 GB (RTX 4060 Ti 16GB, 4070 Ti Super, 5070 Ti, 5080): FLUX.1 Dev in FP8 met ruimte; Z-Image Turbo en Klein 4B bij volledige precisie; Qwen-Image in GGUF Q4-Q5;
    HunyuanVideo 1.5
    met offloading; Wan 2.2 A14B in GGUF Q5 op 720p (communityrapporten).
  5. 24 GB (RTX 3090, 4090): bijna elk beeldmodel behalve FLUX.2 Dev bij volledige precisie; Qwen-Image in FP8 of Q8; Wan 2.2 A14B in FP8 en Wan 2.2 5B bij volledige precisie; LTX-2 in FP4; de meeste LoRA-training voor SDXL en Flux.
  6. 32 GB (RTX 5090): FLUX.2 Dev in FP8; LTX-2 en
    LTX-2.3
    in FP8; Wan 2.2 A14B op 720p zonder halverwege een clip zonder geheugen te komen.
  7. 48 GB en meer (RTX 6000 Ada, A100, H100): volledige precisie Qwen-Image, LTX-2 en FLUX.2 Dev met ruimte over; lange of hoge resolutie video, batchgeneratie en serieuze training.
  8. Download de precisie voor jouw niveau van de modelpagina op deze site (daar staat elke variant met bestandsgrootte), laad tekstencoders in FP8, en houd 32 GB systeem-RAM (64 GB voor de grootste modellen) vrij voor offloading.

Voorbeelden

FLUX.1 Dev op een 12 GB kaart (ComfyUI)

Load Diffusion Model: flux1-dev-fp8-e4m3fn (11.9 GB) or UnetLoaderGGUF flux1-dev-Q6_K (9.8 GB) | DualCLIPLoader: clip_l + t5xxl_fp8_e4m3fn_scaled | Load VAE: ae
1024x1024, 20 steps, euler, simple, guidance 3.5 | VAE Decode (Tiled) if the last step fails

Qwen-Image op 16 GB

UnetLoaderGGUF: qwen_image_Q4_K_M.gguf (~12.5 GB) | CLIPLoader: qwen_2.5_vl_7b_fp8_scaled, device cpu | Load VAE: qwen_image_vae
1328x1328 native; start at 1024x1024, 20 steps, cfg 2.5

Dezelfde modellen zonder kaart

/render <flux-dev> a studio photo of a vintage camera on a walnut desk, soft window light /size:1024x1024 (PirateDiffusion, Telegram)

Tips

  • Als je
    CUDA out of memory
    ziet, doe dan dit in volgorde: schakel over naar een FP8- of GGUF-versie van hetzelfde model (de grootste besparing); verlaag de resolutie of cliplengte (geheugen groeit met het aantal pixels, 1536 naar 1024 px scheelt veel); gebruik getegelde VAE-decodering; laad de tekstencoder in FP8 of houd die op de CPU; sluit andere GPU-apps (browsers en games gebruiken ook VRAM).
  • Offloading werkt, maar je betaalt in snelheid en systeem-RAM: een model kan draaien op een kaart die "te klein" is, meerdere keren langzamer, en je hebt misschien 32-64 GB of meer systeem-RAM nodig.
  • Licenties in één regel: Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image en
    Wan
    2.1/2.2 zijn Apache 2.0 (commercieel gebruik toegestaan); FLUX.1 Dev, FLUX.2 Dev en Klein 9B gebruiken Black Forest Labs' niet-commerciële licentie, die het gebruik van het model in een commercieel product of dienst verbiedt, maar je mag de gegenereerde beelden commercieel gebruiken. Licenties veranderen; de modelpagina linkt naar de actuele.
  • Een 32 GB kaart kopen om FLUX.2 Dev of LTX-2 voor een weekendproject te draaien betaalt zich zelden uit; als het model dat je wilt in de 24 GB+ rijen staat, is huren per uur of een vast cloudabonnement meestal goedkoper en sneller dan offloading op een kleine kaart.
  • Regel per miljard parameters: 2 GB bij BF16, 1 GB bij FP8, ongeveer 0,6 GB bij Q4, plus 2-5 GB voor de encoder, VAE en latent.
  • Voor video zijn resolutie en cliplengte net zo belangrijk als het model; de begeleidende gids over VRAM voor AI-video legt dat uit.

Probleemoplossing

CUDA out of memory op een kaart die de tabel als geschikt aangeeft

Waarom het gebeurt
Volledige precisie tekstencoder, een LoRA-stack, ControlNet of een hoge resolutie bovenop het model.

Zo los je het op
FP8 encoder, één LoRA, native resolutie, getegelde VAE; de CUDA out of memory gids heeft de lange versie.

Generatie is pijnlijk traag hoewel niets crasht

Waarom het gebeurt
Automatisch offloading naar systeem-RAM.

Zo los je het op
Ga naar de volgende precisie (FP8 naar Q6, Q6 naar Q4) totdat gedeeld GPU-geheugen bijna nul blijft.

FLUX.2 Dev "werkt" op 12 GB maar heeft 70 GB RAM nodig

Waarom het gebeurt
FP8-gewichten gewisseld vanuit systeemgeheugen.

Zo los je het op
Gebruik Klein 4B/9B lokaal en FLUX.2 Dev in de cloud of op een 32 GB kaart.

Kan FP8 niet onderscheiden van volledige precisie, waarom ziet Q4 er dan zacht uit?

Waarom het gebeurt
Q4 verliest meer detail dan FP8; onder Q4 daalt de kwaliteit snel.

Zo los je het op
Gebruik Q6 of Q8 als die passen; Q4 voor concepten.

Licentieverwarring bij FLUX

Waarom het gebeurt
Schnell en Klein 4B zijn Apache 2.0; Dev, FLUX.2 Dev en Klein 9B zijn niet-commercieel.

Zo los je het op
Controleer de licentie-kolom en de modelkaart voordat je een model in een product gebruikt.

AD
PirateDiffusion
De 24 GB+ rijen, vanaf je telefoon
PirateDiffusion host FLUX.2 Dev, Qwen-Image, Wan 2.2 14B en LTX-2 op serverhardware en draait ze via Telegram-commando's. Onbeperkt genereren tegen een vaste maandprijs; geen kaart, geen offloading, geen 70 GB RAM.

Vragen

Kan ik Flux draaien op 8 GB VRAM?

Ja, met een gequantiseerd bestand. FLUX.1 in GGUF Q4 heeft ongeveer 7 GB nodig, en FLUX.2 Klein 4B in FP8 ongeveer 8 GB. Verwacht langzamere generaties dan op een 12 of 16 GB kaart. Volledige precisie FLUX.1 heeft ongeveer 24 GB nodig.

Is 12 GB genoeg voor SDXL?

Ja. SDXL zelf past in 8 GB; 12 GB geeft ruimte voor LoRAs, ControlNet en opschaling in dezelfde workflow.

Hoeveel VRAM heeft Wan 2.2 nodig?

Dat hangt af van de versie. Het 5B-model draait op 8 GB als GGUF-bestand en comfortabel op 24 GB. Het A14B-model heeft officieel 80 GB nodig zonder offloading, maar de FP8-versie draait goed op 24 GB en GGUF-versies draaien op 12-16 GB met offloading.

Maakt systeem-RAM uit?

Ja, zodra je begint met offloading. 32 GB is een verstandige minimum voor Flux en Wan, en de grootste modellen (zoals FLUX.2 Dev op een 12 GB kaart) kunnen 64 GB of meer gebruiken.

Welke modellen mag ik commercieel gebruiken?

Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image en Wan 2.1/2.2 (Apache 2.0). FLUX.1 Dev, FLUX.2 Dev en Klein 9B zijn niet-commercieel voor het model zelf, maar de beelden die je genereert mogen wel commercieel gebruikt worden. Controleer altijd de modelkaart.

Is er een nieuwere Wan die ik thuis kan draaien?

Nee. Wan 2.2 is de nieuwste Wan-release met downloadbare gewichten; Wan 2.5, 2.6, 2.7 en 3.0 zijn alleen via API beschikbaar.

Links en bronnen

Modellen in deze gids

Geschreven door
P.I. Panda

Verwante gidsen

Videomodellen
Hoeveel VRAM heb je nodig voor AI-video? Wan 2.2, HunyuanVideo 1.5 en LTX-2 per GPU-grootte (2026)
VRAM die nodig is om Wan 2.2, HunyuanVideo 1.5 en LTX-2 lokaal te draaien, per GPU-grootte, resolutie en cliplengte: wat 8, 12-16, 24, 32 en 48+ GB kaarten aankunnen, waarom video honderd keer meer kost dan een afbeelding, de offloading-trucs die 14B modellen op 24 GB passen, realistische generatie-tijden en wanneer huren beter is dan kopen.
Door P.I. Panda
2026-10-06
Fouten en oplossingen
CUDA geheugen vol: hoeveel VRAM elk AI-model nodig heeft en hoe het past
Een VRAM-tabel voor SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 en HunyuanVideo, en de technieken die een model passend maken: fp8 en GGUF-quantisatie, CPU-offload, getegelde VAE, resolutie- en framebeperkingen, en wanneer je moet stoppen met vechten en het gehost moet draaien.
Door Captain
2026-05-18
Fouten en oplossingen
GPU- en VRAM-gids voor AI-beeld en video: wat elk model nodig heeft en wat je moet kopen (of niet)
Hoeveel grafisch geheugen elke modelfamilie echt nodig heeft bij bruikbare snelheid (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), wat fp8 en GGUF-quantisatie je opleveren, waarom systeem-RAM en schijf ook belangrijk zijn, een ranglijst van kaarten van 8 tot 32 GB, Mac- en AMD-notities, en het punt waarop huren goedkoper is dan kopen.
Door Quartermaster
2026-01-07
Modellen
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: welke modelfamilie gebruik je in 2026
Een praktische vergelijking van de open beeldmodelfamilies: promptvolging, realisme, anime en illustratie, tekstweergave, snelheid, VRAM, LoRA-ecosysteem en licentie, met een aanbeveling voor elk soort werk en hardware.
Door Captain
2026-05-22
Fouten en oplossingen
ComfyUI-fouten en hoe je ze oplost: rode knooppunten, ontbrekende modellen, CUDA-geheugen vol
De ComfyUI-foutmeldingen die mensen als eerste tegenkomen, wat ze betekenen en de oplossing die werkt: ontbrekende aangepaste knooppunten (rode vakken), "Prompt outputs failed validation", CUDA-geheugen vol, verkeerd modeltype in een loader, mat1 en mat2 vormfouten, header deserialisatie, torch en xformers mismatches.
Door Captain
2026-05-12
Clouddiensten
PirateDiffusion: voer elk model uit via Telegram, geen GPU nodig
De belangrijkste commando's in de PirateDiffusion Telegram-bot: /render met model triggerwoorden, (( )) en [[ ]] voor gewicht, #recipes, /adetailer, /highdef en /facelift opschaling, /remix, /inpaint, ComfyUI workflows met /wf /run:, en de nieuwe // skills die het model voor je kiezen.
Door Captain
2026-10-03
Apps
BitVector: Vector voor Discord, Spyglass op het web en Prism chat
Hoe je gehoste modellen en ComfyUI-workflows draait vanuit Discord met de Vector-bot, vanuit elke browser met Spyglass, en door te chatten met Prism: account koppelen, /ai render en /ai workflow, beginmedia voor image-to-image en image-to-video, skills, en de oplossingen voor de fouten die mensen als eerste tegenkomen.
Door Captain
2026-10-03

Meer gidsen

Clouddiensten
Flat fee vs tokens: why unlimited plans like Graydient.ai are the best value for AI creators in 2026
A ranked cost comparison, with prices checked on 8 October 2026, of flat-fee unlimited plans like Graydient.ai against token and credit pricing from Midjourney, Leonardo, fal.ai, Replicate, Runway and Kling: what 1,000 images and 1,000 videos a month really cost on each, and why one fixed fee for unlimited images, video, audio, Grok LLM chat and web apps is the best value for creators who iterate.
Door Captain
2026-10-08
Modellen
FLUX.1 Dev: hoe je het aanstuurt, beste instellingen en creatieve ideeën
Een praktische gids voor FLUX.1 Dev van Black Forest Labs: natuurlijk-taal prompts, begeleiding en stapinstellingen, LoRA stapeling, tekstweergave en promptideeën die goed werken met dit model.
Door Captain
2026-09-30
Modellen
Stable Diffusion XL 1.0: prompts, instellingen en waar het nog steeds het beste in is
Hoe je het meeste haalt uit het officiële SDXL 1.0 basismodel: native resoluties, CFG- en sampler-instellingen, de refiner, negatieve prompts en ideeën voor stijlen waarin SDXL nog steeds uitblinkt.
Door Captain
2026-10-01
Modellen
Stable Diffusion 1.5: het klassieke model, goed aangestuurd
Stable Diffusion 1.5 is nog steeds de moeite waard om te kennen: de juiste resolutie, CFG en sampler, hoe je de enorme bibliotheek met LoRAs en embeddings gebruikt, en creatieve promptideeën die passen bij een 512-pixel model.
Door Captain
2026-10-02
Modellen
FLUX.2 Dev: prompten met het nieuwste model van Black Forest Labs
FLUX.2 Dev brengt langere prompts, betere tekst, sterkere realisme en multi-reference bewerking. Deze gids behandelt de turbo workflow, guidance en resolutie-instellingen, promptstructuur en ideeën die gebruikmaken van de nieuwe mogelijkheden.
Door Captain
2026-10-03
Modellen
Qwen-Image: lange prompts, perfecte tekst en tweetalige posters
Qwen-Image is het model dat je moet gebruiken als de woorden in de afbeelding belangrijk zijn. Leer hoe je lange, beschrijvende prompts schrijft, Engelse en Chinese tekst nauwkeurig weergeeft, CFG en stappen instelt, en creatieve ideeën met veel lay-out onderzoekt.
Door Captain
2026-09-29