Hur mycket VRAM behöver du för AI-video? Wan 2.2, HunyuanVideo 1.5 och LTX-2 efter GPU-storlek (2026)
Ämne: Videomodeller
Av P.I. Panda
Publicerad 2026-10-06
Översikt
Kort svar: 8 GB räcker för korta, lågupplösta klipp med
Wan 2.1
1.3B eller en kvantiserad
Wan 2.2 5B
. 24 GB är den verkliga startpunkten för 720p-video med dagens bästa öppna modeller. 32 GB kör
Wan 2.2
14B och
LTX-2
i 720p utan krångliga lösningar. Fullprecision-versionerna av de största modellerna behöver fortfarande 48 till 80 GB, vilket betyder datacenterkort eller molnet.
Video behöver mycket mer minne än bilder eftersom en enda 1024x1024-bild är ungefär en miljon pixlar, medan ett 5-sekundersklipp vid 24 bilder per sekund är 120 bilder: modellen jobbar med mer än hundra gånger så mycket på en gång och måste hålla varje bild konsekvent med sina grannar, så den kan inte göra dem en i taget. Tre saker driver minnesbehovet och de multipliceras: modellstorlek och precision (full, FP8 eller GGUF), upplösning (720p har ungefär 2,25 gånger fler pixlar än 480p) och klippets längd (ungefär proportionellt). En modell som får plats vid 480p för 3 sekunder kan få slut på minne vid 720p för 5 sekunder på samma kort.
Den här guiden täcker öppna viktade videomodeller som du kan ladda ner och köra själv. Siffrorna är praktiska intervall från officiella modellkort och communitytester, kontrollerade 6 oktober 2026; resultaten varierar med ComfyUI-version, arbetsflöde och hur mycket system-RAM som finns tillgängligt för offloading. För bildmodeller, se den kompletterande guiden om VRAM-krav per modell; båda uppdateras varje månad.
Referens
Namn | Typ | Vad det är |
|---|---|---|
Wan 2.1 T2V 1.3B | 8 GB: 480p, ~5 s clips | 12 GB+: comfortable | Alternativet med 8 GB. Cirka 8,19 GB i användning, 480p-utgång, runt 4 minuter per 5-sekundersklipp på en RTX 4090. Kvaliteten är tydligt lägre än de större modellerna. Apache 2.0. |
Wan 2.2 TI2V 5B | 8 GB: GGUF Q8 with offloading, slow | 12-16 GB: quantised at 720p | 24 GB: full precision (official minimum) | Text eller bild till 720p vid 24 fps. Alibaba listar 24 GB (en RTX 4090) som minimum vid full precision och under 9 minuter för ett 5-sekunders 720p-klipp. Q8 GGUF är ungefär 5,4 GB; ComfyUI offloadar resten till system-RAM. Apache 2.0. |
Wan 2.2 A14B (T2V och I2V) | 12-16 GB: GGUF Q4-Q5 with offloading, short clips | 24 GB: FP8 at 480p, 720p with the text encoder offloaded | 32 GB: FP8 at 720p | 80 GB: full precision | Bästa öppna kvaliteten. Mixture of experts: totalt 27B parametrar, 14B aktiva, en expert för de brusiga tidiga stegen och en för detaljer; bara en expert är i VRAM åt gången. FP8 är ungefär 14,3 GB per expert, GGUF Q4-Q5 cirka 10-11 GB. Officiellt krav 80 GB är för full precision utan offloading. Apache 2.0. |
12-16 GB: ~14 GB minimum with offloading | 24 GB: quantised at 720p | 32 GB: comfortable | 28-48 GB: full precision 720p | Tencent, november 2025, 8,3B parametrar, 480p eller 720p med inbyggd uppskalare till 1080p; 80 GB rekommenderas för bästa kvalitet. Inte den ursprungliga HunyuanVideo (13B), som behöver 60-80 GB vid full precision; många äldre guider blandar ihop dem. | |
16 GB: draft previews in FP8 (distilled pipeline) | 24 GB: FP4, clips up to ~97 frames | 32 GB: FP8 (official minimum) | 48 GB+: BF16 (~43 GB file) | Lightricks, vikter januari och mars 2026. Video med synkad ljud, upp till 4K, och snabbt: runt 90 sekunder för ett 5-sekundersklipp på en RTX 4090. Avvägningen är minne; Lightricks rekommenderar också 100 GB+ ledigt diskutrymme. | |
System RAM | 32 GB workable minimum | 64 GB comfortable for 14B models on 12-24 GB cards | Offloading flyttar en del av modellen till vanligt RAM, så systemminnet är viktigare för video än för bilder. |
Disk | fast NVMe SSD | Videomodeller är tiotals GB vardera; att ladda från en långsam disk lägger till minuter vid varje modellbyte. |
Wan 2.5-3.0, Kling, Veo, Runway, Seedance | API only | Inga nedladdningsbara vikter, så inget VRAM-värde; du betalar per sekund video istället. Wan 2.2 är den nyaste Wan med vikter (från och med oktober 2026). |
AD

Video utan ett 24 GB-kort
BitVector Prism kör Wan- och LTX-videomodellerna från den här guiden på sina egna GPU:er: välj modell, ladda upp en bildruta eller skriv en prompt, få klippet i webbläsaren. Inget att installera, ingen offloading.
Steg för steg
- Kolla ditt VRAM: Windows Aktivitetshanteraren > Prestanda > GPU > Dedikerat GPU-minne; nvidia-smi på Linux. Kolla också system-RAM; 32 GB är lägsta nivån för offloading.
- Välj modellraden för ditt kort från tabellen: 8 GB betyder Wan 2.1 1.3B eller Wan 2.2 5B GGUF; 12-16 GB lägger till Wan 2.2 14B GGUF ochHunyuanVideo 1.5med offloading; 24 GB är det vanliga videokortet (5B full, 14B FP8, LTX-2 FP4); 32 GB kör allt i 720p i FP8.
- Ladda ner den precision som modellens sida på den här sajten listar för din nivå (FP8 för 24-32 GB, GGUF Q4-Q5 för 12-16 GB) istället för den ursprungliga BF16.
- Börja på 480p och korta klipp (49-81 bilder). Få rörelse och komposition rätt, sen skala upp eller rendera om i 720p. Att gå från 480p till 720p fördubblar ungefär bildminnet, så ett arbetsflöde på 14 GB vid 480p kan behöva 24 GB eller mer vid 720p.
- För Wan 2.2 14B på 24 GB, flytta T5/UMT5 textkodaren till system-RAM (CPU-enhet på loadern, eller ComfyUIs automatiska offload). Utan det kan ett 720p-klipp passera 24 GB mitt i.
- För allt över 5-6 sekunder, generera i segment och länka dem: sista bilden i ett klipp blir startbilden i nästa. De flesta öppna modeller är anpassade för cirka 5 sekunder och tappar kvalitet efter det.
- Om ett klipp fortfarande inte får plats, sänk bildfrekvens före upplösning, använd tiled VAE-dekodning och håll webbläsare och spel borta från GPU:n.
- Om du behöver Wan 2.2 14B eller LTX-2 i 720p regelbundet och har mindre än 24 GB, kör dem i molnet:PirateDiffusionkör Wan,LTXoch H3-modeller på server-GPU:er via Telegram;BitVectorvia en webbapp.
Exempel
Wan 2.2 14B bild-till-video på 24 GB (ComfyUI)
UNETLoader x2: wan2.2_i2v_high_noise_14B_fp8_scaled, wan2.2_i2v_low_noise_14B_fp8_scaled | CLIPLoader: umt5_xxl_fp8_e4m3fn_scaled, device: cpu | Load VAE: wan_2.1_vae
WanImageToVideo: 832x480, 81 frames | KSamplerAdvanced high (steps 0-10, cfg 3.5) -> KSamplerAdvanced low (steps 10-20, cfg 3.5) | shift 5 | VAE Decode (Tiled)
Wan 2.2 5B på ett 8-12 GB-kort
UnetLoaderGGUF: wan2.2_ti2v_5B_Q8_0.gguf | CLIPLoader: umt5_xxl_fp8 (cpu) | 1280x704 is the native 720p shape; start at 832x480, 49 frames, 20 steps
python main.py --lowvram
Samma klipp i molnet
/workflow /run:wan22-i2v slow dolly in, she looks up and smiles, soft wind in her hair /length:81 (reply to your image on PirateDiffusion)
Tips
- Rapporterade tider för ett enda 5-sekundersklipp: Wan 2.1 1.3B 480p cirka 4 minuter på en RTX 4090; Wan 2.2 5B 720p under 9 minuter (officiellt); Wan image-to-video cirka 12,7 minuter på en 4090 jämfört med cirka 7 på en 5090 (ungefär 45 procent snabbare i ett publicerat test); LTX-2 cirka 90 sekunder på en 4090. Offloading kan göra någon av dessa flera gånger långsammare.
- Siffran 80 GB som Alibaba anger för Wan 2.2 A14B är för full precision utan offloading; FP8 och GGUF plus textkodaren i system-RAM är hur alla faktiskt kör den.
- Två 14B-experter betyder två filer: kolla modellens sida för vilken expert enLoRAtränades på (hög brusnivå eller låg brusnivå); att ladda den på fel expert gör inget.
- LTX-2 byter minne mot hastighet och ljud; om du får plats med FP8 på 32 GB är det den snabbaste öppna vägen till ett färdigt klipp med ljud.
- En 5090 lanserades för 1 999 dollar men såldes för ungefär 4 500-6 000 i oktober 2026 och kan fortfarande inte hålla fullprecision-modellerna. För sporadisk video är det billigare och mycket snabbare att hyra en 48 eller 80 GB GPU per timme, eller en fast molnplan, än att offloada på ett mindre kort.
- Wan-, Hunyuan- och LTX-familjesidorna på den här sajten listar varje nedladdningsbar variant med dess filstorlek; en variant behöver sin filstorlek plus 3-4 GB ledigt VRAM för att köra snabbt.
Felsökning
CUDA out of memory mitt i ett 720p-klipp på 24 GB
Varför det händer
Textkodaren är fortfarande i VRAM tillsammans med den aktiva 14B-experten.
Så löser du det
Ladda UMT5-kodaren på CPU:n, eller gå ner till 480p; se guiden för
CUDA out of memory
för full checklista.
Får plats i minnet men tar 40 minuter
Varför det händer
Tung offloading till system-RAM, eller en GGUF Q4 på ett kort som skulle köra FP8.
Så löser du det
Kortare klipp, lägre upplösning eller använd största precision som stannar i minnet; kontrollera att "Shared GPU memory" i Aktivitetshanteraren ligger nära noll.
HunyuanVideo-guiden säger 60-80 GB
Varför det händer
Det handlar om den ursprungliga 13B HunyuanVideo, inte HunyuanVideo 1.5 (8,3B).
Så löser du det
Använd 1.5: cirka 14 GB med offloading, 24 GB bekvämt.
LTX-2 laddas inte på 16 GB
Varför det händer
Endast den destillerade FP8-förhandsvisningspipen får plats; hela modellen behöver 24 GB (FP4) eller 32 GB (FP8).
Så löser du det
Använd den destillerade förhandsvisningen för utkast och rendera finaler på ett större kort eller i molnet.
Långt klipp faller isär efter 6 sekunder
Varför det händer
Öppna modeller är anpassade för cirka 5 sekunder; minne och kvalitet försämras efter det.
Så löser du det
Kedja 5-sekunderssegment från sista bilden; skala upp och interpolera efteråt.
Kan inte hitta Wan 2.5 eller 3.0 vikter
Varför det händer
De är API-endast släpp.
Så löser du det
Wan 2.2 är den nyaste Wan du kan köra lokalt; Wan-familjesidan följer alla ändringar.
AD

Wan 2.2 14B, LTX-2 och H3 från Telegram
PirateDiffusion hostar de stora videomodellerna i full precision och skickar det färdiga klippet till din chatt. Obegränsad generering till fast månadspris, mindre än en månad av 5090 gatupris per år.
Frågor
Kan jag göra AI-video med 8 GB VRAM?
Ja, men bara korta, lågupplösta klipp. Wan 2.1 1.3B gör 480p-klipp på ungefär 8 GB, och Wan 2.2 5B körs som en GGUF-fil med offloading. Wan 2.2 14B, HunyuanVideo och LTX-2 behöver mer.
Räcker 24 GB för AI-video?
För de flesta, ja. Ett 24 GB-kort kör Wan 2.2 5B i full precision, Wan 2.2 14B i FP8 (720p med textkodaren offloadad), HunyuanVideo 1.5 och LTX-2 i FP4. Det är det vanligaste kortet för lokal videoproduktion.
Varför säger Wan 2.2 att den behöver 80 GB?
Det är siffran för 14B-modellen i full precision utan offloading. Med FP8 eller GGUF-filer och textkodaren i system-RAM kör den på 24 GB, och på 12-16 GB långsammare.
Är en RTX 5090 värd det för AI-video?
Om du gör video ofta är de extra 8 GB över en 4090 (32 mot 24) det som ger bekväm 720p med Wan 2.2 14B och FP8 LTX-2, och den är ungefär 45 procent snabbare. Till två till tre gånger lanseringspriset på 1 999 dollar är det billigare att hyra för den som inte genererar video varje dag.
Behöver HunyuanVideo mer VRAM än Wan?
HunyuanVideo 1.5 (8,3B) behöver mindre än Wan 2.2 14B: cirka 14 GB med offloading. Den ursprungliga HunyuanVideo (13B) behöver mycket mer, så kolla vilken version en guide pratar om.
Hur mycket system-RAM?
32 GB är fungerande minimum för Wan 2.2 och HunyuanVideo med offloading; 64 GB är bekvämt för 14B-modeller på ett 12-24 GB-kort.
Länkar och källor
- Wan 2.2 official repository (requirements, timings)
- HunyuanVideo 1.5 on Hugging Face
- LTX-2 hardware notes (Lightricks)
- ComfyUI GGUF loaders
- Wan family page
- Hunyuan family page
- LTX-2 family page
- PirateDiffusion
- BitVector web app
Modeller i den här guiden
Skriven av
P.I. Panda
Relaterade guider
Fel och lösningar
VRAM-krav för alla populära AI-bild- och videomodeller (2026): full precision, FP8 och GGUF
Hur mycket VRAM du behöver för SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein och Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 och LTX-2, i full precision, FP8 och 4-bitars GGUF, med den bekväma kort- och licensen för varje, vad varje GPU-storlek från 8 till 48 GB kan köra, och ordningen på fixar när en modell inte får plats.
Av P.I. Panda
2026-10-06
Videomodeller
Wan 2.2 video: text-till-video och bild-till-video setup, inställningar och LoRAs
Få dina första resultat från Wan 2.2: vilken modellstorlek du ska välja (5B eller 14B), expertparet med hög brusnivå / låg brusnivå, upplösning och antal bilder som funkar, lightning-LoRAs som kortar ner renderingar till fyra steg, promptstruktur för rörelse och hur du kör det hostat när kortet är för litet.
Av Captain
2026-05-24
Fel och lösningar
CUDA slut på minne: hur mycket VRAM varje AI-modell behöver och hur man får plats med det
En VRAM-tabell för SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 och HunyuanVideo, och teknikerna som gör att en modell får plats: fp8 och GGUF-kvantisering, CPU-avlastning, tiled VAE, upplösnings- och bildrutegränser, och när det är dags att sluta kämpa och köra den hostad.
Av Captain
2026-05-18
Fel och lösningar
GPU- och VRAM-guide för AI-bild och video: vad varje modell behöver och vad du ska köpa (eller inte)
Hur mycket grafikminne varje modells familj verkligen behöver för användbar hastighet (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), vad fp8 och GGUF-kvantisering ger dig, varför system-RAM och disk också spelar roll, en rankning av kort från 8 till 32 GB, Mac- och AMD-noteringar, och när det är billigare att hyra än att köpa.
Av Quartermaster
2026-01-07
Modeller
LTX 2.3 Crisp Enhance: skarpare, mer filmisk videodetalj
vrgamedevgirls Crisp Enhance LoRA för LTX 2.3 ökar skärpa, mikrodetaill och kontrast i genererad video. Lär dig hur du balanserar den med Soft Enhance-syskonet, vikter och promptidéer.
Av Captain
2026-10-03
Molntjänster
PirateDiffusion: kör vilken modell som helst från Telegram, ingen GPU behövs
De viktigaste kommandona i PirateDiffusion Telegram-boten: /render med modellens triggerord, (( )) och [[ ]] viktning, #recipes, /adetailer, /highdef och /facelift uppskalning, /remix, /inpaint, ComfyUI arbetsflöden med /wf /run:, och de nya // färdigheterna som väljer modellen åt dig.
Av Captain
2026-10-03
Fler guider
Molntjänster
Fast avgift vs tokens: varför obegränsade planer som Graydient.ai är bäst värde för AI-skapare 2026
En rankad kostnadsjämförelse, med priser kontrollerade den 8 oktober 2026, av fast avgift obegränsade planer som Graydient.ai mot token- och kreditpriser från Midjourney, Leonardo, fal.ai, Replicate, Runway och Kling: vad 1 000 bilder och 1 000 videor i månaden verkligen kostar på varje, och varför en fast avgift för obegränsade bilder, video, ljud, Grok LLM-chatt och webbappar är bäst för skapare som itererar.
Av Captain
2026-10-08
Modeller
FLUX.1 Dev: hur du promptar det, bästa inställningarna och kreativa idéer
En praktisk guide till FLUX.1 Dev från Black Forest Labs: naturligt språk för prompts, styrning och steginställningar, LoRA-stapling, textrendering och promptidéer som spelar på dess styrkor.
Av Captain
2026-09-30
Modeller
Stable Diffusion XL 1.0: prompts, inställningar och vad den fortfarande är bäst på
Hur du får ut mest av den officiella SDXL 1.0 basmodellen: inbyggda upplösningar, CFG- och sampler-inställningar, refiner, negativa prompts och idéer för stilar där SDXL fortfarande glänser.
Av Captain
2026-10-01
Modeller
Stable Diffusion 1.5: den klassiska modellen, rätt promptad
Stable Diffusion 1.5 är fortfarande värd att känna till: rätt upplösning, CFG och sampler, hur du använder dess stora bibliotek av LoRAs och embeddings, och kreativa promptidéer som passar en 512-pixelmodell.
Av Captain
2026-10-02
Modeller
FLUX.2 Dev: promptning av den senaste modellen från Black Forest Labs
FLUX.2 Dev ger längre prompts, bättre text, starkare realism och redigering med flera referenser. Den här guiden täcker turboarbetsflödet, styrning och upplösningsinställningar, promptstruktur och idéer som använder dess nya styrkor.
Av Captain
2026-10-03
Modeller
Qwen-Image: långa prompts, perfekt text och tvåspråkiga affischer
Qwen-Image är modellen du ska använda när orden i bilden är viktiga. Lär dig hur du skriver långa beskrivande prompts, återger engelska och kinesiska texter korrekt, ställer in CFG och steg, och utforskar kreativa idéer med mycket layout.
Av Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Alla rättigheter förbehållna