Ile VRAM potrzebujesz do AI wideo? Wan 2.2, HunyuanVideo 1.5 i LTX-2 według wielkości GPU (2026)
Temat: Modele wideo
Autor: P.I. Panda
Opublikowano 2026-10-06
Ilość VRAM potrzebna do uruchomienia Wan 2.2, HunyuanVideo 1.5 i LTX-2 lokalnie, według wielkości GPU, rozdzielczości i długości klipu: co potrafią karty 8, 12-16, 24, 32 i 48+ GB, dlaczego wideo kosztuje sto razy więcej niż obraz, triki z offloadingiem, które mieszczą modele 14B na 24 GB, realistyczne czasy generowania i kiedy wynajem jest lepszy niż kupno.
Przegląd
Krótko: 8 GB wystarczy na krótkie, niskorozdzielcze klipy z
Wan 2.1
1.3B lub skwantowany
Wan 2.2
5B. 24 GB to prawdziwy punkt startowy dla wideo 720p z najlepszymi otwartymi modelami. 32 GB uruchomi Wan 2.2 14B i
LTX-2
w 720p bez kombinacji. Wersje pełnej precyzji największych modeli nadal potrzebują 48 do 80 GB, czyli kart serwerowych lub chmury.
Wideo potrzebuje dużo więcej pamięci niż obrazy, bo pojedynczy obraz 1024x1024 ma około miliona pikseli, a 5-sekundowy klip przy 24 klatkach na sekundę to 120 klatek: model działa na ponad sto razy większej ilości danych naraz i musi zachować spójność każdej klatki z sąsiednimi, więc nie może ich robić pojedynczo. Trzy rzeczy wpływają na pamięć i się mnożą: rozmiar i precyzja modelu (pełna, FP8 lub GGUF), rozdzielczość (720p ma około 2,25 razy więcej pikseli niż 480p) oraz długość klipu (w przybliżeniu proporcjonalna). Model, który mieści się przy 480p na 3 sekundy, może zabraknąć pamięci przy 720p na 5 sekund na tej samej karcie.
Ten przewodnik obejmuje otwarte modele wideo, które możesz pobrać i uruchomić samodzielnie. Dane to praktyczne zakresy z oficjalnych kart modeli i testów społeczności, sprawdzone 6 października 2026; wyniki zależą od wersji
ComfyUI
, workflow i ilości dostępnej pamięci systemowej do offloadingu. Dla modeli obrazów zobacz przewodnik o wymaganiach
VRAM
według modelu; oba są aktualizowane co miesiąc.
Odniesienie
Nazwa | Typ | Co to jest |
|---|---|---|
Wan 2.1 T2V 1.3B | 8 GB: 480p, ~5 s clips | 12 GB+: comfortable | Opcja 8 GB. Około 8,19 GB w użyciu, wyjście 480p, około 4 minuty na 5-sekundowy klip na RTX 4090. Jakość wyraźnie niższa niż większych modeli. Licencja Apache 2.0. |
Wan 2.2 TI2V 5B | 8 GB: GGUF Q8 with offloading, slow | 12-16 GB: quantised at 720p | 24 GB: full precision (official minimum) | Tekst lub obraz do 720p przy 24 fps. Alibaba podaje 24 GB (RTX 4090) jako minimum przy pełnej precyzji i mniej niż 9 minut na 5-sekundowy klip 720p. Q8 GGUF zajmuje około 5,4 GB; ComfyUI przenosi resztę do pamięci systemowej. Licencja Apache 2.0. |
Wan 2.2 A14B (T2V i I2V) | 12-16 GB: GGUF Q4-Q5 with offloading, short clips | 24 GB: FP8 at 480p, 720p with the text encoder offloaded | 32 GB: FP8 at 720p | 80 GB: full precision | Najlepsza otwarta jakość. Mieszanka ekspertów: 27B parametrów łącznie, 14B aktywnych, jeden ekspert do szumu na wczesnych etapach i jeden do detali; w VRAM jest tylko jeden ekspert naraz. FP8 to około 14,3 GB na eksperta, GGUF Q4-Q5 około 10-11 GB. Oficjalne wymaganie 80 GB dotyczy pełnej precyzji bez offloadingu. Licencja Apache 2.0. |
HunyuanVideo 1.5 | 12-16 GB: ~14 GB minimum with offloading | 24 GB: quantised at 720p | 32 GB: comfortable | 28-48 GB: full precision 720p | Tencent, listopad 2025, 8,3B parametrów, 480p lub 720p z wbudowanym upscalerem do 1080p; 80 GB zalecane dla najlepszej jakości. To nie jest oryginalny HunyuanVideo (13B), który potrzebuje 60-80 GB przy pełnej precyzji; wiele starszych przewodników myli te wersje. |
LTX-2 (19B) / LTX-2.3 (22B) | 16 GB: draft previews in FP8 (distilled pipeline) | 24 GB: FP4, clips up to ~97 frames | 32 GB: FP8 (official minimum) | 48 GB+: BF16 (~43 GB file) | Lightricks, wagi z stycznia i marca 2026. Wideo z zsynchronizowanym dźwiękiem, do 4K, i szybkie: około 90 sekund na 5-sekundowy klip na RTX 4090. Kosztem jest pamięć; Lightricks zaleca też ponad 100 GB wolnego miejsca na dysku. |
System RAM | 32 GB workable minimum | 64 GB comfortable for 14B models on 12-24 GB cards | Offloading przenosi część modelu do zwykłej pamięci RAM, więc pamięć systemowa jest ważniejsza dla wideo niż dla obrazów. |
Dysk | fast NVMe SSD | Modele wideo mają po kilkadziesiąt GB każdy; ładowanie z wolnego dysku dodaje minuty do każdej zmiany modelu. |
Wan 2.5-3.0, Kling, Veo, Runway, Seedance | API only | Brak wag do pobrania, więc brak danych o VRAM; płacisz za sekundę wideo. Wan 2.2 to najnowszy Wan z wagami (stan na październik 2026). |
AD

Wideo bez karty 24 GB
BitVector Prism uruchamia Wan i LTX z tego przewodnika na własnych GPU: wybierz model, wrzuć klatkę lub wpisz prompt, odbierz klip w przeglądarce. Nic do instalowania, bez offloadingu.
Krok po kroku
- Sprawdź swoją VRAM: Menedżer zadań Windows > Wydajność > GPU > Dedykowana pamięć GPU; nvidia-smi na Linuxie. Sprawdź też pamięć systemową; 32 GB to minimum do offloadingu.
- Wybierz wiersz modelu dla swojej karty z tabeli: 8 GB to Wan 2.1 1.3B lub Wan 2.2 5B GGUF; 12-16 GB dodaje Wan 2.2 14B GGUF i HunyuanVideo 1.5 z offloadingiem; 24 GB to popularna karta do wideo (5B pełna precyzja, 14B FP8, LTX-2 FP4); 32 GB uruchomi wszystko w 720p w FP8.
- Pobierz precyzję, którą podaje strona modelu dla twojego poziomu (FP8 dla 24-32 GB, GGUF Q4-Q5 dla 12-16 GB), a nie oryginalne BF16.
- Zacznij od 480p i krótkich klipów (49-81 klatek). Dopasuj ruch i kompozycję, potem powiększ lub renderuj ponownie w 720p. Przejście z 480p na 720p mniej więcej podwaja pamięć na klatkę, więc workflow na 14 GB przy 480p może wymagać 24 GB lub więcej przy 720p.
- Dla Wan 2.2 14B na 24 GB przenieś enkoder tekstu T5/UMT5 do pamięci systemowej (CPU device w loaderze lub automatyczny offload ComfyUI). Bez tego klip 720p może przekroczyć 24 GB w trakcie.
- Dla klipów dłuższych niż 5-6 sekund generuj je segmentami i łącz: ostatnia klatka jednego klipu staje się obrazem startowym następnego. Większość otwartych modeli jest dostrojona na około 5 sekund i traci jakość powyżej tego.
- Jeśli klip nadal się nie mieści, obniż liczbę klatek przed rozdzielczością, użyj dekodowania VAE w kafelkach i wyłącz przeglądarkę oraz gry na GPU.
- Jeśli potrzebujesz regularnie Wan 2.2 14B lub LTX-2 w 720p i masz mniej niż 24 GB, uruchamiaj je w chmurze:PirateDiffusiondziała na serwerowych GPU z Telegrama;BitVectorz aplikacji webowej.
Przykłady
Wan 2.2 14B image-to-video na 24 GB (ComfyUI)
UNETLoader x2: wan2.2_i2v_high_noise_14B_fp8_scaled, wan2.2_i2v_low_noise_14B_fp8_scaled | CLIPLoader: umt5_xxl_fp8_e4m3fn_scaled, device: cpu | Load VAE: wan_2.1_vae
WanImageToVideo: 832x480, 81 frames | KSamplerAdvanced high (steps 0-10, cfg 3.5) -> KSamplerAdvanced low (steps 10-20, cfg 3.5) | shift 5 | VAE Decode (Tiled)
Wan 2.2 5B na karcie 8-12 GB
UnetLoaderGGUF: wan2.2_ti2v_5B_Q8_0.gguf | CLIPLoader: umt5_xxl_fp8 (cpu) | 1280x704 is the native 720p shape; start at 832x480, 49 frames, 20 steps
python main.py --lowvram
Ten sam klip w chmurze
/workflow /run:wan22-i2v slow dolly in, she looks up and smiles, soft wind in her hair /length:81 (reply to your image on PirateDiffusion)
Porady
- Podawane czasy dla pojedynczego 5-sekundowego klipu: Wan 2.1 1.3B 480p około 4 minuty na RTX 4090; Wan 2.2 5B 720p poniżej 9 minut (oficjalnie); Wan image-to-video około 12,7 minuty na 4090 vs około 7 na 5090 (około 45% szybciej w jednym opublikowanym teście); LTX-2 około 90 sekund na 4090. Offloading może spowolnić to kilka razy.
- Liczba 80 GB podana przez Alibaba dla Wan 2.2 A14B dotyczy pełnej precyzji bez offloadingu; FP8 i GGUF plus enkoder tekstu w pamięci systemowej to sposób, w jaki wszyscy to faktycznie uruchamiają.
- Dwa eksperci 14B oznaczają dwa pliki: sprawdź na stronie modelu, na którym ekspercie trenowanoLoRA(wysoki szum lub niski); załadowanie na złym ekspercie nic nie daje.
- LTX-2 wymienia pamięć na szybkość i dźwięk; jeśli zmieścisz FP8 na 32 GB, to najszybsza otwarta droga do gotowego klipu z dźwiękiem.
- 5090 kosztowała 1 999 dolarów, ale w październiku 2026 sprzedawała się za około 4 500-6 000 i nadal nie mieści modeli pełnej precyzji. Dla okazjonalnego wideo wynajem GPU 48 lub 80 GB na godziny albo abonament w chmurze jest tańszy i dużo szybszy niż offloading na mniejszej karcie.
- Strony rodzin Wan, Hunyuan iLTXna tym serwisie pokazują każdą wersję do pobrania z rozmiarem pliku; wariant potrzebuje rozmiaru pliku plus 3-4 GB wolnej VRAM, żeby działać płynnie.
Rozwiązywanie problemów
CUDA out of memory w trakcie klipu 720p na 24 GB
Dlaczego tak się dzieje
Enkoder tekstu jest nadal w VRAM razem z aktywnym ekspertem 14B.
Jak to naprawić
Załaduj enkoder UMT5 na CPU lub zmniejsz do 480p; zobacz przewodnik
CUDA out of memory
dla pełnej listy.
Mieści się w pamięci, ale trwa 40 minut
Dlaczego tak się dzieje
Duży offloading do pamięci systemowej lub GGUF Q4 na karcie, która mogłaby uruchomić FP8.
Jak to naprawić
Skróć klip, obniż rozdzielczość lub użyj największej precyzji, która pozostaje w pamięci; sprawdź, czy "Shared GPU memory" w Menedżerze zadań jest bliskie zeru.
Przewodnik HunyuanVideo mówi 60-80 GB
Dlaczego tak się dzieje
Opisuje oryginalny 13B HunyuanVideo, nie HunyuanVideo 1.5 (8,3B).
Jak to naprawić
Użyj 1.5: około 14 GB z offloadingiem, 24 GB komfortowo.
LTX-2 nie załaduje się na 16 GB
Dlaczego tak się dzieje
Pasuje tylko destylowany pipeline FP8; pełny model potrzebuje 24 GB (FP4) lub 32 GB (FP8).
Jak to naprawić
Używaj destylowanego podglądu do szkiców, a finalne rendery na większej karcie lub w chmurze.
Długi klip rozpada się po 6 sekundach
Dlaczego tak się dzieje
Otwarte modele są dostrojone na około 5 sekund; pamięć i jakość spadają powyżej tego.
Jak to naprawić
Łącz segmenty po 5 sekund z ostatnią klatką; potem powiększaj i interpoluj.
Nie można znaleźć wag Wan 2.5 lub 3.0
Dlaczego tak się dzieje
To wydania tylko z API.
Jak to naprawić
Wan 2.2 to najnowszy Wan, który możesz uruchomić lokalnie; strona rodziny Wan śledzi zmiany.
AD

Wan 2.2 14B, LTX-2 i H3 z Telegrama
PirateDiffusion hostuje duże modele wideo w pełnej precyzji i wysyła gotowy klip do twojego czatu. Nieograniczone generowanie za stałą miesięczną opłatą, mniej niż miesięczna cena 5090 rocznie.
Pytania
Czy mogę robić AI wideo z 8 GB VRAM?
Tak, ale tylko krótkie, niskorozdzielcze klipy. Wan 2.1 1.3B robi klipy 480p na około 8 GB, a Wan 2.2 5B działa jako plik GGUF z offloadingiem. Wan 2.2 14B, HunyuanVideo i LTX-2 potrzebują więcej.
Czy 24 GB wystarczy do AI wideo?
Dla większości tak. Karta 24 GB uruchomi Wan 2.2 5B w pełnej precyzji, Wan 2.2 14B w FP8 (720p z offloadowanym enkoderem tekstu), HunyuanVideo 1.5 i LTX-2 w FP4. To najpopularniejsza karta do lokalnej pracy z wideo.
Dlaczego Wan 2.2 mówi, że potrzebuje 80 GB?
To liczba dla modelu 14B w pełnej precyzji bez offloadingu. Z FP8 lub plikami GGUF i enkoderem tekstu w pamięci systemowej działa na 24 GB, a na 12-16 GB wolniej.
Czy RTX 5090 jest wart do AI wideo?
Jeśli często robisz wideo, dodatkowe 8 GB ponad 4090 (32 vs 24) pozwala komfortowo robić 720p z Wan 2.2 14B i FP8 LTX-2, i jest około 45% szybszy. Przy cenie 2-3 razy wyższej niż startowa 1 999 dolarów, wynajem jest tańszy dla tych, którzy nie generują wideo codziennie.
Czy HunyuanVideo potrzebuje więcej VRAM niż Wan?
HunyuanVideo 1.5 (8,3B) potrzebuje mniej niż Wan 2.2 14B: około 14 GB z offloadingiem. Oryginalny HunyuanVideo (13B) potrzebuje dużo więcej, więc sprawdź, o której wersji mówi przewodnik.
Ile pamięci systemowej?
32 GB to minimum do pracy z Wan 2.2 i HunyuanVideo z offloadingiem; 64 GB jest komfortowe dla modeli 14B na kartach 12-24 GB.
Linki i źródła
- Wan 2.2 official repository (requirements, timings)
- HunyuanVideo 1.5 on Hugging Face
- LTX-2 hardware notes (Lightricks)
- ComfyUI GGUF loaders
- Wan family page
- Hunyuan family page
- LTX-2 family page
- PirateDiffusion
- BitVector web app
Modele w tym poradniku
Autor
P.I. Panda
Powiązane poradniki
Błędy i rozwiązania
Wymagania VRAM dla popularnych modeli AI do obrazów i wideo (2026): pełna precyzja, FP8 i GGUF
Ile VRAM potrzebujesz dla SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein i Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 i LTX-2, w pełnej precyzji, FP8 i 4-bit GGUF, jaka karta i licencja są wygodne dla każdego, co potrafi każda karta od 8 do 48 GB i kolejność poprawek, gdy model się nie mieści.
Autor: P.I. Panda
2026-10-06
Modele wideo
Wan 2.2 video: konfiguracja text-to-video i image-to-video, ustawienia i LoRA
Pierwsze wyniki z Wan 2.2: który rozmiar modelu wybrać (5B czy 14B), para ekspertów wysokoszumowy / niskoszumowy, rozdzielczość i liczba klatek, które działają, błyskawiczne LoRA skracające renderowanie do czterech kroków, struktura promptu dla ruchu i jak uruchomić model na hostingu, gdy karta jest za mała.
Autor: Captain
2026-05-24
Błędy i rozwiązania
CUDA brak pamięci: ile VRAM potrzebuje każdy model AI i jak go zmieścić
Tabela VRAM dla SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 i HunyuanVideo oraz techniki pozwalające zmieścić model: kwantyzacja fp8 i GGUF, offload na CPU, kafelkowy VAE, limity rozdzielczości i klatek oraz kiedy przestać walczyć i uruchomić model w chmurze.
Autor: Captain
2026-05-18
Błędy i rozwiązania
Przewodnik po GPU i VRAM dla AI do obrazów i wideo: czego potrzebuje każdy model i co kupić (a czego nie)
Ile pamięci graficznej naprawdę potrzebuje każda rodzina modeli przy użytecznej prędkości (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), co daje kwantyzacja fp8 i GGUF, dlaczego ważna jest też pamięć systemowa i dysk, lista kart od 8 do 32 GB, uwagi o Mac i AMD oraz moment, w którym wynajem jest tańszy niż zakup.
Autor: Quartermaster
2026-01-07
Modele
LTX 2.3 Crisp Enhance: ostrzejsze, bardziej kinowe detale wideo
LoRA Crisp Enhance od vrgamedevgirl do LTX 2.3 zwiększa ostrość, mikrodetale i kontrast w generowanym wideo. Dowiedz się, jak wyważyć ją z jej łagodniejszą siostrą Soft Enhance, jakie stosować wagi i pomysły na prompt.
Autor: Captain
2026-10-03
Usługi w chmurze
PirateDiffusion: uruchamiaj dowolny model z Telegrama, bez potrzeby GPU
Najważniejsze komendy w bocie PirateDiffusion na Telegramie: /render z triggerami modelu, ważenie (( )) i [[ ]], #recipes, /adetailer, skalowanie /highdef i /facelift, /remix, /inpaint, workflowy ComfyUI z /wf /run:, oraz nowe umiejętności //, które same wybierają model.
Autor: Captain
2026-10-03
Więcej poradników
Modele
FLUX.1 Dev: jak go promptować, najlepsze ustawienia i pomysły kreatywne
Praktyczny przewodnik po FLUX.1 Dev od Black Forest Labs: naturalne promptowanie, ustawienia guidance i kroków, nakładanie LoRA, renderowanie tekstu i pomysły na prompt, które wykorzystują jego mocne strony.
Autor: Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompt, ustawienia i co nadal robi najlepiej
Jak wyciągnąć najwięcej z oficjalnego modelu bazowego SDXL 1.0: natywne rozdzielczości, ustawienia CFG i samplerów, refiner, negatywne prompt i pomysły na style, w których SDXL nadal błyszczy.
Autor: Captain
2026-10-01
Modele
Stable Diffusion 1.5: klasyczny model, używany właściwie
Stable Diffusion 1.5 wciąż warto znać: odpowiednia rozdzielczość, CFG i sampler, jak korzystać z ogromnej biblioteki LoRAs i embeddingów oraz pomysły na kreatywne prompta dopasowane do modelu 512-pikselowego.
Autor: Captain
2026-10-02
Modele
FLUX.2 Dev: jak korzystać z najnowszego modelu Black Forest Labs
FLUX.2 Dev obsługuje dłuższe prompt’y, lepszy tekst, silniejszy realizm i edycję z wieloma odniesieniami. Ten przewodnik pokazuje turbo workflow, ustawienia guidance i rozdzielczości, strukturę prompta oraz pomysły wykorzystujące nowe możliwości.
Autor: Captain
2026-10-03
Modele
Qwen-Image: długie prompt’y, idealny tekst i dwujęzyczne plakaty
Qwen-Image to model, do którego sięgasz, gdy liczą się słowa na obrazku. Naucz się pisać jego długie, opisowe prompt’y, dokładnie odwzorowywać tekst po angielsku i chińsku, ustawiać CFG i kroki oraz odkrywać pomysły na kreatywne projekty z dużą ilością układu.
Autor: Captain
2026-09-29
Modele
SDXL-Lightning: generowanie w czterech krokach na dowolnym checkpointcie SDXL
LoRA SDXL-Lightning od ByteDance zmienia renderowanie SDXL z 30 kroków na 4 kroki. Dowiedz się, ile kroków używać, jaką wartość CFG ustawić, jaki sampler wybrać i jak połączyć to z ulubionymi checkpointami i style LoRA.
Autor: Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Wyprodukowano w Japonii
|
© 2026