Model
Trends
.ai
Model
Trends
.ai
najlepsze otwarte modele AI

Wan 2.2 video: konfiguracja text-to-video i image-to-video, ustawienia i LoRA

Temat: Modele wideo
Autor: Captain
Opublikowano 2026-05-24
Share

Przegląd

Wan 2.2
to otwarta rodzina modeli wideo od Alibaba i najczęściej pobierany model wideo na tej stronie. Jest dostępny jako hybrydowy model 5B do text- i image-to-video, stworzony pod karty konsumenckie (720p na 8 do 12 GB), oraz jako modele 14B text-to-video i image-to-video, które używają dwóch ekspertów: model wysokoszumowy, który ustawia ruch i kompozycję w pierwszych krokach, oraz model niskoszumowy, który dodaje szczegóły w ostatnich krokach. Para 14B daje kinowe efekty, które ludzie udostępniają; model 5B jest do nauki.
Społeczność wytrenowała setki
Wan
LoRA
: ruchy kamery (orbit, dolly, crash zoom), style ruchu, postacie, efekty oraz błyskawiczne / destylacyjne LoRA, które skracają renderowanie z 30 kroków do 4-8 z niewielką stratą jakości. Strona rodziny Wan klasyfikuje je według popularności; błyskawiczne LoRA prawie zawsze są na szczycie.
Opcje na hostingu dobrze sprawdzają się przy wideo, bo renderowanie jest długie i wymaga dużo
VRAM
:
PirateDiffusion
uruchamia Wan z Telegrama przez /wf /run, a
BitVector
ma gotowe grafy Wan z LoRA. Oba są podlinkowane w polu Run na każdej stronie modelu Wan.

Odniesienie

Nazwa
Typ
Co to jest
Wan2.2-TI2V-5B
model
Jeden model do text- i image-to-video, 720p przy 24 fps, max 121 klatek. fp16 10 GB, fp8 5 GB. Karty 8 do 12 GB.
Wan2.2-T2V-A14B / I2V-A14B
model pair
Eksperci wysokoszumowy i niskoszumowy, po 14B każdy (łącznie 27B, aktywny 14B). 480p i 720p. fp8 około 14 GB każdy; GGUF Q4 około 8 GB każdy.
umt5-xxl text encoder
file
fp8 skalowany (6 GB) lub fp16 (11 GB). Wspólny dla wszystkich modeli Wan.
Wan 2.1
/ 2.2 VAE
file
Model 5B używa VAE 2.2; modele 14B używają VAE 2.1. Mieszanie ich daje śmieci.
Resolution
setting
480x832 lub 832x480 do szybkich testów; 720x1280 / 1280x720 do finalnych. Wielokrotności 16.
Frames
setting
4n+1: 33, 49, 65, 81. 81 klatek przy 16 fps to pięć sekund.
Steps / shift /
CFG
setting
20 do 30 kroków, shift 5 do 8,
CFG
3.5 do 5 bez lightning. Z lightning LoRA: 4 do 8 kroków, CFG 1, shift 5.
Lightning / distill
LoRA
Osobne LoRA dla eksperta wysokoszumowego i niskoszumowego; ładuj każdą na osobnym modelu. Waga 1.0.
Prompt
text
Temat, akcja, kamera, oświetlenie, styl, w tej kolejności. Opisuj ruch czasownikami. Wan używa negatywnego promptu (w przeciwieństwie do
Flux
).
AD
Bez instalacji – uruchamiaj modele AI w chmurze
BitVector Prism to najprostszy sposób na start: wybierz model, wpisz prompt i generuj w przejrzystej aplikacji webowej, bez żadnej konfiguracji. BitVector jest też dostępny na Discordzie i w sieci (SpyGlass).

Krok po kroku

  1. Zainstaluj loadery:
    ComfyUI
    core obsługuje Wan 2.2; dodaj ComfyUI-GGUF dla plików kwantyzowanych. Najpierw zaktualizuj ComfyUI.
  2. Pobierz wersję dla swojej karty: 5B fp8 plus VAE 2.2 i umt5 fp8 na 8 do 12 GB; para 14B fp8 plus VAE 2.1 na 24 GB; para 14B GGUF Q4 na 12 do 16 GB.
  3. Załaduj oficjalny szablon (Workflow > Browse Templates > Video > Wan 2.2) i podmień loadery na swoje pliki. Dla GGUF zamień Load Diffusion Model na Unet Loader (GGUF).
  4. Dla 14B: dwa węzły KSampler Advanced. Pierwszy uruchamia model wysokoszumowy od kroku 0 do N/2 (zwraca z resztą szumu), drugi uruchamia model niskoszumowy od N/2 do N. Szablon ma to już połączone.
  5. Pierwszy render: 480x832, 33 klatki, 20 kroków, CFG 4, shift 8, prompt "a corgi runs along a beach at sunset, camera tracks alongside, golden light, shallow depth of field". Spodziewaj się 2 do 6 minut.
  6. Dodaj błyskawiczne LoRA ze strony rodziny Wan (po jednym dla każdego eksperta), ustaw kroki na 6 (3 + 3), CFG 1. Renderowanie spada poniżej minuty przy 480p.
  7. Image-to-video: załaduj parę I2V, podaj obraz do WanImageToVideo, w promptcie skup się na ruchu i kamerze, nie na opisie obrazu.
  8. Finalne: 720p, 81 klatek, interpoluj do 32 fps z RIFE lub FILM, jeśli trzeba, powiększaj za pomocą video upscalera z rodziny
    Upscalers
    .
  9. Za wolno lub za duże: uruchom ten sam workflow na BitVector lub na PirateDiffusion z /workflow /show:wan, żeby zobaczyć pola i /wf /run:wan z promptem.

Przykłady

Prompt text-to-video

A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image

Prompt image-to-video (tylko ruch)

The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight

PirateDiffusion

/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in

Porady

  • Opisuj ruch czasownikami i kamerę słowami filmowymi (wolny dolly in, handheld, statyczny szeroki plan). Wan bardzo dobrze rozumie język kamery.
  • Zachowaj negatywny prompt: oficjalny wymienia prześwietlenie, statyczność, rozmyte detale, napisy, najgorszą jakość, dodatkowe palce i pomaga to.
  • Dla I2V wygeneruj pierwszą klatkę Fluxem, Qwenem lub
    Z-Image
    w docelowym formacie; ostry, dobrze oświetlony obraz daje lepszy klip niż prompt.
  • Liczba klatek kosztuje więcej niż rozdzielczość: 81 klatek przy 480p jest tańsze niż 49 klatek przy 720p.
  • Motion LoRA dla Wan mają tagi eksperta, którego dotyczą; LoRA tylko niskoszumowa dodaje detale, LoRA wysokoszumowa zmienia ruch.
  • Seed jest bardzo ważny w wideo; trzymaj seed stały podczas dopracowywania promptu, potem zmieniaj dla różnych ujęć.
  • Zapisz workflow z zestawem LoRA jako szablon; grafy Wan są długie i łatwo je uszkodzić.

Rozwiązywanie problemów

Brak pamięci przy pierwszym samplerze

Dlaczego tak się dzieje
fp16 14B wagi na karcie 24 GB lub mniejszej.

Jak to naprawić
Para fp8 lub GGUF Q4, mniej klatek, 480p, --lowvram; albo model 5B.

Wideo jest rozmazane lub szum kolorów

Dlaczego tak się dzieje
Zły VAE (2.2 VAE z 14B lub 2.1 VAE z 5B), albo lightning LoRA bez CFG 1.

Jak to naprawić
Dopasuj VAE do modelu; z lightning LoRA ustaw CFG 1 i 4 do 8 kroków.

Prawie brak ruchu

Dlaczego tak się dzieje
Prompt opisuje scenę, nie akcję; albo za mało kroków na ekspercie wysokoszumowym.

Jak to naprawić
Dodaj czasowniki ruchu i ruchy kamery; daj ekspertowi wysokoszumowemu połowę kroków.

Obiekt zmienia się w połowie

Dlaczego tak się dzieje
Za dużo klatek na rozdzielczość, albo dwie sprzeczne LoRA.

Jak to naprawić
Skróć do 49 klatek, jedna LoRA ruchu na raz, zwiększ kroki na ekspercie niskoszumowym.

Dekodowanie nie powiodło się po udanym próbkowaniu

Dlaczego tak się dzieje
Dekodowanie VAE to szczyt pamięci dla wideo.

Jak to naprawić
Wan VAE dekoduj w kafelkach (opcja tiled na węźle decode), albo mniej klatek.

Ostrzeżenia o niezaładowanym kluczu LoRA

Dlaczego tak się dzieje
LoRA 2.1 na 2.2, albo LoRA 14B na model 5B.

Jak to naprawić
Dopasuj wersję i rozmiar; strona modelu podaje oba.

AD
PirateDiffusion
Bez instalacji – uruchamiaj modele AI w chmurze
PirateDiffusion działa tylko na Telegramie i jest stworzony dla profesjonalistów: tysiące modeli, LoRA i workflowów sterowanych komendami czatu, z nielimitowanym generowaniem w stałej cenie.

Pytania

5B czy 14B?

5B do nauki i na karty 8 do 12 GB; 14B do jakości, jeśli masz 24 GB lub używasz hostingu. Oba biorą te same prompt.

Jak długi jest klip?

Do 81 klatek (5 s przy 16 fps) dla 14B i 121 klatek (5 s przy 24 fps) dla 5B na render; dłuższe wideo składa się z kontynuacji ostatniej klatki.

Czy Wan robi dźwięk?

Wan 2.2 S2V animuje mówcę z audio, ale nie generuje dźwięku;
LTX-2
i
MiniMax H3
generują dźwięk z wideo (ich poradniki są na tej stronie).

Skąd są błyskawiczne LoRA?

Wydania destylacyjne od Lightx2v i innych; strona rodziny Wan pokazuje je z ocenami popularności i ekspertem, którego dotyczą.

Czy mogę uruchomić Wan bez GPU?

Tak: PirateDiffusion z Telegrama, BitVector w przeglądarce. Oba mają gotowe workflow i LoRA.

Linki i źródła

Modele w tym poradniku

Autor
Captain

Powiązane poradniki

Błędy i rozwiązania
CUDA brak pamięci: ile VRAM potrzebuje każdy model AI i jak go zmieścić
Tabela VRAM dla SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 i HunyuanVideo oraz techniki pozwalające zmieścić model: kwantyzacja fp8 i GGUF, offload na CPU, kafelkowy VAE, limity rozdzielczości i klatek oraz kiedy przestać walczyć i uruchomić model w chmurze.
Autor: Captain
2026-05-18
Błędy i rozwiązania
Błędy ComfyUI i jak je naprawić: czerwone węzły, brakujące modele, brak pamięci CUDA
Pierwsze komunikaty o błędach w ComfyUI, co każdy z nich oznacza i jak je naprawić: brakujące niestandardowe węzły (czerwone pola), „Prompt outputs failed validation”, brak pamięci CUDA, zły typ modelu w loaderze, błędy kształtu mat1 i mat2, problemy z deserializacją nagłówka, niezgodności torch i xformers.
Autor: Captain
2026-05-12
Modele wideo
MiniMax H3 video prompts: oficjalna struktura
Jak MiniMax chce, żeby pisać prompt H3: linia wyrównania dla wideo osadzonego na obrazie, trzy główne pola, ujęcia i cięcia, ruchy kamery, ID mówców i tagi dialogowe, dźwięk i muzyka. Skrócone z oficjalnego przewodnika po pisaniu promptów.
Autor: Captain
2026-09-14
Modele
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: którą rodzinę modeli wybrać w 2026
Praktyczne porównanie otwartych rodzin modeli obrazów: podążanie za promptem, realizm, anime i ilustracja, renderowanie tekstu, szybkość, VRAM, ekosystem LoRA i licencje, z rekomendacją dla każdego rodzaju pracy i sprzętu.
Autor: Captain
2026-05-22

Więcej poradników

Usługi w chmurze
Stała opłata vs tokeny: dlaczego nieograniczone plany jak Graydient.ai to najlepsza wartość dla twórców AI w 2026
Porównanie kosztów z 8 października 2026, pokazujące ceny stałych, nieograniczonych planów takich jak Graydient.ai w porównaniu do cen za tokeny i kredyty w Midjourney, Leonardo, fal.ai, Replicate, Runway i Kling: ile naprawdę kosztuje 1 000 obrazów i 1 000 filmów miesięcznie na każdej z tych usług i dlaczego jedna stała opłata za nieograniczoną liczbę obrazów, wideo, audio, czat Grok LLM i aplikacje webowe to najlepsza opcja dla twórców, którzy często poprawiają swoje prace.
Autor: Captain
2026-10-08
Modele
FLUX.1 Dev: jak go promptować, najlepsze ustawienia i pomysły kreatywne
Praktyczny przewodnik po FLUX.1 Dev od Black Forest Labs: naturalne promptowanie, ustawienia guidance i kroków, nakładanie LoRA, renderowanie tekstu i pomysły na prompt, które wykorzystują jego mocne strony.
Autor: Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompt, ustawienia i co nadal robi najlepiej
Jak wyciągnąć najwięcej z oficjalnego modelu bazowego SDXL 1.0: natywne rozdzielczości, ustawienia CFG i samplerów, refiner, negatywne prompt i pomysły na style, w których SDXL nadal błyszczy.
Autor: Captain
2026-10-01
Modele
Stable Diffusion 1.5: klasyczny model, używany właściwie
Stable Diffusion 1.5 wciąż warto znać: odpowiednia rozdzielczość, CFG i sampler, jak korzystać z ogromnej biblioteki LoRAs i embeddingów oraz pomysły na kreatywne prompta dopasowane do modelu 512-pikselowego.
Autor: Captain
2026-10-02
Modele
FLUX.2 Dev: jak korzystać z najnowszego modelu Black Forest Labs
FLUX.2 Dev obsługuje dłuższe prompt’y, lepszy tekst, silniejszy realizm i edycję z wieloma odniesieniami. Ten przewodnik pokazuje turbo workflow, ustawienia guidance i rozdzielczości, strukturę prompta oraz pomysły wykorzystujące nowe możliwości.
Autor: Captain
2026-10-03
Modele
Qwen-Image: długie prompt’y, idealny tekst i dwujęzyczne plakaty
Qwen-Image to model, do którego sięgasz, gdy liczą się słowa na obrazku. Naucz się pisać jego długie, opisowe prompt’y, dokładnie odwzorowywać tekst po angielsku i chińsku, ustawiać CFG i kroki oraz odkrywać pomysły na kreatywne projekty z dużą ilością układu.
Autor: Captain
2026-09-29