Model
Trends
.ai
Model
Trends
.ai
najlepsze otwarte modele AI

Generowanie wideo AI dla początkujących: obraz na wideo, tekst na wideo i pierwszy klip z Wan, LTX-2 i H3

Temat: Modele wideo
Autor: Lookout
Opublikowano 2026-04-29
Pierwszy tydzień z otwartymi modelami wideo: różnica między tekstem na wideo a obrazem na wideo i dlaczego warto zacząć od tego drugiego, trzy rodziny modeli warte poznania (Wan 2.2, LTX-2, MiniMax H3), liczba klatek i rozdzielczości, które działają, jak napisać prompt ruchu, czego się spodziewać po karcie 16 lub 24 GB w porównaniu z chmurą oraz jak zamienić pięciosekundowe klipy w coś dłuższego.

Przegląd

Modele wideo to modele obrazów z osią czasu: ta sama pętla denoisingu działa na bloku klatek naraz, więc wszystko, co wiesz o promptach, seedach i denoise, się przenosi, podobnie jak koszty, pomnożone przez liczbę klatek. Praktyczne konsekwencje dla początkującego są trzy. Zacznij od image-to-video (I2V), bo dobry statyczny obraz z modelu obrazowego ustawia kompozycję i styl, a model wideo musi wymyślić tylko ruch. Trzymaj klipy krótkie (około pięciu sekund), bo na tym model był trenowany. I spodziewaj się uruchamiać duże modele w chmurze, chyba że masz kartę 24 GB.
Trzy otwarte rodziny pokrywają większość potrzeb w 2026.
Wan 2.2
(Alibaba) to uniwersalny model: 5B działający na 12-16 GB i 14B z dwoma ekspertami o najlepszej jakości otwartej, plus ogromny ekosystem
LoRA
do ruchu i stylu.
LTX-2
(Lightricks) jest szybki i generuje zsynchronizowany dźwięk, ale wymaga 24-32 GB.
MiniMax H3
to model audio-wideo z dialogami i efektami dźwiękowymi, głównie używany przez hostowane workflow; przewodniki po promptach H3 na tej stronie autorstwa Marka White’a są bardzo szczegółowe.
Hunyuan
Video 1.5 to lżejsza alternatywa dla
Wan
14B.
Katalog wymienia każdy model wideo i jego LoRA z bazą i rozmiarem, na który są skierowane (5B lub 14B, ekspert wysokoszumowy lub niskoszumowy), a strony modeli pokazują przykładowe klipy z ich promptami. Przycisk Run otwiera model na
PirateDiffusion
, gdzie komenda workflow tworzy klip z odpowiedzi na twój obraz, lub na
BitVector
.

Odniesienie

Nazwa
Typ
Co to jest
I2V (image to video)
mode
Animuj statyczny obraz. Najlepszy pierwszy tryb: kompozycja jest już dobra; prompt opisuje tylko ruch.
T2V (text to video)
mode
Tylko z promptu. Więcej różnorodności, mniej kontroli; używaj do pomysłów i ujęć B-roll.
FLF2V / first-last frame
mode
Dwie klatki kluczowe; model wypełnia ruch między nimi. Kontrolowane przejścia.
Frames and fps
setting
Wan: 81 klatek przy 16 fps (5 s); LTX-2: 97-121 klatek przy 24-25 fps; H3: 145 klatek przy ~24 fps. Pamięć rośnie z liczbą klatek.
Resolution
setting
Wan 2.2: 832x480 lub 480x832 (szybko), 1280x720 (24 GB+); LTX-2 do 1080p+ z 32 GB. Portret dla ludzi, krajobraz dla scen.
Motion prompt
prompt
Ruch jednego obiektu plus ruch kamery: "ona odwraca się do okna i się uśmiecha; powolne przybliżenie". Unikaj wymieniania szczegółów sceny już widocznych na obrazie.
Steps / CFG / shift
setting
Wan 2.2 14B: 20 kroków podzielonych 10/10 na ekspertów,
CFG
3.5, shift 5; 5B: 20-30 kroków, CFG 5; LTX-2: 25-30 kroków z własnym harmonogramem; destylowane LoRA (lightx2v) skracają Wan do 4-8 kroków przy CFG 1.
Motion LoRAs
file
Ruchy kamery, tańce, gesty, fizyka; dopasowane do 5B/14B i eksperta. Strony tu podają cel.
Interpolation and upscale
post
RIFE lub FILM do 32-60 fps; ESRGAN klatka po klatce lub SeedVR do rozdzielczości.
AD
Twój pierwszy klip bez GPU
BitVector Prism animuje statyczny obraz z modelami Wan z tego przewodnika w przeglądarce: załaduj obraz, napisz zdanie o ruchu, pobierz klip. Nic do instalacji, działa na laptopie.

Krok po kroku

  1. Zrób lub wybierz statyczny obraz: render 1024x1024 lub 832x1216 z wyraźnym obiektem i prostym tłem. Twarze większe niż jedna dziesiąta klatki animują się najlepiej.
  2. Otwórz stronę modelu Wan 2.2 I2V na tej stronie, skopiuj wzór przykładowego promptu ruchu i kliknij Run (PirateDiffusion: odpowiedz na swój obraz komendą /workflow; BitVector: załaduj i wybierz model).
  3. Napisz prompt ruchu: jedno zdanie o obiekcie i jedno o kamerze. Nic o ubraniach, kolorach czy oświetleniu; to jest na obrazie.
  4. Generuj w 832x480 (krajobraz) lub 480x832 (portret), 81 klatek, domyślne kroki. Obejrzyj cały klip; oceniaj ruch, nie ostrość.
  5. Poprawiaj tylko prompt ruchu: wolniejsze czasowniki ("powoli", "delikatnie") zmniejszają chaotyczne ruchy; jedna instrukcja kamery zapobiega skokom.
  6. Lokalnie, z kartą 16 GB:
    Wan 2.2 5B
    fp8 lub GGUF, 832x480, 49-81 klatek, enkoder tekstu na CPU. Z 24 GB: 14B fp8 przy 480p, 720p z wyłączonym enkoderem. Zobacz przewodnik
    VRAM
    dla wideo AI.
  7. Dłuższe kawałki: weź ostatnią klatkę pierwszego klipu jako obraz startowy drugiego z kontynuowanym promptem ruchu; połącz w edytorze; interpoluj do 30 fps i podbij rozdzielczość na końcu.
  8. Dodaj dźwięk: LTX-2 i H3 generują audio z klipem; w Wan dodaj muzykę lub efekty w edytorze.

Przykłady

Prompt ruchu dla I2V

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

Komenda workflow PirateDiffusion

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B na 16 GB

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

Porady

  • Czasowniki ruchu są ważniejsze niż przymiotniki: "obraca się, chodzi, podnosi, nalewa, macha" dają wyraźny, pewny ruch; "piękny, kinowy" nic nie da.
  • Jeden ruch kamery na klip: przybliżenie, oddalenie, panoramowanie w lewo, orbitowanie. Dwa ruchy dają drgania.
  • Portretowe statyki lepiej animują twarze; krajobrazowe lepiej animują otoczenie.
  • Wan LoRA dla eksperta wysokoszumowego kształtuje ruch; niskoszumowy kształtuje detale. Wiele pakietów ma oba; ładuj każdy na swojego eksperta.
  • Destylowane LoRA (lightx2v, FastWan) skracają Wan z 20 kroków do 4-6 przy CFG 1 bez dużej utraty jakości; strony modeli je wymieniają.
  • Spodziewaj się 3-10 minut na klip na 4090 dla Wan 14B i około 90 sekund dla LTX-2; chmura zwraca większość klipów w minutę lub dwie.

Rozwiązywanie problemów

Klip jest statyczny z lekkim migotaniem

Dlaczego tak się dzieje
Brak czasownika ruchu w promptcie lub zbyt wysoka waga statycznej LoRA.

Jak to naprawić
Dodaj ruch obiektu i ruch kamery; zmniejsz LoRA do 0.7.

Twarz się rozmywa lub zmienia tożsamość

Dlaczego tak się dzieje
Twarz za mała, za dużo klatek lub 480p na szczegółowej twarzy.

Jak to naprawić
Przytnij bliżej, 49-61 klatek lub 720p w chmurze; ostatnia deska ratunku to poprawka twarzy na każdą klatkę.

Skoki kamery lub cięcia sceny

Dlaczego tak się dzieje
Dwie instrukcje kamery lub słowa "cut to" w promptcie.

Jak to naprawić
Jeden ruch kamery; wpisz "jump cut" w negatywnym.

Brak pamięci przy 720p

Dlaczego tak się dzieje
Liczba klatek razy rozdzielczość przekracza VRAM.

Jak to naprawić
Zmień na 480p lub mniej klatek, odciąż enkoder tekstu; zobacz przewodnik VRAM dla wideo AI.

LoRA ruchu nic nie robi

Dlaczego tak się dzieje
Załadowano na złego eksperta lub zły rozmiar modelu.

Jak to naprawić
Sprawdź stronę modelu dla 5B/14B i wysokiego/niskiego szumu; ładuj zgodnie z triggerem.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 i H3 z Telegrama
PirateDiffusion uruchamia duże modele wideo na serwerowych GPU: odpowiedz na dowolny obraz komendą workflow, a klip wróci na czacie. Nieograniczone generowanie za stałą cenę, bez potrzeby karty 24 GB.

Pytania

Który model wideo na początek?

Wan 2.2 I2V: wyrozumiały, dobrze udokumentowany, najwięcej LoRA. Przewodnik startowy Wan ma pełną konfigurację.

Czy mogę to zrobić na karcie 8 GB?

Krótkie klipy 480p z
Wan 2.1
1.3B lub Wan 2.2 5B GGUF, powoli. Realistycznie zacznij w chmurze.

Jak zdobyć dźwięk?

LTX-2 i MiniMax H3 generują zsynchronizowany dźwięk; przewodniki Marka White’a po promptach H3 wyjaśniają dialogi i efekty.

Jak długi może być klip?

Około pięciu sekund natywnie. Dłuższe kawałki to łączone klipy; jakość spada po sześciu do ośmiu sekundach w jednym przebiegu.

Czy najnowsze modele komercyjne (Veo, Kling, Wan 3.0) są dostępne lokalnie?

Nie; są tylko przez API. Wszystko w tym przewodniku to otwarte wagi i działa lokalnie lub w chmurze partnerów.

Linki i źródła

Modele w tym poradniku

Autor
Lookout

Powiązane poradniki

Modele wideo
Wan 2.2 video: konfiguracja text-to-video i image-to-video, ustawienia i LoRA
Pierwsze wyniki z Wan 2.2: który rozmiar modelu wybrać (5B czy 14B), para ekspertów wysokoszumowy / niskoszumowy, rozdzielczość i liczba klatek, które działają, błyskawiczne LoRA skracające renderowanie do czterech kroków, struktura promptu dla ruchu i jak uruchomić model na hostingu, gdy karta jest za mała.
Autor: Captain
2026-05-24
Modele wideo
Ile VRAM potrzebujesz do AI wideo? Wan 2.2, HunyuanVideo 1.5 i LTX-2 według wielkości GPU (2026)
Ilość VRAM potrzebna do uruchomienia Wan 2.2, HunyuanVideo 1.5 i LTX-2 lokalnie, według wielkości GPU, rozdzielczości i długości klipu: co potrafią karty 8, 12-16, 24, 32 i 48+ GB, dlaczego wideo kosztuje sto razy więcej niż obraz, triki z offloadingiem, które mieszczą modele 14B na 24 GB, realistyczne czasy generowania i kiedy wynajem jest lepszy niż kupno.
Autor: P.I. Panda
2026-10-06
Promptowanie
Promptowanie MiniMax H3: tekst na wideo, obraz na wideo, wideo referencyjne i audio
Jak kierować MiniMax H3 za pomocą komendy w czacie: przepis WHO + WHERE + ACTION + CAMERA + SOUND dla tekstu na wideo, animowanie statycznego obrazu w obraz na wideo, przypisywanie każdemu obrazowi referencyjnemu zadania w trybie referencyjnym oraz uzyskiwanie czystego dialogu zamiast mamrotania. Z gotowymi promptami do kopiowania i testowania oraz PDF-em autora.
Autor: Mark White
2026-09-20
Modele wideo
MiniMax H3 video prompts: oficjalna struktura
Jak MiniMax chce, żeby pisać prompt H3: linia wyrównania dla wideo osadzonego na obrazie, trzy główne pola, ujęcia i cięcia, ruchy kamery, ID mówców i tagi dialogowe, dźwięk i muzyka. Skrócone z oficjalnego przewodnika po pisaniu promptów.
Autor: Captain
2026-09-14
Modele
LTX 2.3 Crisp Enhance: ostrzejsze, bardziej kinowe detale wideo
LoRA Crisp Enhance od vrgamedevgirl do LTX 2.3 zwiększa ostrość, mikrodetale i kontrast w generowanym wideo. Dowiedz się, jak wyważyć ją z jej łagodniejszą siostrą Soft Enhance, jakie stosować wagi i pomysły na prompt.
Autor: Captain
2026-10-03
Błędy i rozwiązania
Przewodnik po GPU i VRAM dla AI do obrazów i wideo: czego potrzebuje każdy model i co kupić (a czego nie)
Ile pamięci graficznej naprawdę potrzebuje każda rodzina modeli przy użytecznej prędkości (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), co daje kwantyzacja fp8 i GGUF, dlaczego ważna jest też pamięć systemowa i dysk, lista kart od 8 do 32 GB, uwagi o Mac i AMD oraz moment, w którym wynajem jest tańszy niż zakup.
Autor: Quartermaster
2026-01-07

Więcej poradników

Modele
FLUX.1 Dev: jak go promptować, najlepsze ustawienia i pomysły kreatywne
Praktyczny przewodnik po FLUX.1 Dev od Black Forest Labs: naturalne promptowanie, ustawienia guidance i kroków, nakładanie LoRA, renderowanie tekstu i pomysły na prompt, które wykorzystują jego mocne strony.
Autor: Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompt, ustawienia i co nadal robi najlepiej
Jak wyciągnąć najwięcej z oficjalnego modelu bazowego SDXL 1.0: natywne rozdzielczości, ustawienia CFG i samplerów, refiner, negatywne prompt i pomysły na style, w których SDXL nadal błyszczy.
Autor: Captain
2026-10-01
Modele
Stable Diffusion 1.5: klasyczny model, używany właściwie
Stable Diffusion 1.5 wciąż warto znać: odpowiednia rozdzielczość, CFG i sampler, jak korzystać z ogromnej biblioteki LoRAs i embeddingów oraz pomysły na kreatywne prompta dopasowane do modelu 512-pikselowego.
Autor: Captain
2026-10-02
Modele
FLUX.2 Dev: jak korzystać z najnowszego modelu Black Forest Labs
FLUX.2 Dev obsługuje dłuższe prompt’y, lepszy tekst, silniejszy realizm i edycję z wieloma odniesieniami. Ten przewodnik pokazuje turbo workflow, ustawienia guidance i rozdzielczości, strukturę prompta oraz pomysły wykorzystujące nowe możliwości.
Autor: Captain
2026-10-03
Modele
Qwen-Image: długie prompt’y, idealny tekst i dwujęzyczne plakaty
Qwen-Image to model, do którego sięgasz, gdy liczą się słowa na obrazku. Naucz się pisać jego długie, opisowe prompt’y, dokładnie odwzorowywać tekst po angielsku i chińsku, ustawiać CFG i kroki oraz odkrywać pomysły na kreatywne projekty z dużą ilością układu.
Autor: Captain
2026-09-29
Modele
SDXL-Lightning: generowanie w czterech krokach na dowolnym checkpointcie SDXL
LoRA SDXL-Lightning od ByteDance zmienia renderowanie SDXL z 30 kroków na 4 kroki. Dowiedz się, ile kroków używać, jaką wartość CFG ustawić, jaki sampler wybrać i jak połączyć to z ulubionymi checkpointami i style LoRA.
Autor: Captain
2026-09-30