Generování AI videa pro začátečníky: z obrázku na video, z textu na video a první klip s Wan, LTX-2 a H3
Téma: Video modely
Autor: Lookout
Publikováno 2026-04-29
Přehled
Video modely jsou obrazové modely s časovou osou: stejný proces odšumu běží najednou na bloku snímků, takže všechno, co víš o promptech, semenech a odšumu, platí i tady, stejně jako náklady, které se násobí počtem snímků. Pro začátečníka to znamená tři věci. Začni s obrázkem na video (I2V), protože dobrý statický obrázek od obrazového modelu už vyřeší kompozici a styl a video model pak vymýšlí jen pohyb. Drž klipy krátké (asi pět sekund), protože na takových modelech se trénovalo. A počítej s tím, že velké modely poběží spíš v cloudu, pokud nemáš 24GB kartu.
Tři otevřené rodiny pokryjí většinu potřeb v roce 2026.
Wan 2.2
(Alibaba) je univerzál: 5B model, který běží na 12-16 GB, a 14B dvou-expertový model s nejlepší otevřenou kvalitou, plus obrovský ekosystém
LoRA
pro pohyb a styl.
LTX-2
(Lightricks) je rychlý a generuje synchronizovaný zvuk, ale chce 24-32 GB.
MiniMax H3
je audio-video model s dialogy a zvukovými efekty, většinou se používá přes hostované workflow; Mark White má na tomto webu podrobné návody na H3 promptování.
Hunyuan
Video 1.5 je lehčí alternativa k
Wan
14B.
Katalog uvádí každý video model a jeho LoRA s verzí a velikostí, na kterou cílí (5B nebo 14B, expert s vysokým nebo nízkým šumem), a stránky modelů ukazují ukázkové klipy s jejich promptem. Tlačítko Run otevře model na
PirateDiffusion
, kde workflow příkaz vytvoří klip z odpovědi na tvůj obrázek, nebo na
BitVector
.
Reference
Název | Typ | Co to je |
|---|---|---|
I2V (image to video) | mode | Oživit statický obrázek. Nejlepší první režim: kompozice už sedí; prompt popisuje jen pohyb. |
T2V (text to video) | mode | Jen z promptu. Větší variabilita, menší kontrola; použij pro nápady a doplňkové záběry. |
FLF2V / first-last frame | mode | Dva klíčové snímky; model vyplní pohyb mezi nimi. Kontrolované přechody. |
Frames and fps | setting | Wan: 81 snímků při 16 fps (5 s); LTX-2: 97-121 snímků při 24-25 fps; H3: 145 snímků při ~24 fps. Paměť roste s počtem snímků. |
Resolution | setting | Wan 2.2: 832x480 nebo 480x832 (rychlé), 1280x720 (24 GB+); LTX-2 až 1080p+ s 32 GB. Portrét pro lidi, krajina pro scény. |
Motion prompt | prompt | Jeden pohyb subjektu a jeden pohyb kamery: "otočí se k oknu a usměje se; pomalý přiblížení". Vyhni se popisu detailů scény, které už jsou na obrázku. |
setting | Wan 2.2 14B: 20 kroků rozdělených 10/10 mezi experty, CFG 3.5, shift 5; 5B: 20-30 kroků, CFG 5; LTX-2: 25-30 kroků s vlastním plánem; destilované LoRA (lightx2v) zkracují Wan na 4-8 kroků při CFG 1. | |
Motion LoRAs | file | Pohyby kamery, tance, gesta, fyzika; přizpůsobené 5B/14B a expertovi. Stránky tady uvádějí cílový model. |
Interpolation and upscale | post | RIFE nebo FILM na 32-60 fps; po snímcích ESRGAN nebo SeedVR pro rozlišení. |
AD

Tvůj první klip bez GPU
BitVector Prism oživí statický obrázek s Wan modely z tohoto průvodce přímo v prohlížeči: nahraj obrázek, napiš větu o pohybu, stáhni klip. Nic se neinstaluje, funguje i na notebooku.
Krok za krokem
- Vytvoř nebo vyber statický obrázek: render 1024x1024 nebo 832x1216 s jasným subjektem a jednoduchým pozadím. Nejlépe se animují tváře větší než desetina snímku.
- Otevři stránku modelu Wan 2.2 I2V na tomto webu, zkopíruj příklad vzoru pohybového promptu a stiskni tlačítko Run (PirateDiffusion: odpověz na svůj obrázek příkazem /workflow; BitVector: nahraj a vyber model).
- Napiš pohybový prompt jednou větou pro subjekt a jednou pro kameru. Nic o oblečení, barvách nebo světle; to už je na obrázku.
- Generuj v rozlišení 832x480 (krajina) nebo 480x832 (portrét), 81 snímků, výchozí počet kroků. Podívej se na celý klip; posuzuj pohyb, ne ostrost.
- Upravuj jen pohybový prompt: pomalejší slovesa ("pomalu", "jemně") snižují mávání; jedna instrukce kamery zabrání skokům.
- Lokálně, s 16GB kartou:Wan 2.2 5Bfp8 nebo GGUF, 832x480, 49-81 snímků, textový enkodér na CPU. S 24 GB: 14B fp8 na 480p, 720p s enkodérem mimo GPU. Viz průvodceVRAMpro AI video.
- Delší kusy: vezmi poslední snímek prvního klipu jako startovní obrázek druhého s pokračujícím pohybovým promptem; spoj v editoru; nakonec interpoluj na 30 fps a zvětši rozlišení.
- Přidej zvuk: LTX-2 a H3 generují zvuk s klipem; u Wan přidej hudbu nebo efekty v editoru.
Příklady
Pohybový prompt pro I2V
Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text
Workflow příkaz pro PirateDiffusion
/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)
ComfyUI Wan 2.2 5B na 16 GB
UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)
Tipy
- Slovesa pohybu jsou důležitější než přídavná jména: "otočí se, jde, zvedá, nalévá, mává" dávají jasný, spolehlivý pohyb; "krásný, filmový" nic nevygeneruje.
- Jeden pohyb kamery na klip: přiblížení, oddálení, panoráma vlevo, oblet. Dva pohyby způsobí chvění.
- Portrétní statické obrázky lépe animují tváře; krajinné lépe animují prostředí.
- Wan LoRA pro experta s vysokým šumem formují pohyb; nízký šum formuje detaily. Mnoho balíčků má obojí; načítej je na správného experta.
- Destilované LoRA (lightx2v, FastWan) zkracují Wan z 20 kroků na 4-6 při CFG 1 s malou ztrátou kvality; jsou uvedeny na stránkách modelů.
- Počítej s 3-10 minutami na klip na 4090 pro Wan 14B a asi 90 sekund pro LTX-2; cloud většinu klipů vrátí za minutu nebo dvě.
Řešení problémů
Klip je statický s mírným třepením
Proč k tomu dochází
V promptu chybí sloveso pohybu, nebo je váha statické LoRA příliš vysoká.
Jak to opravit
Přidej pohyb subjektu a pohyb kamery; sniž váhy LoRA na 0.7.
Tvář se rozmazává nebo mění identitu
Proč k tomu dochází
Tvář je příliš malá, příliš mnoho snímků, nebo 480p na detailní tvář.
Jak to opravit
Ořízni blíž, 49-61 snímků, nebo 720p v cloudu; poslední možností je detailování tváře po snímcích.
Skoky kamery nebo střih scény
Proč k tomu dochází
Dvě instrukce kamery, nebo ve promptu slova jako "cut to".
Jak to opravit
Použij jen jeden pohyb kamery; "jump cut" dej do negativního promptu.
Nedostatek paměti při 720p
Proč k tomu dochází
Počet snímků krát rozlišení přesahuje VRAM.
Jak to opravit
Sniž rozlišení na 480p nebo počet snímků, odlož textový enkodér; viz průvodce VRAM pro AI video.
Motion LoRA nic nedělá
Proč k tomu dochází
Načteno na špatného experta nebo špatnou velikost modelu.
Jak to opravit
Zkontroluj stránku modelu pro 5B/14B a vysoký/nízký šum; načti podle toho s příslušným spouštěcím slovem.
AD

Wan 2.2 14B, LTX-2 a H3 přes Telegram
PirateDiffusion spouští velké video modely na serverových GPU: odpověz na jakýkoli obrázek workflow příkazem a klip se ti vrátí v chatu. Neomezená tvorba za pevnou cenu, bez potřeby 24GB karty.
Otázky
Který video model vyzkoušet první?
Wan 2.2 I2V: odpouští chyby, dobře zdokumentovaný, nejvíc LoRA. Průvodce Wan začátky má kompletní nastavení.
Můžu to dělat na 8GB kartě?
Jak získat zvuk?
LTX-2 a MiniMax H3 generují synchronizovaný zvuk; Mark White má návody na promptování dialogů a efektů pro H3.
Jak dlouhý může být klip?
Asi pět sekund nativně. Delší kusy jsou řetězené klipy; kvalita klesá po šesti až osmi sekundách v jednom průchodu.
Jsou nejnovější komerční modely (Veo, Kling, Wan 3.0) dostupné lokálně?
Ne; jsou jen přes API. Vše v tomto průvodci je otevřená váha a běží lokálně nebo u cloudových partnerů.
Odkazy a zdroje
- Wan 2.2 repository
- LTX-2 (Lightricks)
- Wan family page
- LTX-2 family page
- MiniMax H3 family page
- PirateDiffusion
- BitVector web app
Modely v tomto návodu
Napsal
Lookout
Související návody
Video modely
Wan 2.2 video: nastavení text-to-video a image-to-video, nastavení a LoRA
První výsledky s Wan 2.2: jakou velikost modelu vybrat (5B nebo 14B), pár expertů vysoký šum / nízký šum, rozlišení a počet snímků, které fungují, lightning LoRA, které zkracují render na čtyři kroky, struktura promptu pro pohyb a jak to spustit hostované, když má karta málo paměti.
Autor: Captain
2026-05-24

Video modely
Kolik VRAM potřebuješ pro AI video? Wan 2.2, HunyuanVideo 1.5 a LTX-2 podle velikosti GPU (2026)
Kolik VRAM je potřeba pro spuštění Wan 2.2, HunyuanVideo 1.5 a LTX-2 lokálně podle velikosti GPU, rozlišení a délky klipu: co zvládnou karty s 8, 12-16, 24, 32 a 48+ GB, proč video stojí stokrát víc než obrázek, triky s offloadingem, které vměstnají 14B modely na 24 GB, reálné časy generování a kdy se vyplatí pronájem místo koupě.
Autor: P.I. Panda
2026-10-06
Promptování
Promptování MiniMax H3: text na video, obrázek na video, referenční video a audio
Jak řídit MiniMax H3 z chatového příkazu: recept WHO + WHERE + ACTION + CAMERA + SOUND pro text na video, animování statického obrázku pomocí obrázku na video, dát každému referenčnímu obrázku úkol v referenčním režimu a získat čistý dialog místo mumlání. S kopírovatelnými a vyzkoušet promptami a PDF od autora.
Autor: Mark White
2026-09-20
Video modely
MiniMax H3 video prompts: the official structure
How MiniMax wants an H3 prompt written: the alignment line for image-anchored videos, the three core fields, shots and cuts, camera moves, speaker IDs and dialogue tags, the soundscape and the music. Condensed from the official prompt writing guide.
Autor: Captain
2026-09-14
Modely
LTX 2.3 Crisp Enhance: ostřejší, více filmové detaily ve videu
Crisp Enhance LoRA od vrgamedevgirl pro LTX 2.3 zvyšuje ostrost, mikrodetaily a kontrast ve generovaném videu. Nauč se, jak ji vyvážit s jemnější Soft Enhance, váhami a nápady na prompt.
Autor: Captain
2026-10-03
Chyby a opravy
Průvodce GPU a VRAM pro AI obrázky a video: co každý model potřebuje a co koupit (nebo ne)
Kolik grafické paměti opravdu potřebuje každá rodina modelů při použitelné rychlosti (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), co ti přinese kvantizace fp8 a GGUF, proč je důležitá i systémová RAM a disk, žebříček karet od 8 do 32 GB, poznámky k Mac a AMD a kdy je výhodnější pronájem než koupě.
Autor: Quartermaster
2026-01-07
Další návody
Cloudové služby
Paušální poplatek vs tokeny: proč jsou neomezené plány jako Graydient.ai nejlepší hodnotou pro tvůrce AI v roce 2026
Srovnání nákladů podle pořadí, s cenami zkontrolovanými 8. října 2026, mezi paušálními neomezenými plány jako Graydient.ai a cenami za tokeny a kredity od Midjourney, Leonardo, fal.ai, Replicate, Runway a Kling: kolik opravdu stojí 1 000 obrázků a 1 000 videí měsíčně u každého z nich a proč je jedna pevná cena za neomezené obrázky, video, audio, chat Grok LLM a webové aplikace nejlepší hodnotou pro tvůrce, kteří často upravují.
Autor: Captain
2026-10-08
Modely
FLUX.1 Dev: jak ho promptovat, nejlepší nastavení a kreativní nápady
Praktický průvodce FLUX.1 Dev od Black Forest Labs: promptování v přirozeném jazyce, nastavení guidance a kroků, vrstvení LoRA, vykreslování textu a nápady na prompty, které využívají jeho silné stránky.
Autor: Captain
2026-09-30
Modely
Stable Diffusion XL 1.0: promptování, nastavení a co stále umí nejlíp
Jak vytěžit maximum z oficiálního základního modelu SDXL 1.0: nativní rozlišení, nastavení CFG a sampleru, refiner, negativní prompt a nápady na styly, kde SDXL stále vyniká.
Autor: Captain
2026-10-01
Modely
Stable Diffusion 1.5: klasický model, správně promptovaný
Stable Diffusion 1.5 stojí za to znát: správné rozlišení, CFG a sampler, jak používat jeho obrovskou knihovnu LoRAs a embeddingů a kreativní nápady na prompt vhodné pro model s rozlišením 512 pixelů.
Autor: Captain
2026-10-02
Modely
FLUX.2 Dev: zadávání příkazů pro nejnovější model Black Forest Labs
FLUX.2 Dev přináší delší příkazy, lepší text, silnější realismus a úpravy s více odkazy. Tento průvodce pokrývá turbo workflow, nastavení vedení a rozlišení, strukturu příkazů a nápady, které využívají jeho nové možnosti.
Autor: Captain
2026-10-03
Modely
Qwen-Image: dlouhé prompti, perfektní text a dvoujazyčné plakáty
Qwen-Image je model, ke kterému sáhneš, když na slovech na obrázku záleží. Nauč se psát jeho dlouhé popisné prompti, přesně vykreslovat anglický a čínský text, nastavovat CFG a kroky a objevovat nápady s hodně rozvržením.
Autor: Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Všechna práva vyhrazena