Model
Trends
.ai
Model
Trends
.ai
nejlepší open source AI modely

Generování AI videa pro začátečníky: z obrázku na video, z textu na video a první klip s Wan, LTX-2 a H3

Téma: Video modely
Autor: Lookout
Publikováno 2026-04-29
Share

Přehled

Video modely jsou obrazové modely s časovou osou: stejný proces odšumu běží najednou na bloku snímků, takže všechno, co víš o promptech, semenech a odšumu, platí i tady, stejně jako náklady, které se násobí počtem snímků. Pro začátečníka to znamená tři věci. Začni s obrázkem na video (I2V), protože dobrý statický obrázek od obrazového modelu už vyřeší kompozici a styl a video model pak vymýšlí jen pohyb. Drž klipy krátké (asi pět sekund), protože na takových modelech se trénovalo. A počítej s tím, že velké modely poběží spíš v cloudu, pokud nemáš 24GB kartu.
Tři otevřené rodiny pokryjí většinu potřeb v roce 2026.
Wan 2.2
(Alibaba) je univerzál: 5B model, který běží na 12-16 GB, a 14B dvou-expertový model s nejlepší otevřenou kvalitou, plus obrovský ekosystém
LoRA
pro pohyb a styl.
LTX-2
(Lightricks) je rychlý a generuje synchronizovaný zvuk, ale chce 24-32 GB.
MiniMax H3
je audio-video model s dialogy a zvukovými efekty, většinou se používá přes hostované workflow; Mark White má na tomto webu podrobné návody na H3 promptování.
Hunyuan
Video 1.5 je lehčí alternativa k
Wan
14B.
Katalog uvádí každý video model a jeho LoRA s verzí a velikostí, na kterou cílí (5B nebo 14B, expert s vysokým nebo nízkým šumem), a stránky modelů ukazují ukázkové klipy s jejich promptem. Tlačítko Run otevře model na
PirateDiffusion
, kde workflow příkaz vytvoří klip z odpovědi na tvůj obrázek, nebo na
BitVector
.

Reference

Název
Typ
Co to je
I2V (image to video)
mode
Oživit statický obrázek. Nejlepší první režim: kompozice už sedí; prompt popisuje jen pohyb.
T2V (text to video)
mode
Jen z promptu. Větší variabilita, menší kontrola; použij pro nápady a doplňkové záběry.
FLF2V / first-last frame
mode
Dva klíčové snímky; model vyplní pohyb mezi nimi. Kontrolované přechody.
Frames and fps
setting
Wan: 81 snímků při 16 fps (5 s); LTX-2: 97-121 snímků při 24-25 fps; H3: 145 snímků při ~24 fps. Paměť roste s počtem snímků.
Resolution
setting
Wan 2.2: 832x480 nebo 480x832 (rychlé), 1280x720 (24 GB+); LTX-2 až 1080p+ s 32 GB. Portrét pro lidi, krajina pro scény.
Motion prompt
prompt
Jeden pohyb subjektu a jeden pohyb kamery: "otočí se k oknu a usměje se; pomalý přiblížení". Vyhni se popisu detailů scény, které už jsou na obrázku.
Steps /
CFG
/ shift
setting
Wan 2.2 14B: 20 kroků rozdělených 10/10 mezi experty,
CFG
3.5, shift 5; 5B: 20-30 kroků, CFG 5; LTX-2: 25-30 kroků s vlastním plánem; destilované LoRA (lightx2v) zkracují Wan na 4-8 kroků při CFG 1.
Motion
LoRAs
file
Pohyby kamery, tance, gesta, fyzika; přizpůsobené 5B/14B a expertovi. Stránky tady uvádějí cílový model.
Interpolation and upscale
post
RIFE nebo FILM na 32-60 fps; po snímcích ESRGAN nebo SeedVR pro rozlišení.
AD
Tvůj první klip bez GPU
BitVector Prism oživí statický obrázek s Wan modely z tohoto průvodce přímo v prohlížeči: nahraj obrázek, napiš větu o pohybu, stáhni klip. Nic se neinstaluje, funguje i na notebooku.

Krok za krokem

  1. Vytvoř nebo vyber statický obrázek: render 1024x1024 nebo 832x1216 s jasným subjektem a jednoduchým pozadím. Nejlépe se animují tváře větší než desetina snímku.
  2. Otevři stránku modelu Wan 2.2 I2V na tomto webu, zkopíruj příklad vzoru pohybového promptu a stiskni tlačítko Run (PirateDiffusion: odpověz na svůj obrázek příkazem /workflow; BitVector: nahraj a vyber model).
  3. Napiš pohybový prompt jednou větou pro subjekt a jednou pro kameru. Nic o oblečení, barvách nebo světle; to už je na obrázku.
  4. Generuj v rozlišení 832x480 (krajina) nebo 480x832 (portrét), 81 snímků, výchozí počet kroků. Podívej se na celý klip; posuzuj pohyb, ne ostrost.
  5. Upravuj jen pohybový prompt: pomalejší slovesa ("pomalu", "jemně") snižují mávání; jedna instrukce kamery zabrání skokům.
  6. Lokálně, s 16GB kartou:
    Wan 2.2 5B
    fp8 nebo GGUF, 832x480, 49-81 snímků, textový enkodér na CPU. S 24 GB: 14B fp8 na 480p, 720p s enkodérem mimo GPU. Viz průvodce
    VRAM
    pro AI video.
  7. Delší kusy: vezmi poslední snímek prvního klipu jako startovní obrázek druhého s pokračujícím pohybovým promptem; spoj v editoru; nakonec interpoluj na 30 fps a zvětši rozlišení.
  8. Přidej zvuk: LTX-2 a H3 generují zvuk s klipem; u Wan přidej hudbu nebo efekty v editoru.

Příklady

Pohybový prompt pro I2V

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

Workflow příkaz pro PirateDiffusion

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B na 16 GB

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

Tipy

  • Slovesa pohybu jsou důležitější než přídavná jména: "otočí se, jde, zvedá, nalévá, mává" dávají jasný, spolehlivý pohyb; "krásný, filmový" nic nevygeneruje.
  • Jeden pohyb kamery na klip: přiblížení, oddálení, panoráma vlevo, oblet. Dva pohyby způsobí chvění.
  • Portrétní statické obrázky lépe animují tváře; krajinné lépe animují prostředí.
  • Wan LoRA pro experta s vysokým šumem formují pohyb; nízký šum formuje detaily. Mnoho balíčků má obojí; načítej je na správného experta.
  • Destilované LoRA (lightx2v, FastWan) zkracují Wan z 20 kroků na 4-6 při CFG 1 s malou ztrátou kvality; jsou uvedeny na stránkách modelů.
  • Počítej s 3-10 minutami na klip na 4090 pro Wan 14B a asi 90 sekund pro LTX-2; cloud většinu klipů vrátí za minutu nebo dvě.

Řešení problémů

Klip je statický s mírným třepením

Proč k tomu dochází
V promptu chybí sloveso pohybu, nebo je váha statické LoRA příliš vysoká.

Jak to opravit
Přidej pohyb subjektu a pohyb kamery; sniž váhy LoRA na 0.7.

Tvář se rozmazává nebo mění identitu

Proč k tomu dochází
Tvář je příliš malá, příliš mnoho snímků, nebo 480p na detailní tvář.

Jak to opravit
Ořízni blíž, 49-61 snímků, nebo 720p v cloudu; poslední možností je detailování tváře po snímcích.

Skoky kamery nebo střih scény

Proč k tomu dochází
Dvě instrukce kamery, nebo ve promptu slova jako "cut to".

Jak to opravit
Použij jen jeden pohyb kamery; "jump cut" dej do negativního promptu.

Nedostatek paměti při 720p

Proč k tomu dochází
Počet snímků krát rozlišení přesahuje VRAM.

Jak to opravit
Sniž rozlišení na 480p nebo počet snímků, odlož textový enkodér; viz průvodce VRAM pro AI video.

Motion LoRA nic nedělá

Proč k tomu dochází
Načteno na špatného experta nebo špatnou velikost modelu.

Jak to opravit
Zkontroluj stránku modelu pro 5B/14B a vysoký/nízký šum; načti podle toho s příslušným spouštěcím slovem.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 a H3 přes Telegram
PirateDiffusion spouští velké video modely na serverových GPU: odpověz na jakýkoli obrázek workflow příkazem a klip se ti vrátí v chatu. Neomezená tvorba za pevnou cenu, bez potřeby 24GB karty.

Otázky

Který video model vyzkoušet první?

Wan 2.2 I2V: odpouští chyby, dobře zdokumentovaný, nejvíc LoRA. Průvodce Wan začátky má kompletní nastavení.

Můžu to dělat na 8GB kartě?

Krátké 480p klipy s
Wan 2.1
1.3B nebo Wan 2.2 5B GGUF, pomalu. Reálně začni v cloudu.

Jak získat zvuk?

LTX-2 a MiniMax H3 generují synchronizovaný zvuk; Mark White má návody na promptování dialogů a efektů pro H3.

Jak dlouhý může být klip?

Asi pět sekund nativně. Delší kusy jsou řetězené klipy; kvalita klesá po šesti až osmi sekundách v jednom průchodu.

Jsou nejnovější komerční modely (Veo, Kling, Wan 3.0) dostupné lokálně?

Ne; jsou jen přes API. Vše v tomto průvodci je otevřená váha a běží lokálně nebo u cloudových partnerů.

Odkazy a zdroje

Modely v tomto návodu

Napsal
Lookout

Související návody

Video modely
Wan 2.2 video: nastavení text-to-video a image-to-video, nastavení a LoRA
První výsledky s Wan 2.2: jakou velikost modelu vybrat (5B nebo 14B), pár expertů vysoký šum / nízký šum, rozlišení a počet snímků, které fungují, lightning LoRA, které zkracují render na čtyři kroky, struktura promptu pro pohyb a jak to spustit hostované, když má karta málo paměti.
Autor: Captain
2026-05-24
Video modely
Kolik VRAM potřebuješ pro AI video? Wan 2.2, HunyuanVideo 1.5 a LTX-2 podle velikosti GPU (2026)
Kolik VRAM je potřeba pro spuštění Wan 2.2, HunyuanVideo 1.5 a LTX-2 lokálně podle velikosti GPU, rozlišení a délky klipu: co zvládnou karty s 8, 12-16, 24, 32 a 48+ GB, proč video stojí stokrát víc než obrázek, triky s offloadingem, které vměstnají 14B modely na 24 GB, reálné časy generování a kdy se vyplatí pronájem místo koupě.
Autor: P.I. Panda
2026-10-06
Promptování
Promptování MiniMax H3: text na video, obrázek na video, referenční video a audio
Jak řídit MiniMax H3 z chatového příkazu: recept WHO + WHERE + ACTION + CAMERA + SOUND pro text na video, animování statického obrázku pomocí obrázku na video, dát každému referenčnímu obrázku úkol v referenčním režimu a získat čistý dialog místo mumlání. S kopírovatelnými a vyzkoušet promptami a PDF od autora.
Autor: Mark White
2026-09-20
Video modely
MiniMax H3 video prompts: the official structure
How MiniMax wants an H3 prompt written: the alignment line for image-anchored videos, the three core fields, shots and cuts, camera moves, speaker IDs and dialogue tags, the soundscape and the music. Condensed from the official prompt writing guide.
Autor: Captain
2026-09-14
Modely
LTX 2.3 Crisp Enhance: ostřejší, více filmové detaily ve videu
Crisp Enhance LoRA od vrgamedevgirl pro LTX 2.3 zvyšuje ostrost, mikrodetaily a kontrast ve generovaném videu. Nauč se, jak ji vyvážit s jemnější Soft Enhance, váhami a nápady na prompt.
Autor: Captain
2026-10-03
Chyby a opravy
Průvodce GPU a VRAM pro AI obrázky a video: co každý model potřebuje a co koupit (nebo ne)
Kolik grafické paměti opravdu potřebuje každá rodina modelů při použitelné rychlosti (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), co ti přinese kvantizace fp8 a GGUF, proč je důležitá i systémová RAM a disk, žebříček karet od 8 do 32 GB, poznámky k Mac a AMD a kdy je výhodnější pronájem než koupě.
Autor: Quartermaster
2026-01-07

Další návody

Cloudové služby
Paušální poplatek vs tokeny: proč jsou neomezené plány jako Graydient.ai nejlepší hodnotou pro tvůrce AI v roce 2026
Srovnání nákladů podle pořadí, s cenami zkontrolovanými 8. října 2026, mezi paušálními neomezenými plány jako Graydient.ai a cenami za tokeny a kredity od Midjourney, Leonardo, fal.ai, Replicate, Runway a Kling: kolik opravdu stojí 1 000 obrázků a 1 000 videí měsíčně u každého z nich a proč je jedna pevná cena za neomezené obrázky, video, audio, chat Grok LLM a webové aplikace nejlepší hodnotou pro tvůrce, kteří často upravují.
Autor: Captain
2026-10-08
Modely
FLUX.1 Dev: jak ho promptovat, nejlepší nastavení a kreativní nápady
Praktický průvodce FLUX.1 Dev od Black Forest Labs: promptování v přirozeném jazyce, nastavení guidance a kroků, vrstvení LoRA, vykreslování textu a nápady na prompty, které využívají jeho silné stránky.
Autor: Captain
2026-09-30
Modely
Stable Diffusion XL 1.0: promptování, nastavení a co stále umí nejlíp
Jak vytěžit maximum z oficiálního základního modelu SDXL 1.0: nativní rozlišení, nastavení CFG a sampleru, refiner, negativní prompt a nápady na styly, kde SDXL stále vyniká.
Autor: Captain
2026-10-01
Modely
Stable Diffusion 1.5: klasický model, správně promptovaný
Stable Diffusion 1.5 stojí za to znát: správné rozlišení, CFG a sampler, jak používat jeho obrovskou knihovnu LoRAs a embeddingů a kreativní nápady na prompt vhodné pro model s rozlišením 512 pixelů.
Autor: Captain
2026-10-02
Modely
FLUX.2 Dev: zadávání příkazů pro nejnovější model Black Forest Labs
FLUX.2 Dev přináší delší příkazy, lepší text, silnější realismus a úpravy s více odkazy. Tento průvodce pokrývá turbo workflow, nastavení vedení a rozlišení, strukturu příkazů a nápady, které využívají jeho nové možnosti.
Autor: Captain
2026-10-03
Modely
Qwen-Image: dlouhé prompti, perfektní text a dvoujazyčné plakáty
Qwen-Image je model, ke kterému sáhneš, když na slovech na obrázku záleží. Nauč se psát jeho dlouhé popisné prompti, přesně vykreslovat anglický a čínský text, nastavovat CFG a kroky a objevovat nápady s hodně rozvržením.
Autor: Captain
2026-09-29