Generarea video AI pentru începători: de la imagine la video, de la text la video și primul clip cu Wan, LTX-2 și H3
Subiect: Modele video
De Lookout
Publicat 2026-04-29
Prima săptămână cu modele video open: diferența dintre text-la-video și imagine-la-video și de ce să începi cu al doilea, cele trei familii de modele care merită învățate (Wan 2.2, LTX-2, MiniMax H3), numărul de cadre și rezoluțiile care funcționează, cum să scrii un prompt de mișcare, la ce să te aștepți de la un card de 16 sau 24 GB față de cloud și cum să transformi clipuri de cinci secunde în ceva mai lung.
Prezentare generală
Modelele video sunt modele de imagine cu o axă temporală: același ciclu de denoising rulează pe un bloc de cadre odată, deci tot ce știi despre prompturi, seed-uri și denoise se aplică și costurile se înmulțesc cu numărul de cadre. Consecințele practice pentru un începător sunt trei. Începe cu imagine-la-video (I2V), pentru că un cadru bun dintr-un model de imagine fixează compoziția și stilul și lasă modelul video să inventeze doar mișcarea. Păstrează clipurile scurte (aproximativ cinci secunde), pentru că pe asta au fost antrenate modelele. Și așteaptă-te să rulezi modelele mari în cloud, dacă nu ai un card de 24 GB.
Trei familii open acoperă majoritatea nevoilor în 2026.
Wan 2.2
(Alibaba) e modelul universal: un model de 5B care rulează pe 12-16 GB și un model de 14B cu doi experți, cu cea mai bună calitate open, plus un ecosistem mare de
LoRA
pentru mișcare și stil.
LTX-2
(Lightricks) e rapid și generează audio sincronizat, dar cere 24-32 GB.
MiniMax H3
e modelul audio-video cu dialog și efecte sonore, folosit mai ales prin fluxuri găzduite; ghidurile de prompting H3 de pe acest site de Mark White merg în detalii.
Hunyuan
Video 1.5 e o alternativă mai ușoară la
Wan
14B.
Catalogul listează fiecare model video și LoRA-urile lui cu baza și dimensiunea țintită (5B sau 14B, expert zgomot mare sau mic), iar paginile modelelor arată clipuri exemplu cu prompturile lor. Butonul Run deschide modelul pe
PirateDiffusion
, unde o comandă workflow produce clipul dintr-un răspuns la imaginea ta, sau pe
BitVector
.
Referință
Nume | Tip | Ce este |
|---|---|---|
I2V (image to video) | mode | Animează o imagine fixă. Cel mai bun mod de început: compoziția e deja corectă; promptul descrie doar mișcarea. |
T2V (text to video) | mode | Doar dintr-un prompt. Mai multă varietate, mai puțin control; folosește pentru idei și B-roll. |
FLF2V / first-last frame | mode | Două cadre cheie; modelul completează mișcarea între ele. Tranziții controlate. |
Frames and fps | setting | Wan: 81 cadre la 16 fps (5 s); LTX-2: 97-121 cadre la 24-25 fps; H3: 145 cadre la ~24 fps. Memoria crește odată cu cadrele. |
Resolution | setting | Wan 2.2: 832x480 sau 480x832 (rapid), 1280x720 (24 GB+); LTX-2 până la 1080p+ cu 32 GB. Portret pentru oameni, peisaj pentru scene. |
Motion prompt | prompt | O mișcare a subiectului plus o mișcare a camerei: "se întoarce spre fereastră și zâmbește; push-in lent". Evită să enumeri detalii din scenă deja în imagine. |
Steps / CFG / shift | setting | Wan 2.2 14B: 20 pași împărțiți 10/10 între experți, CFG 3.5, shift 5; 5B: 20-30 pași, CFG 5; LTX-2: 25-30 pași cu programul lui; LoRA-urile distilate (lightx2v) aduc Wan la 4-8 pași la CFG 1. |
Motion LoRAs | file | Mișcări de cameră, dansuri, gesturi, fizică; potrivite pentru 5B/14B și expertul corespunzător. Paginile aici spun ținta. |
Interpolation and upscale | post | RIFE sau FILM la 32-60 fps; ESRGAN cadru cu cadru sau SeedVR pentru rezoluție. |
AD

Primul tău clip fără GPU
BitVector Prism animează o imagine fixă cu modelele Wan din acest ghid direct în browser: încarcă imaginea, scrie propoziția de mișcare, descarcă clipul. Nimic de instalat, merge de pe laptop.
Pas cu pas
- Fă sau alege o imagine fixă: un render 1024x1024 sau 832x1216 cu un subiect clar și fundal simplu. Fețele mai mari de o zecime din cadru se animă cel mai bine.
- Deschide o pagină a modelului Wan 2.2 I2V pe acest site, copiază modelul de prompt de mișcare exemplu și apasă butonul Run (PirateDiffusion: răspunde la imaginea ta cu comanda /workflow; BitVector: încarcă și alege modelul).
- Scrie un prompt de mișcare cu o propoziție pentru subiect și una pentru cameră. Nimic despre haine, culori sau lumină; imaginea are deja astea.
- Generează la 832x480 (peisaj) sau 480x832 (portret), 81 cadre, pașii default. Uită-te la tot clipul; judecă mișcarea, nu claritatea.
- Iterează doar pe promptul de mișcare: verbe mai lente ("încet", "blând") reduc mișcările haotice; o singură instrucțiune pentru cameră previne salturile.
- Local, cu un card de 16 GB: Wan 2.2 5B fp8 sau GGUF, 832x480, 49-81 cadre, encoder text pe CPU. Cu 24 GB: 14B fp8 la 480p, 720p cu encoderul pe offload. Vezi ghidulVRAMpentru video AI.
- Piese mai lungi: ia ultimul cadru din clipul unu ca imagine de start pentru clipul doi cu un prompt de mișcare continuu; unește în editor; interpolează la 30 fps și upscale la final.
- Adaugă sunet: LTX-2 și H3 generează audio cu clipul; pentru Wan, adaugă muzică sau efecte în editor.
Exemple
Prompt de mișcare pentru I2V
Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text
Comandă workflow PirateDiffusion
/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)
ComfyUI Wan 2.2 5B pe 16 GB
UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)
Sfaturi
- Verbele de mișcare contează mai mult decât adjectivele: "se întoarce, merge, ridică, toarnă, face cu mâna" produc fiecare o mișcare distinctă și sigură; "frumos cinematic" nu produce nimic.
- O singură mișcare de cameră pe clip: push-in, pull-back, pan stânga, orbită. Două mișcări dau un efect de tremurat.
- Imaginile portret animă mai bine fețele; cele peisaj animă mai bine mediul.
- LoRA-urile Wan pentru expertul cu zgomot mare modelează mișcarea; cele cu zgomot mic modelează detaliile. Multe pachete au ambele; încarcă fiecare pe expertul lui.
- LoRA-urile distilate (lightx2v, FastWan) reduc Wan de la 20 pași la 4-6 la CFG 1 cu puțină pierdere de calitate; paginile modelelor le listează.
- Așteaptă 3-10 minute pe clip pe un 4090 pentru Wan 14B și cam 90 de secunde pentru LTX-2; cloud-ul returnează majoritatea clipurilor în unu-două minute.
Depanare
Clipul e o imagine fixă cu un ușor tremurat
De ce se întâmplă
Fără verb de mișcare în prompt sau o greutate LoRA statică prea mare.
Cum se repară
Adaugă o mișcare a subiectului și una a camerei; scade LoRA-urile la 0.7.
Fața se topește sau își schimbă identitatea
De ce se întâmplă
Fața prea mică, prea multe cadre sau 480p pe o față detaliată.
Cum se repară
Decupează mai aproape, 49-61 cadre sau 720p în cloud; un pas de detaliere a feței pe cadru e ultima soluție.
Camera sare sau scena taie
De ce se întâmplă
Două instrucțiuni pentru cameră sau cuvinte "cut to" în prompt.
Cum se repară
O singură mișcare de cameră; pune "jump cut" la negativ.
Memorie insuficientă la 720p
De ce se întâmplă
Numărul de cadre înmulțit cu rezoluția depășește VRAM-ul.
Cum se repară
Scade la 480p sau mai puține cadre, pune encoderul text pe offload; vezi ghidul VRAM pentru video AI.
LoRA de mișcare nu face nimic
De ce se întâmplă
Încărcat pe expertul greșit sau dimensiunea greșită a modelului.
Cum se repară
Verifică pagina modelului pentru 5B/14B și zgomot mare/mic; încarcă conform cu cuvântul lui trigger.
AD

Wan 2.2 14B, LTX-2 și H3 din Telegram
PirateDiffusion rulează modelele video mari pe GPU-uri server: răspunde la orice imagine cu o comandă workflow și clipul vine înapoi în chat. Generare nelimitată la preț fix, fără nevoie de card de 24 GB.
Întrebări
Ce model video să aleg prima dată?
Wan 2.2 I2V: iertător, bine documentat, cu cele mai multe LoRA-uri. Ghidul de început Wan are setup-ul complet.
Pot face asta pe un card de 8 GB?
Cum obțin sunet?
LTX-2 și MiniMax H3 generează audio sincronizat; ghidurile de prompting H3 de Mark White explică dialogul și efectele.
Cât poate dura un clip?
Cam cinci secunde nativ. Piesele mai lungi sunt clipuri legate; calitatea scade după șase-opt secunde într-un singur pas.
Cele mai noi modele comerciale (Veo, Kling, Wan 3.0) sunt disponibile local?
Nu; sunt doar API. Tot ce e în acest ghid e open-weight și rulează local sau pe cloud parteneri.
Linkuri și surse
- Wan 2.2 repository
- LTX-2 (Lightricks)
- Wan family page
- LTX-2 family page
- MiniMax H3 family page
- PirateDiffusion
- BitVector web app
Modele din acest ghid
Scris de
Lookout
Ghiduri conexe
Modele video
Wan 2.2 video: configurare text-la-video și imagine-la-video, setări și LoRA-uri
Primele rezultate cu Wan 2.2: ce mărime de model să alegi (5B sau 14B), perechea de experți zgomot ridicat / zgomot scăzut, rezoluții și număr de cadre care funcționează, LoRA-urile lightning care reduc randările la patru pași, structura promptului pentru mișcare și cum să-l rulezi găzduit când placa video e prea mică.
De Captain
2026-05-24

Modele video
Cât VRAM îți trebuie pentru video AI? Wan 2.2, HunyuanVideo 1.5 și LTX-2 după mărimea GPU-ului (2026)
VRAM necesar pentru a rula Wan 2.2, HunyuanVideo 1.5 și LTX-2 local, în funcție de mărimea GPU-ului, rezoluție și durata clipului: ce pot face plăcile de 8, 12-16, 24, 32 și 48+ GB, de ce video costă de o sută de ori mai mult decât o imagine, trucurile de offloading care permit modelelor de 14B să încapă pe 24 GB, timpi reali de generare și când e mai bine să închiriezi decât să cumperi.
De P.I. Panda
2026-10-06
Prompting
MiniMax H3: text la video, imagine la video, video de referință și audio
Cum să controlezi MiniMax H3 dintr-o comandă de chat: rețeta WHO + WHERE + ACTION + CAMERA + SOUND pentru text la video, animarea unei imagini statice cu imagine la video, atribuirea unui rol fiecărei poze de referință în modul de referință și obținerea unui dialog clar în loc de bâlbâială. Cu prompturi de copiat și încercat și PDF-ul autorului.
De Mark White
2026-09-20
Modele video
MiniMax H3 prompturi video: structura oficială
Cum vrea MiniMax să fie scris un prompt H3: linia de aliniere pentru videoclipuri ancorate pe imagini, cele trei câmpuri principale, cadrele și tăieturile, mișcările camerei, ID-urile vorbitorilor și etichetele de dialog, peisajul sonor și muzica. Rezumat din ghidul oficial de scriere a prompturilor.
De Captain
2026-09-14
Modele
LTX 2.3 Crisp Enhance: detalii video mai clare, mai cinematice
LoRA Crisp Enhance de la vrgamedevgirl pentru LTX 2.3 crește claritatea, micro-detaliile și contrastul în videoclipurile generate. Află cum să îl echilibrezi cu fratele Soft Enhance, greutățile și ideile de prompt.
De Captain
2026-10-03
Erori și soluții
Ghid GPU și VRAM pentru AI imagine și video: ce are nevoie fiecare model și ce să cumperi (sau nu)
Câtă memorie grafică are nevoie fiecare familie de modele la o viteză utilizabilă (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), ce îți aduce cuantizarea fp8 și GGUF, de ce contează și RAM-ul sistemului și discul, o listă de plăci video de la 8 la 32 GB, note pentru Mac și AMD și punctul în care închirierea e mai ieftină decât cumpărarea.
De Quartermaster
2026-01-07
Mai multe ghiduri
Modele
FLUX.1 Dev: cum să-l folosești, cele mai bune setări și idei creative
Un ghid practic pentru FLUX.1 Dev de la Black Forest Labs: cum să dai comenzi în limbaj natural, setările pentru ghidare și pași, cum să combini LoRA-uri, redarea textului și idei de prompturi care îi pun în valoare punctele forte.
De Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompturi, setări și ce face încă cel mai bine
Cum să profiți la maximum de modelul oficial SDXL 1.0 de bază: rezoluții native, setări CFG și sampler, refinerul, prompturi negative și idei pentru stiluri unde SDXL încă strălucește.
De Captain
2026-10-01
Modele
Stable Diffusion 1.5: modelul clasic, folosit corect
Stable Diffusion 1.5 merită să fie cunoscut în continuare: rezoluția potrivită, CFG și sampler-ul, cum să folosești biblioteca uriașă de LoRA și embeddings, plus idei creative de prompturi potrivite pentru un model de 512 pixeli.
De Captain
2026-10-02
Modele
FLUX.2 Dev: cum să folosești cel mai nou model Black Forest Labs
FLUX.2 Dev aduce prompturi mai lungi, text mai bun, realism mai puternic și editare cu referințe multiple. Acest ghid acoperă fluxul turbo, setările de ghidare și rezoluție, structura promptului și idei care folosesc noile sale puncte forte.
De Captain
2026-10-03
Modele
Qwen-Image: prompturi lungi, text perfect și postere bilingve
Qwen-Image e modelul la care apelezi când contează cuvintele din imagine. Învață cum să scrii prompturi lungi și descriptive, să redai text în engleză și chineză corect, să setezi CFG și pașii, și să explorezi idei creative cu layout complex.
De Captain
2026-09-29
Modele
SDXL-Lightning: generare în patru pași pe orice checkpoint SDXL
LoRA SDXL-Lightning de la ByteDance transformă o randare SDXL de 30 de pași într-una de 4 pași. Află câți pași trebuie să folosești, ce CFG să setezi, ce sampler să alegi și cum să îl combini cu checkpoint-urile și LoRA-urile tale preferate de stil.
De Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Realizat în Japonia
|
© 2026