Model
Trends
.ai
Model
Trends
.ai
i migliori modelli di IA open source

Generazione video AI per principianti: da immagine a video, da testo a video e il primo clip con Wan, LTX-2 e H3

Argomento: Modelli video
Di Lookout
Pubblicato il 2026-04-29
La prima settimana con modelli video open: la differenza tra testo a video e immagine a video e perché iniziare con quest’ultimo, le tre famiglie di modelli da conoscere (Wan 2.2, LTX-2, MiniMax H3), i conteggi di frame e risoluzioni che funzionano, come scrivere un prompt di movimento, cosa aspettarsi da una scheda da 16 o 24 GB rispetto al cloud, e come trasformare clip di cinque secondi in qualcosa di più lungo.

Panoramica

I modelli video sono modelli di immagini con un asse temporale: lo stesso ciclo di denoising si applica a un blocco di frame insieme, quindi tutto quello che sai su prompt, seed e denoise vale anche qui, così come i costi, moltiplicati per il numero di frame. Le conseguenze pratiche per un principiante sono tre. Inizia con immagine a video (I2V), perché un fermo immagine da un modello di immagini fissa composizione e stile e lascia al modello video solo il movimento da inventare. Tieni i clip corti (circa cinque secondi), perché è su questo che i modelli sono stati addestrati. E aspettati di usare i modelli grandi sul cloud a meno che tu non abbia una scheda da 24 GB.
Tre famiglie open coprono la maggior parte delle esigenze nel 2026.
Wan 2.2
(Alibaba) è il tuttofare: un modello da 5B che gira su 12-16 GB e un modello da 14B con due esperti con la migliore qualità open, più un enorme ecosistema di
LoRA
per movimento e stile.
LTX-2
(Lightricks) è veloce e genera audio sincronizzato ma richiede 24-32 GB.
MiniMax H3
è il modello audio-video con dialoghi ed effetti sonori, usato soprattutto tramite workflow ospitati; le guide di Mark White su H3 qui sul sito sono molto approfondite.
Hunyuan
Video 1.5 è un’alternativa più leggera a
Wan
14B.
Il catalogo elenca ogni modello video e le sue LoRA con la base e la dimensione a cui puntano (5B o 14B, esperto ad alto o basso rumore), e le pagine dei modelli mostrano clip di esempio con i loro prompt. Il pulsante Run apre il modello su
PirateDiffusion
, dove un comando workflow produce il clip da una risposta alla tua immagine, o su
BitVector
.

Riferimento

Nome
Tipo
Cos'è
I2V (image to video)
mode
Anima
un fermo immagine. Il miglior primo modo: la composizione è già giusta; il prompt descrive solo il movimento.
T2V (text to video)
mode
Solo da un prompt. Più varietà, meno controllo; usalo per idee e B-roll.
FLF2V / first-last frame
mode
Due keyframe; il modello riempie il movimento tra loro. Transizioni controllate.
Frames and fps
setting
Wan: 81 frame a 16 fps (5 s); LTX-2: 97-121 frame a 24-25 fps; H3: 145 frame a ~24 fps. La memoria scala con i frame.
Resolution
setting
Wan 2.2: 832x480 o 480x832 (veloce), 1280x720 (24 GB+); LTX-2 fino a 1080p+ con 32 GB. Ritratto per persone, paesaggio per scene.
Motion prompt
prompt
Un movimento del soggetto più uno della camera: "lei si gira verso la finestra e sorride; slow push-in". Evita di elencare dettagli della scena già nell’immagine.
Steps /
CFG
/ shift
setting
Wan 2.2 14B: 20 step divisi 10/10 tra esperti,
CFG
3.5, shift 5; 5B: 20-30 step, CFG 5; LTX-2: 25-30 step con il suo schedule; LoRA distillate (lightx2v) portano Wan a 4-8 step a CFG 1.
Motion
LoRAs
file
Movimenti di camera, danze, gesti, fisica; abbinati a 5B/14B e all’esperto. Le pagine qui indicano il target.
Interpolation and upscale
post
RIFE o FILM a 32-60 fps; ESRGAN frame-wise o SeedVR per la risoluzione.
AD
Il tuo primo clip senza GPU
BitVector Prism anima un fermo immagine con i modelli Wan di questa guida nel browser: carica l’immagine, scrivi la frase di movimento, scarica il clip. Niente da installare, funziona da laptop.

Passo dopo passo

  1. Crea o scegli un fermo immagine: un render 1024x1024 o 832x1216 con un soggetto chiaro e sfondo semplice. I volti più grandi di un decimo del frame si animano meglio.
  2. Apri una pagina modello Wan 2.2 I2V su questo sito, copia il modello di prompt di movimento di esempio e premi il pulsante Run (PirateDiffusion: rispondi alla tua immagine con il comando /workflow; BitVector: carica e scegli il modello).
  3. Scrivi un prompt di movimento con una frase per il soggetto e una per la camera. Niente su vestiti, colori o luce; l’immagine li ha già.
  4. Genera a 832x480 (paesaggio) o 480x832 (ritratto), 81 frame, step di default. Guarda tutto il clip; giudica il movimento, non la nitidezza.
  5. Itera solo sul prompt di movimento: verbi più lenti ("lentamente", "delicatamente") riducono i movimenti scomposti; un’istruzione singola per la camera evita salti.
  6. Localmente, con una scheda da 16 GB:
    Wan 2.2 5B
    fp8 o GGUF, 832x480, 49-81 frame, text encoder su CPU. Con 24 GB: 14B fp8 a 480p, 720p con encoder offloadato. Vedi la guida
    VRAM
    per video AI.
  7. Per pezzi più lunghi: prendi l’ultimo frame del clip uno come immagine iniziale del clip due con un prompt di movimento che continua; unisci in un editor; interpola a 30 fps e fai upscale alla fine.
  8. Aggiungi audio: LTX-2 e H3 generano audio con il clip; per Wan, aggiungi musica o effetti nell’editor.

Esempi

Prompt di movimento per I2V

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

Comando workflow PirateDiffusion

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B su 16 GB

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

Consigli

  • I verbi di movimento contano più degli aggettivi: "gira, cammina, solleva, versa, saluta" producono movimenti distinti e affidabili; "bello cinematografico" non produce nulla.
  • Un movimento di camera per clip: push-in, pull-back, panoramica a sinistra, orbita. Due movimenti danno un effetto tremolante.
  • I fermi in ritratto animano meglio i volti; quelli in paesaggio animano meglio gli ambienti.
  • Le LoRA Wan per l’esperto ad alto rumore modellano il movimento; quelle a basso rumore modellano il dettaglio. Molti pacchetti hanno entrambe; caricale su ogni esperto.
  • Le LoRA distillate (lightx2v, FastWan) riducono Wan da 20 a 4-6 step a CFG 1 con poca perdita di qualità; le pagine modello le elencano.
  • Aspettati 3-10 minuti per clip su una 4090 per Wan 14B e circa 90 secondi per LTX-2; il cloud restituisce la maggior parte dei clip in uno o due minuti.

Risoluzione dei problemi

Il clip è un fermo con un leggero tremolio

Perché succede
Nessun verbo di movimento nel prompt, o peso LoRA statico troppo alto.

Come risolverlo
Aggiungi un movimento del soggetto e uno della camera; abbassa le LoRA a 0.7.

Il volto si scioglie o cambia identità

Perché succede
Volto troppo piccolo, troppi frame, o 480p su un volto dettagliato.

Come risolverlo
Ritaglia più vicino, 49-61 frame, o 720p sul cloud; un passaggio di dettaglio volto per frame è l’ultima risorsa.

Salti di camera o tagli di scena

Perché succede
Due istruzioni di camera, o parole come "cut to" nel prompt.

Come risolverlo
Un solo movimento di camera; metti "jump cut" nel negativo.

Memoria esaurita a 720p

Perché succede
Frame per risoluzione superano la VRAM.

Come risolverlo
Scendi a 480p o meno frame, offloada il text encoder; vedi la guida VRAM per video AI.

La LoRA di movimento non fa nulla

Perché succede
Caricato sull’esperto sbagliato o dimensione modello sbagliata.

Come risolverlo
Controlla la pagina modello per 5B/14B e alto/basso rumore; carica con la parola trigger giusta.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 e H3 da Telegram
PirateDiffusion esegue i grandi modelli video su GPU server: rispondi a qualsiasi immagine con un comando workflow e il clip torna in chat. Generazione illimitata a prezzo fisso, senza bisogno di scheda da 24 GB.

Domande

Quale modello video usare per primo?

Wan 2.2 I2V: indulgente, ben documentato, con più LoRA. La guida per iniziare con Wan ha tutto il setup.

Posso farlo con una scheda da 8 GB?

Clip brevi a 480p con
Wan 2.1
1.3B o Wan 2.2 5B GGUF, lentamente. Realisticamente, inizia dal cloud.

Come ottengo l’audio?

LTX-2 e MiniMax H3 generano audio sincronizzato; le guide di Mark White su H3 spiegano i prompt per dialoghi ed effetti.

Quanto può durare un clip?

Circa cinque secondi nativamente. Pezzi più lunghi sono clip concatenati; la qualità cala oltre i sei-otto secondi in un unico passaggio.

I modelli commerciali più nuovi (Veo, Kling, Wan 3.0) sono disponibili localmente?

No; sono solo API. Tutto in questa guida è open-weight e gira localmente o sui partner cloud.

Link e fonti

Modelli di questa guida

Scritto da
Lookout

Guide correlate

Modelli video
Wan 2.2 video: configurazione, impostazioni e LoRA per text-to-video e image-to-video
Primi risultati con Wan 2.2: quale dimensione modello scegliere (5B o 14B), la coppia di esperti high-noise / low-noise, risoluzione e numero di frame che funzionano, le LoRA lightning che riducono i render a quattro step, struttura del prompt per il movimento e come usarlo in hosting quando la scheda è troppo piccola.
Di Captain
2026-05-24
Modelli video
Quanta VRAM serve per i video AI? Wan 2.2, HunyuanVideo 1.5 e LTX-2 in base alla dimensione GPU (2026)
VRAM necessaria per far girare Wan 2.2, HunyuanVideo 1.5 e LTX-2 in locale, in base alla dimensione della GPU, risoluzione e durata del clip: cosa possono fare le schede da 8, 12-16, 24, 32 e 48+ GB, perché il video costa cento volte un’immagine, i trucchi di offloading che fanno entrare modelli 14B su 24 GB, tempi realistici di generazione e quando conviene affittare invece di comprare.
Di P.I. Panda
2026-10-06
Prompting
Prompting MiniMax H3: da testo a video, da immagine a video, video di riferimento e audio
Come dirigere MiniMax H3 da un comando in chat: la ricetta WHO + WHERE + ACTION + CAMERA + SOUND per testo a video, animare un'immagine ferma con immagine a video, assegnare un ruolo a ogni immagine di riferimento in modalità riferimento e ottenere dialoghi chiari invece di mormorii. Con prompt da copiare e provare e il PDF dell'autore.
Di Mark White
2026-09-20
Modelli video
Prompt video MiniMax H3: la struttura ufficiale
Come MiniMax vuole che sia scritto un prompt H3: la linea di allineamento per video ancorati all’immagine, i tre campi principali, inquadrature e tagli, movimenti di camera, ID degli speaker e tag di dialogo, paesaggio sonoro e musica. Riassunto dalla guida ufficiale alla scrittura dei prompt.
Di Captain
2026-09-14
Modelli
LTX 2.3 Crisp Enhance: dettagli video più nitidi e cinematografici
Il Crisp Enhance LoRA di vrgamedevgirl per LTX 2.3 aumenta nitidezza, micro-dettagli e contrasto nei video generati. Scopri come bilanciarlo con il fratello Soft Enhance, i pesi e alcune idee per i prompt.
Di Captain
2026-10-03
Errori e soluzioni
Guida a GPU e VRAM per immagini e video AI: cosa serve a ogni modello e cosa comprare (o no)
Quanta memoria grafica serve davvero a ogni famiglia di modelli per avere una velocità utilizzabile (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), cosa ti danno la quantizzazione fp8 e GGUF, perché anche la RAM di sistema e il disco contano, una lista di schede da 8 a 32 GB, note su Mac e AMD, e il punto in cui conviene affittare invece di comprare.
Di Quartermaster
2026-01-07

Altre guide

Servizi cloud
Flat fee vs tokens: why unlimited plans like Graydient.ai are the best value for AI creators in 2026
A ranked cost comparison, with prices checked on 8 October 2026, of flat-fee unlimited plans like Graydient.ai against token and credit pricing from Midjourney, Leonardo, fal.ai, Replicate, Runway and Kling: what 1,000 images and 1,000 videos a month really cost on each, and why one fixed fee for unlimited images, video, audio, Grok LLM chat and web apps is the best value for creators who iterate.
Di Captain
2026-10-08
Modelli
FLUX.1 Dev: come usarlo, impostazioni migliori e idee creative
Una guida pratica a FLUX.1 Dev di Black Forest Labs: come scrivere i prompt in linguaggio naturale, impostazioni di guida e passi, stacking di LoRA, rendering del testo e idee per prompt che sfruttano i suoi punti di forza.
Di Captain
2026-09-30
Modelli
Stable Diffusion XL 1.0: prompt, impostazioni e cosa fa ancora meglio
Come ottenere il massimo dal modello base ufficiale SDXL 1.0: risoluzioni native, impostazioni di CFG e sampler, il refiner, prompt negativi e idee per stili in cui SDXL brilla ancora.
Di Captain
2026-10-01
Modelli
Stable Diffusion 1.5: il modello classico, usato nel modo giusto
Stable Diffusion 1.5 vale ancora la pena conoscerlo: la risoluzione giusta, CFG e sampler, come usare la sua enorme libreria di LoRA e embedding, e idee creative per prompt adatte a un modello a 512 pixel.
Di Captain
2026-10-02
Modelli
FLUX.2 Dev: come usare il modello più recente di Black Forest Labs
FLUX.2 Dev supporta prompt più lunghi, testo migliore, realismo più forte e modifica con riferimenti multipli. Questa guida spiega il flusso turbo, le impostazioni di guida e risoluzione, la struttura del prompt e idee che sfruttano le sue nuove potenzialità.
Di Captain
2026-10-03
Modelli
Qwen-Image: prompt lunghi, testo perfetto e poster bilingue
Qwen-Image è il modello da usare quando le parole nell'immagine contano. Scopri come scrivere prompt descrittivi lunghi, riprodurre testo in inglese e cinese con precisione, impostare CFG e passi, e esplorare idee creative con layout complessi.
Di Captain
2026-09-29