Prompt video MiniMax H3: la struttura ufficiale
Argomento: Modelli video
Di Captain
Pubblicato il 2026-09-14
Come MiniMax vuole che sia scritto un prompt H3: la linea di allineamento per video ancorati all’immagine, i tre campi principali, inquadrature e tagli, movimenti di camera, ID degli speaker e tag di dialogo, paesaggio sonoro e musica. Riassunto dalla guida ufficiale alla scrittura dei prompt.
Informazioni aggiornate
Questa guida è un'istantanea. La fonte qui sotto è tenuta aggiornata dai suoi autori; consultala per i dettagli più recenti.
MiniMax's official video prompt writing guide (Hugging Face)
Panoramica
MiniMax H3
crea video con audio da un solo prompt. Ci sono quattro compiti: T2VA costruisce tutta la timeline audiovisiva dal testo; I2VA parte da un primo fotogramma e sviluppa in avanti; FL2VA viaggia da un primo fotogramma a un ultimo; L2VA converge su un ultimo fotogramma da uno stato precedente plausibile. Il corpo del prompt è lo stesso per tutti e quattro. I tre compiti con immagine aggiungono una riga di istruzione davanti.
Un prompt finito ha due parti: la riga di istruzione (solo per i compiti con immagine), una riga vuota, poi i tre campi principali integrated_multimodal_description, overall_soundscape e non_diegetic_music, ognuno in un paragrafo a sé e scritti in inglese. Ogni dettaglio deve essere qualcosa che lo spettatore può vedere o sentire.
Questa guida riassume il documento ufficiale in una tabella di riferimento, un ordine di scrittura, esempi ufficiali e le regole su cui si inciampa spesso. La fonte è linkata sopra e resta l’autorità quando ci sono differenze.
Riferimento
Nome | Tipo | Cos'è |
|---|---|---|
integrated_multimodal_description | core field | La timeline, inquadratura per inquadratura: stile visivo, composizione, soggetti e loro posizioni, scena e oggetti di scena, azioni e reazioni, tagli, movimenti di camera, speaker, dialoghi, canto e suoni diegetici che li accompagnano. |
overall_soundscape | core field | Un paragrafo da 1 a 4 frasi: suoni ambientali, suoni di azioni fisiche e suoni umani non verbali (vento, pioggia, traffico, passi, tessuti, impatti, respiro, risate) per tutto il video. Qui niente dialoghi, canto o musica diegetica. N/A solo se l’utente chiede silenzio totale. |
non_diegetic_music | core field | Da 1 a 3 frasi solo sulla colonna sonora che sente il pubblico: strumenti, tempo, ritmo e variazioni dinamiche. Niente parole sull’umore o spiegazioni del ruolo emotivo. N/A se non c’è colonna sonora. |
I2VA instruction | first line | Per il video target, a 0.00 secondi nel video target, <Picture 1> (da [Shot 1]) è completamente referenziata. |
FL2VA instruction | first line | Come le immagini di riferimento si allineano col video target — Picture 1 (da Shot 1) si allinea con il secondo 0.00 del video target; Picture 2 (da Shot N) si allinea con il secondo S.SS del video target. |
L2VA instruction | first line | Come le immagini di riferimento si allineano col video target — <Picture 1> (da [Shot N]) si allinea con il secondo S.SS del video target. N è l’indice dell’inquadratura finale reale; S.SS è la durata del video con esattamente due decimali. |
[Shot 1] | shot marker | Apre la descrizione. Nessun timestamp. Inizia con lo stile generale (Cinematic, live-action, 2D-animated, 3D CG, claymation, watercolor, vintage film) e la prima composizione. |
[Shot 2] At 00:03.500, the camera cuts to ... | shot marker | Ogni inquadratura successiva: un numero sequenziale e un tempo di taglio strettamente crescente dentro la durata del video, poi la frase di taglio e cosa mostra la nuova inquadratura. |
(S1), (S2), (S1,S2) | speaker ID | Un ID stabile per ogni soggetto che parla, canta o si sente fuori schermo; lo stesso ID tra le inquadrature; un ID composto quando più speaker numerati vocalizzano insieme. Personaggi che non vocalizzano mai non hanno ID. |
<d>[English] ... </d> | dialogue tag | Solo il tag della lingua e le parole esatte pronunciate, con ogni parola e punteggiatura originale mantenuta. Chi parla, l’azione e il modo di dire restano fuori dal tag. |
"..." | on-screen text | Qualsiasi scritta visibile sullo schermo, come banner, insegna, etichetta, sottotitolo o neon, in inglese tra virgolette doppie, parola per parola e non tradotta. |
camera motion | phrase | Tipo di movimento, più ampiezza e velocità solo se rilevanti, scritto come un’azione naturale dentro l’inquadratura: La camera si avvicina con piccola ampiezza a bassa velocità verso la lettera piegata nelle sue mani. |
says in an off-screen voiceover | fixed phrase | L’unica frase per il voiceover. Subito dopo il blocco <d>, specifica che le labbra del personaggio sullo schermo restano completamente chiuse. |
AD

Nessuna installazione: esegui i modelli IA nel cloud
BitVector Prism è il modo più semplice per iniziare: scegli un modello, scrivi un prompt e genera in una web app pulita, senza configurare nulla. BitVector è disponibile anche su Discord e sul web (SpyGlass).
Passo dopo passo
- Scegli il compito. Per T2VA inizia direttamente con i tre campi principali. Per I2VA, FL2VA e L2VA scrivi l’istruzione di allineamento come primissima riga, lascia una riga vuota, poi scrivi i campi. N è l’indice dell’ultima inquadratura e S.SS la durata effettiva con due decimali.
- Apri [Shot 1] con lo stile e la composizione iniziale. Per un compito con immagine prendi lo stile dall’immagine di riferimento e mantieni identità, abbigliamento, colori, oggetti chiave e relazioni spaziali coerenti; per T2VA scegli lo stile dalla richiesta.
- Scrivi il resto della descrizione lungo la timeline: aspetto e posizione dei soggetti, scena e oggetti chiave, azioni e reazioni, cambi di inquadratura, parole dette e suoni diegetici sincronizzati. Escludi tutto ciò che non si può vedere o sentire.
- Taglia solo quando la nuova inquadratura porta informazioni nuove su soggetto, spazio, stato, punto di vista o tempo. Numerale in ordine e inizia ogni inquadratura successiva con un tempo di taglio strettamente crescente. Se cambia solo la distanza o un leggero angolo, muovi la camera invece di tagliare.
- Scrivi i movimenti di camera come azioni: tipo di movimento, poi con piccola ampiezza o con ampia ampiezza e a bassa velocità o ad alta velocità solo se sono significativi. Ampiezza media e velocità normale si omettono.
- Presenta ogni voce alla prima apparizione con abbastanza identità da restare stabile (tipo di personaggio, età, genere, in o fuori schermo, tono, timbro, velocità di parola, accento) e il suo ID. Metti le parole esatte dentro <d>[English] ... </d>, mantenendo la punteggiatura, e non tradurle o riscriverle mai.
- Per il voiceover usa la frase esatta says in an off-screen voiceover e aggiungi subito dopo il tag che le labbra del personaggio sullo schermo restano completamente chiuse.
- Quando una battuta o una canzone attraversa un taglio, tagga entrambe le parti e specifica che l’audio continua oltre il taglio (continua senza soluzione di continuità oltre il taglio, continua ininterrotto nella inquadratura successiva, si porta dalla inquadratura precedente, resta udibile durante la transizione). Anche discorsi troncati alla fine del video vanno taggati.
- Metti il testo visibile sullo schermo tra virgolette doppie, esattamente come si legge.
- Scrivi overall_soundscape come un paragrafo da 1 a 4 frasi su ambiente, suoni di azioni e suoni umani non verbali per tutto il video. Dialoghi, canto e musica che i personaggi sentono sono già nella descrizione, quindi non ripeterli.
- Scrivi non_diegetic_music in 1-3 frasi su strumenti, tempo, ritmo e dinamiche, o N/A. Radio, TV, musica da telefono e canto dal vivo sono diegetici e vanno nella descrizione.
- Per un compito con immagine segui il percorso consigliato. I2VA: ancoraggio al primo fotogramma, inizio azione, sviluppo continuo, risultato o reazione. FL2VA: stato primo fotogramma, cambiamenti intermedi osservabili, differenze che si restringono progressivamente, stato ultimo fotogramma, di solito in un’unica inquadratura. L2VA: stato precedente plausibile, azione esplicita e percorso di transizione, convergenza graduale nell’ultima inquadratura, atterraggio all’ultimo fotogramma.
Esempi
Movimenti di camera scritti come azioni
The camera pushes in with small amplitude at slow speed toward the folded letter in her hands.
The camera pans right with large amplitude at fast speed, revealing the open doorway.
The camera holds a static shot as the runner exits the frame.
Speaker, dialoghi e voiceover
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>
The man (S1) says in an off-screen voiceover: <d>[English] I still remember that road.</d> while his lips remain completely closed.
A red neon sign reading "营业中" glows above the doorway.
Caso 1: T2VA (solo testo)
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium-wide shot frames a baker opening the shutters of a small street bakery before sunrise. The camera pushes in with small amplitude at slow speed as the middle-aged baker with a calm, slightly raspy voice (S1) places a fresh loaf on the wooden counter and says: <d>[English] First batch of the morning.</d> [Shot 2] At 00:05.000, the camera cuts to a close-up of steam rising from the sliced bread while the baker's final words carry over from the previous shot.
overall_soundscape: Wooden shutters scrape open over a quiet street as trays clink softly inside the bakery. The doorbell rings once, followed by light footsteps and the crisp sound of bread being sliced.
non_diegetic_music: A soft acoustic-guitar pattern at a moderate tempo, joined by sparse upright-bass notes and a gentle fade at the end.
Caso 2: I2VA (primo fotogramma)
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, the young woman shown in <Picture 1> remains beside the rain-covered train window, preserving her appearance, clothing, seat position, and the carriage layout. The camera trucks right with small amplitude at slow speed as she lifts her gaze from the folded letter toward the passing city lights. Her reflection moves across the glass while the quiet, breathy young woman (S1) says: <d>[English] I get off at the next station.</d> She folds the letter along its existing crease.
overall_soundscape: The train wheels produce a steady metallic rhythm beneath a low ventilation hum. Rain ticks against the window while paper rustles softly in her hands.
non_diegetic_music: Sustained cello notes at a slow tempo with widely spaced piano tones, gradually decreasing in volume.
Caso 3: FL2VA (primo e ultimo fotogramma, un’inquadratura di otto secondi)
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a rain-soaked cyclist begins in the position and framing established by Picture 1, holding a closed black umbrella beside a silver bicycle. The camera pulls out with small amplitude at slow speed as she releases the bicycle handle, raises the umbrella above her shoulder, and presses the runner upward until the canopy opens. Water rolls from the expanding fabric while she steps beneath it, rotates the handle into the final angle, and settles into the pose, spacing, and composition established by Picture 2 at the end of the shot.
overall_soundscape: Rain falls steadily on the pavement, followed by the metallic click of the umbrella runner and the soft snap of the canopy opening. Water drips from the bicycle frame as distant traffic passes.
non_diegetic_music: N/A
Caso 4: L2VA (ultimo fotogramma, un’inquadratura di sei secondi)
How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 6.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a close shot begins with an intact drinking glass near the edge of a dark wooden table, while the same hand and sleeve visible in <Picture 1> approach from the right. The camera pushes in with small amplitude at slow speed as the fingertips strike the rim. The glass tips, falls, and hits the floor with a sharp impact; cracks spread through it as fragments slide outward. Toward the end, the moving pieces lose momentum and settle into the exact broken arrangement, hand position, camera angle, lighting, and final composition established by <Picture 1>.
overall_soundscape: Fingertips tap the glass before it scrapes across the tabletop, falls, and breaks with a sharp crash. Small fragments scatter and gradually stop sliding across the floor.
non_diegetic_music: A low electronic pulse at a slow tempo, ending immediately after the glass breaks.
Consigli
- Tipi di movimento nominati dalla guida: Zoom In / Zoom Out (variazione della lunghezza focale, camera ferma), Push In / Pull Out (camera si muove avanti o indietro), Pan Left / Right (obiettivo ruota orizzontalmente), Truck Left / Right (camera scivola lateralmente), Tilt Up / Down (obiettivo ruota verticalmente), Pedestal Up / Down (camera intera si alza o scende), Arc Shot, Tracking Shot, Static Shot, Shake Slightly / Shake Strongly, POV, Roll Clockwise / Counterclockwise.
- Ampiezza: con piccola ampiezza, con ampia ampiezza. Velocità: a bassa velocità, ad alta velocità.
- Frasi per i tagli: la camera taglia a, l’inquadratura taglia a, l’inquadratura transita a, l’inquadratura cambia a, l’inquadratura passa a. Cross-dissolve, fade e wipe solo se richiesti dall’utente.
- FL2VA favorisce un’unica inquadratura così il modello può interpolare continuamente; usa più inquadrature solo se sono esplicitamente specificate, e l’ultimo fotogramma deve essere raggiunto dall’ultima inquadratura alla fine del video.
- Per L2VA l’immagine appartiene all’ultima inquadratura, non a Shot 1. Parti da uno stato precedente che potrebbe plausibilmente portare a quello finale.
- Il campo musica riguarda strumenti, velocità, ritmo e dinamiche. Evita parole sull’umore e su cosa la colonna sonora dovrebbe far provare al pubblico.
- Descrivi il suono legato a un’azione nella descrizione accanto all’azione; il paesaggio sonoro è il riassunto per tutto il video, non un secondo copione.
Risoluzione dei problemi
Il video non arriva all’ultimo fotogramma
Perché succede
In FL2VA o L2VA l’immagine di riferimento è stata descritta come immagine statica, raggiunta in un’inquadratura precedente, o il tempo di allineamento non corrispondeva alla durata reale del video.
Come risolverlo
Scrivi il percorso di movimento che collega gli stati invece di due descrizioni, lascia che la convergenza avvenga nell’ultimo [Shot N], e imposta il tempo di allineamento S.SS alla durata effettiva con due decimali.
Le labbra si muovono durante un voiceover
Perché succede
Il voiceover non è stato marcato con la frase esatta, o mancava la frase sulle labbra chiuse dopo il blocco <d>.
Come risolverlo
Usa says in an off-screen voiceover e aggiungi subito dopo il tag che le labbra del personaggio sullo schermo restano completamente chiuse.
Le parole dette escono riscritte, tradotte o gonfiate
Perché succede
Note di recitazione o descrizioni sono finite dentro il tag <d>, o le parole sono state parafrasate invece che scritte esattamente.
Come risolverlo
Dentro <d>[English] ... </d> tieni solo il tag della lingua e le parole esatte con la punteggiatura; metti l’identità dello speaker, l’azione e la recitazione fuori dal tag.
I tagli sembrano casuali o le inquadrature sono fuori ordine
Perché succede
Un taglio che non aggiunge informazioni nuove, tempi di taglio mancanti o non crescenti, o un timestamp sulla prima inquadratura.
Come risolverlo
Nessun timestamp su [Shot 1]; ogni inquadratura successiva inizia con un tempo di taglio strettamente crescente dentro la durata del video e una frase di taglio; sostituisci piccoli reframing con un movimento di camera.
La colonna sonora è generica o ripete il dialogo
Perché succede
Parole sull’umore in non_diegetic_music, o dialoghi e canto ripetuti in overall_soundscape.
Come risolverlo
Descrivi strumenti, tempo, ritmo e dinamiche nel campo musica; tieni il paesaggio sonoro per ambiente, suoni di azioni e suoni umani non verbali.
AD

Nessuna installazione: esegui i modelli IA nel cloud
PirateDiffusion è solo su Telegram ed è pensato per i professionisti: migliaia di modelli, LoRA e workflow tramite comandi in chat, con generazione illimitata a prezzo fisso.
Domande
Il primo shot ha bisogno di un timestamp?
No. [Shot 1] non ha tempo. Ogni inquadratura successiva inizia con un tempo di taglio strettamente crescente che cade dentro la durata del video, per esempio [Shot 2] At 00:03.500, the camera cuts to ...
Cosa va dentro il tag di dialogo?
Solo il tag della lingua e il contenuto esatto parlato, con ogni parola e punteggiatura originale mantenuta parola per parola. Identità, ID, azione e modo di dire dello speaker restano fuori dal tag.
E se nessuno parla?
Allora nessun personaggio ha un ID speaker. Il paesaggio sonoro descrive comunque ambiente e suoni di azioni; N/A è riservato a un video che deve essere completamente silenzioso.
Un prompt FL2VA può avere più inquadrature?
Solo se l’utente lo chiede esplicitamente. Un’inquadratura permette al modello di interpolare dal primo all’ultimo fotogramma; qualunque sia il numero, l’ultimo fotogramma deve essere raggiunto dall’ultima inquadratura.
Dove va la musica che i personaggi sentono?
Radio, televisione, musica da telefono, strumenti e canto sono eventi diegetici e vanno in integrated_multimodal_description. non_diegetic_music è solo per la colonna sonora che sente il pubblico.
Esiste un formato per audio di riferimento e clonazione vocale?
Sì. La modalità full-reference ha un formato in sei sezioni nella guida di riferimento MiniMax, linkata sotto. La guida di Mark White per i prompt audio spiega come legare una voce di riferimento a uno speaker.
Link e fonti
- MiniMax's official video prompt writing guide (base tasks)
- MiniMax's reference-mode prompt writing guide
- MiniMax H3 model card on Hugging Face
Modelli di questa guida
Scritto da
Captain
Guide correlate
Prompting
Prompting MiniMax H3: da testo a video, da immagine a video, video di riferimento e audio
Come dirigere MiniMax H3 da un comando in chat: la ricetta WHO + WHERE + ACTION + CAMERA + SOUND per testo a video, animare un'immagine ferma con immagine a video, assegnare un ruolo a ogni immagine di riferimento in modalità riferimento e ottenere dialoghi chiari invece di mormorii. Con prompt da copiare e provare e il PDF dell'autore.
Di Mark White
2026-09-20
ComfyUI
Nodi di ComfyUI: documentazione e risoluzione dei problemi
Documentazione in linguaggio semplice per i nodi di ComfyUI più usati: cosa fa ogni nodo, tutti gli input e output, come collegarli, le impostazioni importanti e gli errori che dà con la soluzione per ognuno.
Di Captain
2026-06-02
Modelli video
Wan 2.2 video: configurazione, impostazioni e LoRA per text-to-video e image-to-video
Primi risultati con Wan 2.2: quale dimensione modello scegliere (5B o 14B), la coppia di esperti high-noise / low-noise, risoluzione e numero di frame che funzionano, le LoRA lightning che riducono i render a quattro step, struttura del prompt per il movimento e come usarlo in hosting quando la scheda è troppo piccola.
Di Captain
2026-05-24
Altre guide
Modelli
FLUX.1 Dev: come usarlo, impostazioni migliori e idee creative
Una guida pratica a FLUX.1 Dev di Black Forest Labs: come scrivere i prompt in linguaggio naturale, impostazioni di guida e passi, stacking di LoRA, rendering del testo e idee per prompt che sfruttano i suoi punti di forza.
Di Captain
2026-09-30
Modelli
Stable Diffusion XL 1.0: prompt, impostazioni e cosa fa ancora meglio
Come ottenere il massimo dal modello base ufficiale SDXL 1.0: risoluzioni native, impostazioni di CFG e sampler, il refiner, prompt negativi e idee per stili in cui SDXL brilla ancora.
Di Captain
2026-10-01
Modelli
Stable Diffusion 1.5: il modello classico, usato nel modo giusto
Stable Diffusion 1.5 vale ancora la pena conoscerlo: la risoluzione giusta, CFG e sampler, come usare la sua enorme libreria di LoRA e embedding, e idee creative per prompt adatte a un modello a 512 pixel.
Di Captain
2026-10-02
Modelli
FLUX.2 Dev: come usare il modello più recente di Black Forest Labs
FLUX.2 Dev supporta prompt più lunghi, testo migliore, realismo più forte e modifica con riferimenti multipli. Questa guida spiega il flusso turbo, le impostazioni di guida e risoluzione, la struttura del prompt e idee che sfruttano le sue nuove potenzialità.
Di Captain
2026-10-03
Modelli
Qwen-Image: prompt lunghi, testo perfetto e poster bilingue
Qwen-Image è il modello da usare quando le parole nell'immagine contano. Scopri come scrivere prompt descrittivi lunghi, riprodurre testo in inglese e cinese con precisione, impostare CFG e passi, e esplorare idee creative con layout complessi.
Di Captain
2026-09-29
Modelli
SDXL-Lightning: generazione in quattro passaggi su qualsiasi checkpoint SDXL
Lo LoRA SDXL-Lightning di ByteDance trasforma un rendering SDXL da 30 passaggi in uno da 4. Scopri il numero di passaggi, il CFG da usare, il sampler e come combinarlo con i tuoi checkpoint e LoRA di stile preferiti.
Di Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Fatto in Giappone
|
© 2026