MiniMax H3 video prompts: de officiële structuur
Onderwerp: Videomodellen
Door Captain
Gepubliceerd op 2026-09-14
Hoe MiniMax wil dat een H3-prompt wordt geschreven: de uitlijningsregel voor beeld-gebonden video's, de drie kernvelden, shots en cuts, camerabewegingen, spreker-ID's en dialooglabels, het geluid en de muziek. Samengevat uit de officiële prompt schrijfhandleiding.
Actuele informatie
Deze gids is een momentopname. De bron hieronder wordt door de makers bijgehouden; kijk daar voor de nieuwste details.
MiniMax's official video prompt writing guide (Hugging Face)
Overzicht
MiniMax H3
maakt video met geluid uit één prompt. Er zijn vier taken: T2VA bouwt de hele audiovisuele tijdlijn vanuit tekst; I2VA begint bij een eerste frame en ontwikkelt verder; FL2VA reist van een eerste frame naar een laatste frame; L2VA convergeert naar een laatste frame vanuit een plausibele eerdere staat. De kern van de prompt is voor alle vier hetzelfde. De drie beeldtaken voegen één instructieregel toe vooraan.
Een afgewerkte prompt heeft twee delen: de instructieregel (alleen voor beeldtaken), één lege regel, dan de drie kernvelden integrated_multimodal_description, overall_soundscape en non_diegetic_music, elk in een eigen alinea en in het Engels geschreven. Elk detail moet iets zijn dat de kijker kan zien of horen.
Deze gids vat het officiële document samen in een referentietabel, een schrijfvolgorde, de officiële voorbeelden en de regels waar mensen vaak over struikelen. De bron is hierboven gelinkt en blijft leidend als er verschillen zijn.
Naslag
Naam | Type | Wat het is |
|---|---|---|
integrated_multimodal_description | core field | De tijdlijn, shot voor shot: visuele stijl, compositie, onderwerpen en hun posities, scène en rekwisieten, acties en reacties, cuts, camerabewegingen, sprekers, dialoog, zingen en het diegetische geluid dat erbij hoort. |
overall_soundscape | core field | Eén alinea van 1 tot 4 zinnen: omgevingsgeluid, geluiden van fysieke acties en niet-verbale menselijke geluiden (wind, regen, verkeer, voetstappen, stof, impacten, ademhaling, lachen) door de hele video. Geen dialoog, zingen of diegetische muziek hier. N/B alleen als de gebruiker om volledige stilte vraagt. |
non_diegetic_music | core field | 1 tot 3 zinnen over de muziek die alleen het publiek hoort: instrumentatie, tempo, ritme en dynamische veranderingen. Geen stemmingswoorden en geen uitleg over de emotionele rol. N/B als er geen muziek is. |
I2VA instruction | first line | Voor de doelvideo is bij 0.00 seconden in de doelvideo <Picture 1> (van [Shot 1]) volledig gerefereerd. |
FL2VA instruction | first line | Hoe de referentiebeelden uitlijnen met de doelvideo — Picture 1 (van Shot 1) valt samen met het 0.00-secondenpunt van de doelvideo; Picture 2 (van Shot N) valt samen met het S.SS-secondenpunt van de doelvideo. |
L2VA instruction | first line | Hoe de referentiebeelden uitlijnen met de doelvideo — <Picture 1> (van [Shot N]) valt samen met het S.SS-secondenpunt van de doelvideo. N is de index van het echte laatste shot; S.SS is de videolengte met precies twee decimalen. |
[Shot 1] | shot marker | Opent de beschrijving. Geen tijdstempel. Begint met de algemene stijl (Cinematisch, live-action, 2D-geanimeerd, 3D CG, kleianimatie, aquarel, vintage film) en de eerste compositie. |
[Shot 2] At 00:03.500, the camera cuts to ... | shot marker | Elk volgend shot: een oplopend nummer en een strikt toenemende cut-tijd binnen de videolengte, dan de cut-tekst en wat het nieuwe shot toont. |
(S1), (S2), (S1,S2) | speaker ID | Een vaste ID voor elk onderwerp dat spreekt, zingt of off-screen te horen is; dezelfde ID over shots heen; een samengestelde ID als meerdere genummerde sprekers samen vocaliseren. Personages die nooit spreken krijgen geen ID. |
<d>[English] ... </d> | dialogue tag | Alleen de taalcode en de exacte gesproken woorden, met elk origineel woord en leesteken precies zo. Wie spreekt, de actie en de manier van spreken blijven buiten het label. |
"..." | on-screen text | Elke banner, bord, label, ondertitel of neontekst die echt zichtbaar is, in Engelse dubbele aanhalingstekens, woord voor woord en niet vertaald. |
camera motion | phrase | Type beweging, plus amplitude en snelheid alleen als ze belangrijk zijn, geschreven als een natuurlijke actie binnen het shot: De camera duwt langzaam met kleine amplitude in op de gevouwen brief in haar handen. |
says in an off-screen voiceover | fixed phrase | De enige formulering voor voice-over. Direct na het <d>-blok aangeven dat de lippen van het personage op het scherm volledig gesloten blijven. |
AD

Geen installatie nodig – draai AI-modellen in de cloud
BitVector Prism is de makkelijkste manier om te beginnen: kies een model, typ een prompt en genereer in een overzichtelijke web-app, zonder iets in te stellen. BitVector is ook beschikbaar op Discord en op het web (SpyGlass).
Stap voor stap
- Kies de taak. Voor T2VA begin je direct met de drie kernvelden. Voor I2VA, FL2VA en L2VA schrijf je de uitlijningsinstructie als allereerste regel, laat je één lege regel, en schrijf je dan de velden. N is de index van het laatste shot en S.SS de effectieve lengte met twee decimalen.
- Open [Shot 1] met de stijl en de eerste compositie. Voor een beeldtaak neem je de stijl van de referentieafbeelding en houd je identiteit, kleding, kleuren, belangrijke objecten en ruimtelijke relaties consistent; voor T2VA kies je de stijl uit de opdracht.
- Schrijf de rest van de beschrijving langs de tijdlijn: uiterlijk en positie van de onderwerpen, scène en belangrijke rekwisieten, acties en reacties, shotwisselingen, gesproken woorden en het gesynchroniseerde diegetische geluid. Laat alles weg wat niet te zien of te horen is.
- Knip alleen als het nieuwe shot nieuwe info brengt over het onderwerp, ruimte, toestand, perspectief of tijd. Nummer de shots op volgorde en begin elk volgend shot met een strikt toenemende cut-tijd. Als alleen afstand of een kleine hoek verandert, beweeg dan de camera in plaats van te knippen.
- Schrijf camerabewegingen als acties: het type beweging, dan met kleine amplitude of met grote amplitude en op langzame of snelle snelheid alleen als dat belangrijk is. Middelmatige amplitude en normale snelheid laat je weg.
- Introduceer elke stem bij de eerste keer met genoeg info om stabiel te blijven (type personage, leeftijd, geslacht, op of buiten scherm, toonhoogte, klankkleur, spreektempo, accent) en de ID. Zet de exacte woorden binnen <d>[English] ... </d>, met leestekens, en vertaal of herschrijf ze nooit.
- Voor voice-over gebruik je de exacte uitdrukking says in an off-screen voiceover en voeg je direct na het label toe dat de lippen van het bijbehorende personage op het scherm volledig gesloten blijven.
- Als een regel dialoog of songtekst over een cut heen gaat, label je beide delen en zeg je dat het geluid doorloopt over de cut (loopt naadloos door over de cut, gaat ononderbroken door in het volgende shot, draagt over van het vorige shot, blijft hoorbaar over de overgang). Gesproken tekst die afgebroken wordt door het einde van de video label je ook.
- Zet zichtbare tekst op het scherm in dubbele aanhalingstekens, precies zoals het staat.
- Schrijf overall_soundscape als één alinea van 1 tot 4 zinnen over sfeer, actiegeluiden en niet-verbale menselijke geluiden voor de hele video. Dialoog, zingen en muziek die de personages horen staan al in de beschrijving, dus herhaal die niet.
- Schrijf non_diegetic_music in 1 tot 3 zinnen over instrumenten, tempo, ritme en dynamiek, of N/B. Radio, tv, telefoonmuziek en live zingen zijn diegetisch en horen in de beschrijving.
- Voor een beeldtaak volg je het aanbevolen pad. I2VA: anker eerste frame, begin actie, doorlopende ontwikkeling, resultaat of reactie. FL2VA: toestand eerste frame, waarneembare tussenliggende veranderingen, steeds kleinere verschillen, toestand laatste frame, meestal in één shot. L2VA: plausibele eerdere toestand, expliciete actie en overgangspad, geleidelijke convergentie in het laatste shot, landing laatste frame.
Voorbeelden
Camerabeweging geschreven als actie
The camera pushes in with small amplitude at slow speed toward the folded letter in her hands.
The camera pans right with large amplitude at fast speed, revealing the open doorway.
The camera holds a static shot as the runner exits the frame.
Sprekers, dialoog en voice-over
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>
The man (S1) says in an off-screen voiceover: <d>[English] I still remember that road.</d> while his lips remain completely closed.
A red neon sign reading "营业中" glows above the doorway.
Geval 1: T2VA (alleen tekst)
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium-wide shot frames a baker opening the shutters of a small street bakery before sunrise. The camera pushes in with small amplitude at slow speed as the middle-aged baker with a calm, slightly raspy voice (S1) places a fresh loaf on the wooden counter and says: <d>[English] First batch of the morning.</d> [Shot 2] At 00:05.000, the camera cuts to a close-up of steam rising from the sliced bread while the baker's final words carry over from the previous shot.
overall_soundscape: Wooden shutters scrape open over a quiet street as trays clink softly inside the bakery. The doorbell rings once, followed by light footsteps and the crisp sound of bread being sliced.
non_diegetic_music: A soft acoustic-guitar pattern at a moderate tempo, joined by sparse upright-bass notes and a gentle fade at the end.
Geval 2: I2VA (eerste frame)
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, the young woman shown in <Picture 1> remains beside the rain-covered train window, preserving her appearance, clothing, seat position, and the carriage layout. The camera trucks right with small amplitude at slow speed as she lifts her gaze from the folded letter toward the passing city lights. Her reflection moves across the glass while the quiet, breathy young woman (S1) says: <d>[English] I get off at the next station.</d> She folds the letter along its existing crease.
overall_soundscape: The train wheels produce a steady metallic rhythm beneath a low ventilation hum. Rain ticks against the window while paper rustles softly in her hands.
non_diegetic_music: Sustained cello notes at a slow tempo with widely spaced piano tones, gradually decreasing in volume.
Geval 3: FL2VA (eerste en laatste frame, één shot van acht seconden)
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a rain-soaked cyclist begins in the position and framing established by Picture 1, holding a closed black umbrella beside a silver bicycle. The camera pulls out with small amplitude at slow speed as she releases the bicycle handle, raises the umbrella above her shoulder, and presses the runner upward until the canopy opens. Water rolls from the expanding fabric while she steps beneath it, rotates the handle into the final angle, and settles into the pose, spacing, and composition established by Picture 2 at the end of the shot.
overall_soundscape: Rain falls steadily on the pavement, followed by the metallic click of the umbrella runner and the soft snap of the canopy opening. Water drips from the bicycle frame as distant traffic passes.
non_diegetic_music: N/A
Geval 4: L2VA (laatste frame, één shot van zes seconden)
How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 6.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a close shot begins with an intact drinking glass near the edge of a dark wooden table, while the same hand and sleeve visible in <Picture 1> approach from the right. The camera pushes in with small amplitude at slow speed as the fingertips strike the rim. The glass tips, falls, and hits the floor with a sharp impact; cracks spread through it as fragments slide outward. Toward the end, the moving pieces lose momentum and settle into the exact broken arrangement, hand position, camera angle, lighting, and final composition established by <Picture 1>.
overall_soundscape: Fingertips tap the glass before it scrapes across the tabletop, falls, and breaks with a sharp crash. Small fragments scatter and gradually stop sliding across the floor.
non_diegetic_music: A low electronic pulse at a slow tempo, ending immediately after the glass breaks.
Tips
- Bewegingssoorten die de gids noemt: Zoom In / Zoom Out (brandpuntsafstand verandert, camera stil), Push In / Pull Out (camera beweegt naar voren of achteren), Pan Left / Right (lens draait horizontaal), Truck Left / Right (camera schuift zijwaarts), Tilt Up / Down (lens draait verticaal), Pedestal Up / Down (hele camera gaat omhoog of omlaag), Arc Shot, Tracking Shot, Static Shot, Shake Slightly / Shake Strongly, POV, Roll Clockwise / Counterclockwise. Amplitude: met kleine amplitude, met grote amplitude. Snelheid: op langzame snelheid, op snelle snelheid.
- Cut-woorden: the camera cuts to, the shot cuts to, the shot transitions to, the shot changes to, the shot switches to. Cross-dissolve, fade en wipe alleen als de gebruiker erom vraagt.
- FL2VA geeft de voorkeur aan één shot zodat het model continu kan interpoleren; gebruik meerdere shots alleen als ze expliciet zijn opgegeven, en het laatste frame moet bereikt worden door het laatste shot aan het einde van de video.
- Voor L2VA hoort de afbeelding bij het laatste shot, niet bij Shot 1. Begin bij een eerdere toestand die plausibel naar het laatste frame leidt.
- Het muziekveld gaat over instrumenten, snelheid, ritme en dynamiek. Laat stemmingswoorden en wat de muziek het publiek moet laten voelen weg.
- Beschrijf geluid dat aan een actie vastzit in de beschrijving naast die actie; het geluidsspectrum is de samenvatting voor de hele video, niet een tweede script.
- Eén lege regel tussen de instructie en de velden, en één tussen de velden, precies zoals in de officiële voorbeelden.
Probleemoplossing
De video eindigt niet op het laatste frame
Waarom het gebeurt
Bij FL2VA of L2VA werd de referentieafbeelding beschreven als een stilstaand beeld, bereikt in een eerder shot, of de uitlijningstijd kwam niet overeen met de werkelijke lengte van de video.
Zo los je het op
Schrijf het bewegingspad dat de toestanden verbindt in plaats van twee beschrijvingen, laat de convergentie plaatsvinden in het laatste [Shot N], en zet de S.SS-uitlijningstijd op de effectieve duur met twee decimalen.
Lippen bewegen tijdens een voice-over
Waarom het gebeurt
De voice-over was niet gemarkeerd met de exacte uitdrukking, of de zin over gesloten lippen na het <d>-blok ontbrak.
Zo los je het op
Gebruik says in an off-screen voiceover en voeg direct na het label toe dat de lippen van het personage op het scherm volledig gesloten blijven.
De gesproken woorden zijn herschreven, vertaald of aangevuld
Waarom het gebeurt
Aantekeningen over de manier van spreken of beschrijvingen kwamen binnen het <d>-label, of de woorden werden herschreven in plaats van exact overgenomen.
Zo los je het op
Binnen <d>[English] ... </d> houd je alleen de taalcode en de exacte woorden met leestekens; zet de identiteit van de spreker, actie en manier van spreken buiten het label.
Cuts voelen willekeurig of shots lopen door elkaar
Waarom het gebeurt
Een cut voegt geen nieuwe info toe, ontbrekende of niet-opeenvolgende cut-tijden, of een tijdstempel op het eerste shot.
Zo los je het op
Geen tijdstempel op [Shot 1]; elk volgend shot begint met een strikt toenemende tijd binnen de videolengte en een cut-tekst; vervang kleine herkadering door een camerabeweging.
De soundtrack is algemeen of dubbel de dialoog
Waarom het gebeurt
Stemmingswoorden in non_diegetic_music, of dialoog en zingen herhaald in overall_soundscape.
Zo los je het op
Beschrijf instrumenten, tempo, ritme en dynamiek in het muziekveld; houd het geluidsspectrum bij sfeer, actiegeluiden en niet-verbale menselijke geluiden.
AD

Geen installatie nodig – draai AI-modellen in de cloud
PirateDiffusion is alleen op Telegram en gemaakt voor pro's: duizenden modellen, LoRA's en workflows via chatcommando's, met onbeperkt genereren voor een vaste prijs.
Vragen
Heeft het eerste shot een tijdstempel nodig?
Nee. [Shot 1] heeft geen tijd. Elk volgend shot begint met een strikt toenemende cut-tijd die binnen de videolengte valt, bijvoorbeeld [Shot 2] At 00:03.500, the camera cuts to ...
Wat komt er in het dialooglabel?
Alleen de taalcode en de exacte gesproken inhoud, met elk origineel woord en leesteken precies zo. De identiteit, ID, actie en manier van spreken van de spreker blijven buiten het label.
Wat als niemand spreekt?
Dan krijgt geen enkel personage een spreker-ID. Het geluidsspectrum beschrijft nog steeds sfeer en actiegeluiden; N/B is voor een video die helemaal stil moet zijn.
Kan een FL2VA-prompt meerdere shots hebben?
Alleen als de gebruiker dat expliciet vraagt. Eén shot laat het model interpoleren van het eerste naar het laatste frame; hoeveel shots er ook zijn, het laatste frame moet bereikt worden door het laatste shot.
Waar hoort muziek die de personages horen?
Radio, televisie, telefoonmuziek, instrumenten en zingen zijn diegetische gebeurtenissen en horen in integrated_multimodal_description. non_diegetic_music is alleen voor de muziek die het publiek hoort.
Is er een formaat voor referentie-audio en stemklonen?
Ja. Full-reference mode heeft een eigen zesdelige structuur in MiniMax's referentiegids, hieronder gelinkt. Mark White's audio prompting guide legt uit hoe je een referentiestem aan een spreker koppelt.
Links en bronnen
- MiniMax's official video prompt writing guide (base tasks)
- MiniMax's reference-mode prompt writing guide
- MiniMax H3 model card on Hugging Face
Modellen in deze gids
Geschreven door
Captain
Verwante gidsen
Prompten
Prompting MiniMax H3: tekst naar video, afbeelding naar video, referentievideo en audio
Hoe je MiniMax H3 aanstuurt vanuit een chatcommando: het WHO + WHERE + ACTION + CAMERA + SOUND recept voor tekst naar video, een stilstaand beeld animeren met afbeelding naar video, elke referentieafbeelding een taak geven in referentiemodus, en duidelijke dialogen krijgen in plaats van gemompel. Met kopieer-en-probeer prompts en de PDF van de auteur.
Door Mark White
2026-09-20
ComfyUI
ComfyUI nodes: documentatie en probleemoplossing
Eenvoudige uitleg over de ComfyUI nodes die mensen het meest gebruiken: wat elke node doet, alle inputs en outputs, hoe je ze koppelt, de belangrijke instellingen, en de fouten die ze geven met de oplossing voor elke fout.
Door Captain
2026-06-02
Videomodellen
Wan 2.2 video: tekst-naar-video en afbeelding-naar-video setup, instellingen en LoRA's
Eerste resultaten met Wan 2.2: welke modelgrootte kies je (5B of 14B), het high-noise / low-noise expertpaar, resolutie en aantal frames die werken, de lightning LoRA's die renders terugbrengen tot vier stappen, promptstructuur voor beweging, en hoe je het gehost draait als je kaart te klein is.
Door Captain
2026-05-24
Meer gidsen
Modellen
FLUX.1 Dev: hoe je het aanstuurt, beste instellingen en creatieve ideeën
Een praktische gids voor FLUX.1 Dev van Black Forest Labs: natuurlijk-taal prompts, begeleiding en stapinstellingen, LoRA stapeling, tekstweergave en promptideeën die goed werken met dit model.
Door Captain
2026-09-30
Modellen
Stable Diffusion XL 1.0: prompts, instellingen en waar het nog steeds het beste in is
Hoe je het meeste haalt uit het officiële SDXL 1.0 basismodel: native resoluties, CFG- en sampler-instellingen, de refiner, negatieve prompts en ideeën voor stijlen waarin SDXL nog steeds uitblinkt.
Door Captain
2026-10-01
Modellen
Stable Diffusion 1.5: het klassieke model, goed aangestuurd
Stable Diffusion 1.5 is nog steeds de moeite waard om te kennen: de juiste resolutie, CFG en sampler, hoe je de enorme bibliotheek met LoRAs en embeddings gebruikt, en creatieve promptideeën die passen bij een 512-pixel model.
Door Captain
2026-10-02
Modellen
FLUX.2 Dev: prompten met het nieuwste model van Black Forest Labs
FLUX.2 Dev brengt langere prompts, betere tekst, sterkere realisme en multi-reference bewerking. Deze gids behandelt de turbo workflow, guidance en resolutie-instellingen, promptstructuur en ideeën die gebruikmaken van de nieuwe mogelijkheden.
Door Captain
2026-10-03
Modellen
Qwen-Image: lange prompts, perfecte tekst en tweetalige posters
Qwen-Image is het model dat je moet gebruiken als de woorden in de afbeelding belangrijk zijn. Leer hoe je lange, beschrijvende prompts schrijft, Engelse en Chinese tekst nauwkeurig weergeeft, CFG en stappen instelt, en creatieve ideeën met veel lay-out onderzoekt.
Door Captain
2026-09-29
Modellen
SDXL-Lightning: vierstaps generatie op elk SDXL-checkpoint
ByteDance's SDXL-Lightning LoRA verandert een 30-stappen SDXL-render in een van 4 stappen. Leer het aantal stappen, de CFG die je moet gebruiken, de sampler, en hoe je het combineert met je favoriete checkpoints en stijl-LoRA's.
Door Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Gemaakt in Japan
|
© 2026