Model
Trends
.ai
Model
Trends
.ai
de bästa AI-modellerna med öppen källkod

MiniMax H3 videopromptar: den officiella strukturen

Ämne: Videomodeller
Av Captain
Publicerad 2026-09-14
Hur MiniMax vill att en H3-prompt ska skrivas: justeringsraden för bildankrade videor, de tre kärnfälten, tagningar och klipp, kamerarörelser, talar-ID:n och dialogtaggar, ljudbilden och musiken. Sammanfattat från den officiella promptskrivarguiden.
Senaste informationen
Den här guiden är en ögonblicksbild. Källan nedan hålls uppdaterad av sina skapare; se där för de senaste detaljerna.
MiniMax's official video prompt writing guide (Hugging Face)

Översikt

MiniMax H3
skapar video med ljud från en prompt. Det finns fyra uppgifter: T2VA bygger hela audiovisuella tidslinjen från text; I2VA börjar från en första bildruta och utvecklas framåt; FL2VA går från en första bildruta till en sista; L2VA konvergerar mot en sista bildruta från ett rimligt tidigare tillstånd. Huvuddelen av prompten är densamma för alla fyra. De tre bilduppgifterna lägger till en instruktionsrad framför den.
En färdig prompt har två delar: instruktionsraden (endast för bilduppgifter), en tom rad, sedan de tre kärnfälten integrated_multimodal_description, overall_soundscape och non_diegetic_music, var och en i eget stycke och skrivna på engelska. Varje detalj i dem måste vara något tittaren kan se eller höra.
Den här guiden sammanfattar det officiella dokumentet till en referenstabell, en skrivordning, de officiella exemplen och de regler folk ofta missar. Källan är länkad ovan och är auktoriteten när de skiljer sig.

Referens

Namn
Typ
Vad det är
integrated_multimodal_description
core field
Tidslinjen, tagning för tagning: visuell stil, komposition, motiv och deras positioner, scen och rekvisita, handlingar och reaktioner, klipp, kamerarörelser, talare, dialog, sång och det diegetiska ljud som hör till dem.
overall_soundscape
core field
Ett stycke med 1 till 4 meningar: bakgrundsljud, ljud från fysiska handlingar och icke-verbala mänskliga ljud (vind, regn, trafik, fotsteg, tyg, stötar, andning, skratt) över hela videon. Ingen dialog, sång eller diegetisk musik här. N/A endast när användaren begär total tystnad.
non_diegetic_music
core field
1 till 3 meningar om musiken som bara publiken hör: instrumentering, tempo, rytm och dynamiska förändringar. Inga stämningsord och ingen förklaring av dess känslomässiga roll. N/A när det inte finns någon musik.
I2VA instruction
first line
För målvideon, vid 0.00 sekunder in i målvideon, är <Picture 1> (från [Shot 1]) helt refererad.
FL2VA instruction
first line
Hur referensbilderna stämmer med målvideon — Bild 1 (från Tagning 1) stämmer med 0.00-sekundersmärket i målvideon; Bild 2 (från Tagning N) stämmer med S.SS-sekundersmärket i målvideon.
L2VA instruction
first line
Hur referensbilderna stämmer med målvideon — <Picture 1> (från [Shot N]) stämmer med S.SS-sekundersmärket i målvideon. N är index för den verkliga sista tagningen; S.SS är videons längd med exakt två decimaler.
[Shot 1]
shot marker
Öppnar beskrivningen. Ingen tidsstämpel. Börjar med den övergripande stilen (Cinematic, live-action, 2D-animated, 3D CG, claymation, watercolor, vintage film) och den första kompositionen.
[Shot 2] At 00:03.500, the camera cuts to ...
shot marker
Varje senare tagning: ett sekventiellt nummer och en strikt ökande klipptid inom videons längd, sedan klippfrasen och vad den nya tagningen visar.
(S1), (S2), (S1,S2)
speaker ID
Ett stabilt ID för varje motiv som talar, sjunger eller hörs utanför bild; samma ID över tagningar; ett sammansatt ID när numrerade talare sjunger tillsammans. Karaktärer som aldrig talar får inget.
<d>[English] ... </d>
dialogue tag
Endast språktaggen och de exakta uttalade orden, med varje originalord och skiljetecken kvar. Vem som talar, handlingen och leveransen är utanför taggen.
"..."
on-screen text
Alla banderoller, skyltar, etiketter, undertexter eller neontext som verkligen syns, inom engelska citattecken, ordagrant och oöversatt.
camera motion
phrase
Rörelsetyp, plus amplitud och hastighet endast när de är viktiga, skrivna som en naturlig handling i tagningen: Kameran trycker in med liten amplitud i långsam hastighet mot det vikta brevet i hennes händer.
says in an off-screen voiceover
fixed phrase
Den enda formuleringen för voiceover. Direkt efter <d>-blocket anges att den på skärmen synliga karaktärens läppar förblir helt slutna.
AD
Inget att installera - kör AI-modeller i molnet
BitVector Prism är det enklaste sättet att komma igång: välj en modell, skriv en prompt och generera i en ren webbapp, utan någon installation alls. BitVector finns också på Discord och på webben (SpyGlass).

Steg för steg

  1. Välj uppgiften. För T2VA börja direkt med de tre kärnfälten. För I2VA, FL2VA och L2VA skriv justeringsinstruktionen som allra första rad, lämna en tom rad, skriv sedan fälten. N är index för sista tagningen och S.SS den faktiska längden med två decimaler.
  2. Öppna [Shot 1] med stil och initial komposition. För en bilduppgift ta stilen från referensbilden och behåll identitet, kläder, färger, nyckelobjekt och rumsliga relationer konsekventa med den; för T2VA välj stil från förfrågan.
  3. Skriv resten av beskrivningen längs tidslinjen: utseende och position för motiven, scen och viktiga rekvisita, handlingar och reaktioner, tagningbyten, uttalade ord och synkroniserat diegetiskt ljud. Utelämna allt som inte kan ses eller höras.
  4. Klipp bara när den nya tagningen tillför ny information om motivet, rummet, tillståndet, synvinkeln eller tiden. Numrera tagningarna i ordning och börja varje senare med en strikt ökande klipptid. När bara avstånd eller en liten vinkel ändras, flytta kameran istället för att klippa.
  5. Skriv kamerarörelser som handlingar: rörelsetyp, sedan med liten amplitud eller med stor amplitud och i långsam eller snabb hastighet endast när det är meningsfullt. Medelamplitud och normal hastighet utelämnas.
  6. Introducera varje röst vid första förekomst med tillräcklig identitet för att vara stabil (karaktärstyp, ålder, kön, på eller utanför skärmen, tonhöjd, klang, talhastighet, accent) och dess ID. Sätt exakta orden inom <d>[English] ... </d>, behåll skiljetecken och översätt eller skriv aldrig om dem.
  7. För voiceover använd exakt fras says in an off-screen voiceover och lägg till direkt efter taggen att motsvarande karaktärs läppar på skärmen förblir helt slutna.
  8. När en dialog- eller sångrad korsar ett klipp, tagga båda delarna och säg att ljudet fortsätter över klippet (fortsätter sömlöst över klippet, fortsätter obrutet in i nästa tagning, bärs över från föregående tagning, förblir hörbart över övergången). Tal som avbryts av videons slut taggas också.
  9. Sätt synlig text på skärmen inom dubbla citattecken, exakt som den står.
  10. Skriv overall_soundscape som ett stycke med 1 till 4 meningar om bakgrundsljud, handlingsljud och icke-verbala mänskliga ljud för hela videon. Dialog, sång och musik som karaktärerna hör finns redan i beskrivningen, så upprepa dem inte.
  11. Skriv non_diegetic_music i 1 till 3 meningar om instrument, tempo, rytm och dynamik, eller N/A. Radio, TV, telefonmusik och live-sång är diegetiska och hör hemma i beskrivningen.
  12. För en bilduppgift följ den rekommenderade vägen. I2VA: första bildruta som ankare, handlingens början, kontinuerlig utveckling, resultat eller reaktion. FL2VA: första bildrutans tillstånd, observerbara mellanliggande förändringar, successivt minskande skillnader, sista bildrutans tillstånd, oftast i en tagning. L2VA: rimligt föregående tillstånd, tydlig handling och övergångsväg, gradvis konvergens i sista tagningen, landning i sista bildrutan.

Exempel

Kamerarörelser skrivna som en handling

The camera pushes in with small amplitude at slow speed toward the folded letter in her hands.
The camera pans right with large amplitude at fast speed, revealing the open doorway.
The camera holds a static shot as the runner exits the frame.

Talare, dialog och voiceover

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>
The man (S1) says in an off-screen voiceover: <d>[English] I still remember that road.</d> while his lips remain completely closed.
A red neon sign reading "营业中" glows above the doorway.

Exempel 1: T2VA (endast text)

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium-wide shot frames a baker opening the shutters of a small street bakery before sunrise. The camera pushes in with small amplitude at slow speed as the middle-aged baker with a calm, slightly raspy voice (S1) places a fresh loaf on the wooden counter and says: <d>[English] First batch of the morning.</d> [Shot 2] At 00:05.000, the camera cuts to a close-up of steam rising from the sliced bread while the baker's final words carry over from the previous shot.
overall_soundscape: Wooden shutters scrape open over a quiet street as trays clink softly inside the bakery. The doorbell rings once, followed by light footsteps and the crisp sound of bread being sliced.
non_diegetic_music: A soft acoustic-guitar pattern at a moderate tempo, joined by sparse upright-bass notes and a gentle fade at the end.

Exempel 2: I2VA (första bildruta)

For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, the young woman shown in <Picture 1> remains beside the rain-covered train window, preserving her appearance, clothing, seat position, and the carriage layout. The camera trucks right with small amplitude at slow speed as she lifts her gaze from the folded letter toward the passing city lights. Her reflection moves across the glass while the quiet, breathy young woman (S1) says: <d>[English] I get off at the next station.</d> She folds the letter along its existing crease.
overall_soundscape: The train wheels produce a steady metallic rhythm beneath a low ventilation hum. Rain ticks against the window while paper rustles softly in her hands.
non_diegetic_music: Sustained cello notes at a slow tempo with widely spaced piano tones, gradually decreasing in volume.

Exempel 3: FL2VA (första och sista bildruta, en åttasekunders tagning)

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a rain-soaked cyclist begins in the position and framing established by Picture 1, holding a closed black umbrella beside a silver bicycle. The camera pulls out with small amplitude at slow speed as she releases the bicycle handle, raises the umbrella above her shoulder, and presses the runner upward until the canopy opens. Water rolls from the expanding fabric while she steps beneath it, rotates the handle into the final angle, and settles into the pose, spacing, and composition established by Picture 2 at the end of the shot.
overall_soundscape: Rain falls steadily on the pavement, followed by the metallic click of the umbrella runner and the soft snap of the canopy opening. Water drips from the bicycle frame as distant traffic passes.
non_diegetic_music: N/A

Exempel 4: L2VA (sista bildruta, en sexsekunders tagning)

How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 6.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a close shot begins with an intact drinking glass near the edge of a dark wooden table, while the same hand and sleeve visible in <Picture 1> approach from the right. The camera pushes in with small amplitude at slow speed as the fingertips strike the rim. The glass tips, falls, and hits the floor with a sharp impact; cracks spread through it as fragments slide outward. Toward the end, the moving pieces lose momentum and settle into the exact broken arrangement, hand position, camera angle, lighting, and final composition established by <Picture 1>.
overall_soundscape: Fingertips tap the glass before it scrapes across the tabletop, falls, and breaks with a sharp crash. Small fragments scatter and gradually stop sliding across the floor.
non_diegetic_music: A low electronic pulse at a slow tempo, ending immediately after the glass breaks.

Tips

  • Rörelsetyper guiden nämner: Zoom In / Zoom Out (fokuslängdsändringar, kamera stilla), Push In / Pull Out (kamera rör sig framåt eller bakåt), Pan Left / Right (lins pivoterar horisontellt), Truck Left / Right (kamera glider sidledes), Tilt Up / Down (lins pivoterar vertikalt), Pedestal Up / Down (hela kameran höjs eller sänks), Arc Shot, Tracking Shot, Static Shot, Shake Slightly / Shake Strongly, POV, Roll Clockwise / Counterclockwise. Amplitud: med liten amplitud, med stor amplitud. Hastighet: i långsam hastighet, i snabb hastighet.
  • Klippfraser: kameran klipper till, tagningen klipper till, tagningen övergår till, tagningen ändras till, tagningen byter till. Cross-dissolve, fade och wipe endast när användaren begär dem.
  • FL2VA föredrar en enda tagning så modellen kan interpolera kontinuerligt; använd flera tagningar endast när de uttryckligen anges, och sista bildrutan måste nås av sista tagningen i slutet av videon.
  • För L2VA hör bilden till sista tagningen, inte till Tagning 1. Börja från ett tidigare tillstånd som rimligt kan leda till det.
  • Musikfältet handlar om instrument, tempo, rytm och dynamik. Utelämna stämningsord och vad musiken ska få publiken att känna.
  • Beskriv ljud som är kopplat till en handling i beskrivningen bredvid handlingen; ljudbilden är sammanfattningen för hela videon, inte ett andra manus.
  • En tom rad mellan instruktionen och fälten, och en mellan fälten, precis som i de officiella exemplen.

Felsökning

Videon landar inte på sista bildrutan

Varför det händer
I FL2VA eller L2VA beskrevs referensbilden som en statisk bild, nådd i en tidigare tagning, eller justeringstiden stämde inte med videons verkliga längd.

Så löser du det
Skriv rörelsebanan som kopplar tillstånden istället för två beskrivningar, låt konvergensen ske i sista [Shot N], och sätt S.SS justeringstiden till den faktiska varaktigheten med två decimaler.

Läppar rör sig under voiceover

Varför det händer
Voiceovern markerades inte med exakt fras, eller meningen om slutna läppar efter <d>-blocket saknades.

Så löser du det
Använd says in an off-screen voiceover och lägg till direkt efter taggen att den på skärmen synliga karaktärens läppar förblir helt slutna.

De uttalade orden kommer omskrivna, översatta eller utökade

Varför det händer
Leveransanteckningar eller beskrivningar hamnade inuti <d>-taggen, eller orden omskrevs istället för att skrivas exakt.

Så löser du det
Inuti <d>[English] ... </d> behåll bara språktaggen och exakta orden med skiljetecken; sätt talarens identitet, handling och leverans utanför taggen.

Klipp känns slumpmässiga eller tagningarna är i fel ordning

Varför det händer
Ett klipp som inte tillför ny information, saknade eller icke-ökande klipptider, eller en tidsstämpel på första tagningen.

Så löser du det
Ingen tidsstämpel på [Shot 1]; varje senare tagning börjar med en strikt ökande tid inom videons längd och en klippfras; ersätt små omramningar med kamerarörelse.

Ljudspåret är generiskt eller dubblerar dialogen

Varför det händer
Stämningsord i non_diegetic_music, eller dialog och sång upprepade i overall_soundscape.

Så löser du det
Beskriv instrument, tempo, rytm och dynamik i musikfältet; håll ljudbilden till bakgrundsljud, handlingsljud och icke-verbala mänskliga ljud.

AD
PirateDiffusion
Inget att installera - kör AI-modeller i molnet
PirateDiffusion finns bara på Telegram och är byggt för proffs: tusentals modeller, LoRA och arbetsflöden som styrs med chattkommandon, med obegränsad generering till ett fast pris.

Frågor

Behöver första tagningen en tidsstämpel?

Nej. [Shot 1] har ingen tid. Varje senare tagning börjar med en strikt ökande klipptid som ligger inom videons längd, till exempel [Shot 2] At 00:03.500, the camera cuts to ...

Vad ska in i dialogtaggen?

Endast språktaggen och exakt vad som sägs, med varje originalord och skiljetecken kvar ordagrant. Talarnas identitet, ID, handling och leverans är utanför taggen.

Vad händer om ingen talar?

Då får ingen karaktär ett talar-ID. Ljudbilden beskriver ändå bakgrund och handlingsljud; N/A används för video som måste vara helt tyst.

Kan en FL2VA-prompt ha flera tagningar?

Endast när användaren uttryckligen ber om det. En tagning låter modellen interpolera från första till sista bildruta; oavsett antal måste sista bildrutan nås av sista tagningen.

Var hör musik som karaktärerna kan höra hemma?

Radio, TV, telefonmusik, instrument och sång är diegetiska händelser och hör hemma i integrated_multimodal_description. non_diegetic_music är bara för musiken publiken hör.

Finns det format för referensljud och röstkloning?

Ja. Full-reference-läge har sitt eget sexdelade format i MiniMaxs referensguide, länkad nedan. Mark Whites guide för ljudpromptar visar hur man binder en referensröst till en talare.

Länkar och källor

Modeller i den här guiden

Skriven av
Captain

Relaterade guider

Promptning
Prompting MiniMax H3: text till video, bild till video, referensvideo och ljud
Hur du styr MiniMax H3 från ett chattkommando: receptet WHO + WHERE + ACTION + CAMERA + SOUND för text till video, animera en stillbild med bild till video, ge varje referensbild en uppgift i referensläge och få ren dialog istället för mumlande. Med kopiera-och-försök-promptar och författarens PDF.
Av Mark White
2026-09-20
ComfyUI
ComfyUI-noder: dokumentation och felsökning
Dokumentation på enkelt språk för de ComfyUI-noder som folk använder mest: vad varje nod gör, alla ingångar och utgångar, hur man kopplar dem, viktiga inställningar och vilka fel de ger med lösningar för varje.
Av Captain
2026-06-02
Videomodeller
Wan 2.2 video: text-till-video och bild-till-video setup, inställningar och LoRAs
Få dina första resultat från Wan 2.2: vilken modellstorlek du ska välja (5B eller 14B), expertparet med hög brusnivå / låg brusnivå, upplösning och antal bilder som funkar, lightning-LoRAs som kortar ner renderingar till fyra steg, promptstruktur för rörelse och hur du kör det hostat när kortet är för litet.
Av Captain
2026-05-24

Fler guider

Modeller
FLUX.1 Dev: hur du promptar det, bästa inställningarna och kreativa idéer
En praktisk guide till FLUX.1 Dev från Black Forest Labs: naturligt språk för prompts, styrning och steginställningar, LoRA-stapling, textrendering och promptidéer som spelar på dess styrkor.
Av Captain
2026-09-30
Modeller
Stable Diffusion XL 1.0: prompts, inställningar och vad den fortfarande är bäst på
Hur du får ut mest av den officiella SDXL 1.0 basmodellen: inbyggda upplösningar, CFG- och sampler-inställningar, refiner, negativa prompts och idéer för stilar där SDXL fortfarande glänser.
Av Captain
2026-10-01
Modeller
Stable Diffusion 1.5: den klassiska modellen, rätt promptad
Stable Diffusion 1.5 är fortfarande värd att känna till: rätt upplösning, CFG och sampler, hur du använder dess stora bibliotek av LoRAs och embeddings, och kreativa promptidéer som passar en 512-pixelmodell.
Av Captain
2026-10-02
Modeller
FLUX.2 Dev: promptning av den senaste modellen från Black Forest Labs
FLUX.2 Dev ger längre prompts, bättre text, starkare realism och redigering med flera referenser. Den här guiden täcker turboarbetsflödet, styrning och upplösningsinställningar, promptstruktur och idéer som använder dess nya styrkor.
Av Captain
2026-10-03
Modeller
Qwen-Image: långa prompts, perfekt text och tvåspråkiga affischer
Qwen-Image är modellen du ska använda när orden i bilden är viktiga. Lär dig hur du skriver långa beskrivande prompts, återger engelska och kinesiska texter korrekt, ställer in CFG och steg, och utforskar kreativa idéer med mycket layout.
Av Captain
2026-09-29
Modeller
SDXL-Lightning: fyrastegs-generering på vilken SDXL-checkpoint som helst
ByteDance:s SDXL-Lightning LoRA förvandlar en 30-stegs SDXL-rendering till en på 4 steg. Lär dig antal steg, vilken CFG du måste använda, samplern och hur du kombinerar den med dina favoritcheckpoints och stil-LoRAs.
Av Captain
2026-09-30