Model
Trends
.ai
Model
Trends
.ai
les meilleurs modèles d'IA open source

MiniMax H3 : texte en vidéo, image en vidéo, vidéo de référence et audio

Sujet : Prompting
Par Mark White
Publié le 2026-09-20
Share
Informations à jour
Ce guide est un instantané. La source ci-dessous est tenue à jour par ses auteurs ; consultez-la pour les derniers détails.
MiniMax's official prompt writing guide

Aperçu

MiniMax H3
crée un court clip avec ses propres voix, sons et musique à partir d’un seul prompt. Sur
PirateDiffusion
, il fonctionne comme un workflow : tape la commande, mets la description de la scène après, et joins des images quand le plan doit commencer à partir d’une image ou s’en inspirer. Six secondes, c’est un instant, pas un film entier, donc chaque prompt ci-dessous décrit une petite scène avec un début, un changement et une fin claire.
Le texte en vidéo n’a pas besoin d’image : tes mots construisent le sujet, le décor et l’action. La recette est QUI + OÙ + ACTION + CAMÉRA + SON. Décris le sujet et le décor, donne-leur une action principale et une réaction, choisis ce que fait la caméra, et finis avec les sons que tu veux.
Image en vidéo commence à partir d’une image que tu télécharges et appelles avec /image1: suivi de son nom. La recette devient IMAGE DE DÉPART + MOUVEMENT + RÉACTION + CAMÉRA + SON : garde l’identité, les vêtements et le décor existants, décris comment le sujet bouge, ce qui réagit à ce mouvement et où le plan se termine.
La référence à la vidéo utilise le même workflow avec un type de prompt différent : jusqu’à quatre images fournissent des traits sélectionnés (visage et cheveux, corps et tenue, décor, un accessoire) au lieu de définir la scène d’ouverture, et tu peux aussi répondre à une courte vidéo téléchargée d’environ 5 à 10 secondes pour emprunter son action, son timing, sa caméra et son décor.
L’audio est écrit, pas téléchargé. Pour les workflows de base texte et image, le format officiel du prompt a trois champs : integrated_multimodal_description pour la scène, les actions, les intervenants et le dialogue exact ; overall_soundscape pour l’ambiance et les sons physiques ; et non_diegetic_music pour la musique, mis à N/A quand tu ne veux pas de musique. Les mots parlés vont dans les balises <d>[English] ... </d>, les notes sur la voix et la façon de parler restent en dehors, et chaque intervenant garde un ID cohérent comme (S1). Les indications vagues sur la parole sont là où le marmonnement commence.

Référence

Nom
Type
Rôle
/workflow /run:omni-eros-h3
command
Lance le workflow H3 sur PirateDiffusion. La description de la scène va après la commande.
/size:768x896
setting
Largeur x hauteur du clip en pixels.
/length:145
setting
Images, pas secondes. À 24 fps par défaut, 145 images font environ six secondes.
/image1:name
setting
Utilise une image téléchargée. En image en vidéo, c’est la scène d’ouverture ; en mode référence, elle fournit seulement les traits que tu lui assignes. Jusqu’à quatre images (/image1 à /image4).
Reply to a video
reference
Répondre à une vidéo téléchargée de 5 à 10 secondes lui permet de contrôler l’action, le timing, la caméra et le décor, ou d’emprunter juste le mouvement que tu nommes. Les références audio ne sont pas prises en charge.
WHO + WHERE + ACTION + CAMERA + SOUND
recipe
La recette texte en vidéo : sujet et décor, une action principale et une réaction, un travail de caméra, puis les sons.
STARTING IMAGE + MOVEMENT + REACTION + CAMERA + SOUND
recipe
La recette image en vidéo : nomme ce qu’il y a sur l’image, puis dirige ce qui se passe ensuite.
integrated_multimodal_description
text
La scène, les actions, les intervenants et leur dialogue exact, plan par plan.
overall_soundscape
text
Ambiance et sons physiques entendus pendant le plan.
non_diegetic_music
text
La musique de fond. Écris N/A quand tu ne veux pas de musique.
<d>[English] ... </d>
tag
Encadre les mots exacts prononcés. Les notes sur la voix et la façon de parler restent en dehors des balises.
(S1), (S2)
speaker ID
Une étiquette cohérente pour chaque intervenant, utilisée à chaque fois que cette personne parle.
AD
Aucune installation requise – exécutez les modèles IA dans le cloud
BitVector Prism est la façon la plus simple de commencer : choisissez un modèle, tapez un prompt et générez dans une application web épurée, sans rien configurer. BitVector est aussi disponible sur Discord et sur le web (SpyGlass).

Pas à pas

  1. Choisis le mode. Pas d’image : texte en vidéo. Une image qui doit être la première image : image en vidéo avec /image1:. Des images ou une vidéo qui doivent fournir des traits ou un mouvement pour une nouvelle scène : mode référence, même commande, prompt différent.
  2. Remplace les étiquettes d’humeur par des comportements. « Elle est soulagée » dit à H3 l’émotion ; « le loquet s’ouvre, ses épaules tombent et elle souffle » lui donne une cause et une réponse visible. Choisis deux ou trois comportements liés au lieu de diriger chaque muscle.
  3. Montre la cause et l’effet. Rends le mouvement physique : les pieds touchent le sol, les genoux fléchissent, le poids se déplace, puis le corps se stabilise. Pour un atterrissage, décris les jambes de train qui se compressent après le contact.
  4. Donne un travail clair à la caméra. Spécifie la vue de départ, le mouvement et la destination : « un lent zoom depuis une vue taille jusqu’à son visage. » Un gros plan ne peut pas montrer toute la pièce ; choisis ce qui compte le plus et garde les objets importants dans le cadre.
  5. Décris la lumière qui crée l’ambiance. Remplace un tas de mots de qualité par des choix visibles : « lumière chaude de la lampe de bureau sur son visage, lumière froide du jour par la fenêtre derrière elle. » Choisis un style cohérent.
  6. Pour image en vidéo, commence par ce qui est vraiment là. Nomme brièvement l’état d’ouverture (« elle est assise avec les deux mains autour de la tasse »), puis ajoute le mouvement en couches : une action principale, puis une petite réaction causée par elle (les cheveux suivent le mouvement, une manche se plie). Adapte le cadrage à la tâche et finis avec une réaction vivante au lieu d’une image figée.
  7. Pour le mode référence, donne un rôle à chaque référence avant de décrire la scène. Image 1 : visage et cheveux. Image 2 : corps et tenue. Image 3 : décor. Image 4 : un accessoire ou une autre vue utile. Dis quelle image l’emporte quand deux sont en désaccord, et ajoute « ne pas afficher les photos de référence ni copier leurs poses et décors » quand ces détails ne doivent pas être transférés.
  8. Écris l’audio en dernier et laisse-lui de la place. Lis le dialogue à voix haute avec les pauses prévues ; pour six secondes commence par une ligne courte. Décris la texture de la voix et la façon de parler, puis l’ambiance et la musique séparément, et laisse l’action principale finir avant la fin du clip.
  9. Si la parole sort en charabia, simplifie : un intervenant, une phrase courte complète, les mots exacts au lieu de « elle parle du produit », et la ponctuation avant </d>.
  10. Décris les pauses. « Elle ferme la bouche et examine silencieusement l’objet » plus un son de fond calme et concret tout du long empêche H3 de remplir le silence avec des mots en plus.
  11. En mode audio pleine référence, lie explicitement la voix : <Audio 1> fournit seulement le timbre vocal de <Subject 1> (S1), et les mots de l’enregistrement original ne sont pas réutilisés. Ce mode a son propre format en six sections ; voir le guide officiel dans les liens ci-dessous.

Exemples

Texte en vidéo : copier et essayer

/workflow /run:omni-eros-h3 /size:768x896 /length:145
One continuous medium shot inside a battered spaceship cockpit. A reptilian pilot in a faded orange flight suit pulls a landing lever. The cockpit shudders once. His shoulders relax and he says in a low, gravelly voice, "Still in one piece." The camera stays fixed. Amber instrument lights illuminate his face. Sound: low engine rumble, one heavy landing thump and the spoken line. No music. End on his relieved smile.

Texte en vidéo : amélioration du prompt

Vague: A cinematic mechanic is surprised by a machine.
Stronger: Medium shot of a mechanic at a workbench. A brass device suddenly chirps. She freezes with the screwdriver raised, looks at the device, then breaks into a relieved smile. The camera stays fixed, keeping her hands and the device visible. Warm bench light. One chirp over quiet ventilation; no speech or music. Hold on her smile.

Image en vidéo : copier et essayer (un adulte assis à une table ; remplace namehere par le nom de ton image téléchargée)

/workflow /run:omni-eros-h3 /size:768x896 /length:145 /image1:namehere
Use image 1 as the opening scene. Keep the seated adult, clothing, table and background consistent. The subject looks up toward the camera, pauses in recognition, then gives a warm smile. Their shoulders relax as they say softly, "There you are." Keep the camera fixed at eye level. End with the smile settling naturally. Sound: quiet room ambience and that line only. No music.

Image en vidéo : amélioration du prompt

Vague: Make her move naturally and look happy.
Stronger: Keep the seated subject and the existing room. She looks up from the mug, meets the camera with a brief pause, then smiles. Her shoulders relax while both hands stay around the mug. The camera remains fixed. Quiet room tone; no dialogue or music. Let the smile settle through the final moment.

Référence à la vidéo : une image d’identité, une nouvelle scène

/workflow /run:omni-eros-h3 /size:768x896 /length:145 /image1:namehere
Use image 1 only for the adult character identity: face, hair and body proportions. Create a new medium shot in a spaceship workshop. The character wears a charcoal utility jacket and presses one button on a brass device. It chirps; the character smiles with relief. Keep the camera fixed with warm bench lighting. Do not display the reference photograph or reuse its background or pose. Sound: ventilation and one electronic chirp. No speech or music.

Référence à la vidéo : échange de personnage dans une vidéo répondue

Vague: Use these images and put her in the video.
Stronger: Images 1 and 2 define one replacement character: face and hair from image 1; body proportions and outfit from image 2. Replace the woman standing on the left in the replied-to video. The video controls her actions, expressions, timing, camera and setting. The images provide no pose or camera instructions. Keep the other people consistent with the source.

Audio : un prompt de départ au format officiel à trois champs

integrated_multimodal_description: [Shot 1] A woman stands beside a workbench, holding a small wooden box. With a warm, measured voice, the woman (S1) says: <d>[English] This is where the story begins.</d> She closes her mouth and silently opens the box, looking inside for the rest of the shot.
overall_soundscape: A low workshop ventilation hum continues throughout. The wooden lid creaks softly as it opens.
non_diegetic_music: N/A

Astuces

  • Commence avec une action, un choix de caméra et une ligne courte. Laisse la réaction avoir le temps de s’installer.
  • Si un temps disparaît, enlève une action concurrente avant d’ajouter plus d’instructions. Change une chose dans le rendu suivant pour voir ce qui a aidé.
  • Choisis un mouvement que l’image peut supporter : un portrait serré convient à un regard, un sourire ou une ligne courte ; une image en pied laisse de la place pour marcher ou danser ; une interaction avec un objet a besoin des mains et de l’objet visibles dès le départ.
  • Utilise une image claire et un petit premier mouvement. Une fois que ça marche, ajoute un mouvement de caméra ou un deuxième temps. Tout changer d’un coup rend un résultat décevant plus dur à corriger.
  • Si le visage change pendant un grand mouvement, essaie un mouvement plus petit avec une caméra fixe. Si un objet se plie ou glisse, simplifie d’abord le mouvement de la main, en gardant l’image et les autres réglages pour comparer.
  • Une image de visage ne doit pas dicter la tenue et une image de corps ne doit pas remplacer le visage. Des rôles clairs valent mieux qu’une longue liste d’instructions « rendre exact ». Tu n’as pas besoin des quatre images si moins de références expliquent le personnage.
  • En mode référence, juge identité, mouvement et audio séparément : un joli clip peut quand même rater la tâche. Regarde les tournants, les corps qui se chevauchent, les mains, les bords des vêtements et les reflets, et écoute, car une vidéo répondue peut garder sa bande-son originale.
  • Pour un plan sans dialogue, enlève la parole et décris explicitement le personnage qui fait l’action en silence, bouche fermée.
  • Si des voix indésirables persistent, essaie un plan plus court ou une autre génération. Quand tu as besoin de silence sûr, coupe la piste générée et ajoute ton son en montage.

Dépannage

Le clip fait six secondes de rien, ou la fin est coupée

Pourquoi cela arrive
Le prompt demandait une histoire entière, plusieurs actions ou une longue réplique en 145 images.

Comment le corriger
Une action, un choix de caméra et une ligne courte. Laisse l’action principale finir avant la fin du clip, et termine sur une réaction (« maintenir sur son sourire ») plutôt que sur un nouvel événement. Si un temps disparaît, enlève une action concurrente avant d’ajouter des instructions.

Le visage change ou un objet se plie pendant image en vidéo

Pourquoi cela arrive
Un grand mouvement, une image de départ encombrée ou petite, ou un mouvement de main trop complexe pour les images disponibles.

Comment le corriger
Choisis une image claire avec un visage et des mains lisibles et de l’espace dans la direction du mouvement. Essaie un mouvement plus petit avec une caméra fixe, simplifie le mouvement de la main, et ne change que ça entre les rendus.

Le mode référence copie la pose ou le décor de la photo, ou mélange deux visages

Pourquoi cela arrive
Les images n’avaient pas de rôles, ou deux références d’apparence étaient en désaccord et le prompt ne disait pas laquelle l’emporte.

Comment le corriger
Assigne un rôle par image (image 1 contrôle le visage et les cheveux, image 2 contrôle seulement les vêtements), ajoute « ne pas afficher les photos de référence ni copier leurs poses et décors », et si deux références sont encore en conflit essaie une référence forte avant d’en ajouter plus.

La vidéo répondue a gardé sa bande-son originale

Pourquoi cela arrive
Les références audio ne sont pas prises en charge, et une vidéo répondue peut garder sa propre piste ; des instructions visuelles claires ne définissent pas le comportement audio.

Comment le corriger
Décris les nouvelles voix, dialogues et effets dans le prompt, écoute le résultat avant de supposer qu’il a changé, et quand tu as besoin de certitude coupe la piste et ajoute ton son en montage.

Charabia, mots en plus et bruit vocal d’ouverture

Pourquoi cela arrive
Marmonnement aléatoire, mots en plus et ce bizarre bruit vocal d’ouverture sont signalés aussi par d’autres utilisateurs de H3. Les suggestions de la communauté peuvent aider, mais il n’y a pas de correction universelle vérifiée.

Comment le corriger
Un intervenant et une phrase courte complète, ponctuation avant </d>, une action silencieuse explicite pour les pauses avec un son de fond concret, et un lien clair de la voix en mode pleine référence. Si des voix apparaissent encore, utilise un plan plus court ou une autre génération, ou coupe la piste et ajoute le son en montage.

AD
PirateDiffusion
Aucune installation requise – exécutez les modèles IA dans le cloud
PirateDiffusion est réservé à Telegram et conçu pour les pros : des milliers de modèles, LoRA et workflows pilotés par commandes de chat, avec génération illimitée à prix fixe.

Questions

Est-ce que /length est en secondes ?

Non, en images. À 24 fps par défaut, 145 images font environ six secondes. Considère ça comme un moment avec un début, un changement et une fin.

Quelle est la différence entre image en vidéo et mode référence ?

La même commande lance les deux ; c’est le prompt qui décide. En image en vidéo, l’image est la scène d’ouverture et tout ce qu’elle contient est gardé. En mode référence, les images fournissent seulement les traits que tu assignes (visage, tenue, décor, un accessoire) et tu décris une nouvelle composition d’ouverture, une action et un décor.

Puis-je utiliser une vidéo de référence ?

Oui. Télécharge une courte vidéo d’environ 5 à 10 secondes et réponds-y avec la commande. Dis quel est son rôle : pour un échange de personnage, l’image contrôle l’apparence et la vidéo contrôle l’action, le timing, la caméra et le décor ; pour une nouvelle scène, nomme seulement le mouvement que tu veux emprunter.

Puis-je donner un échantillon de voix à H3 ?

Pas dans le workflow de base : les références audio ne sont pas prises en charge là, donc décris la voix, le dialogue et les effets avec des mots. Le mode audio pleine référence, décrit dans le guide de MiniMax, lie un clip audio à un intervenant avec son propre format de prompt en six sections.

Dois-je écrire le dialogue mot pour mot ?

Oui. Écris les mots exacts dans les balises <d>[English] ... </d>. Une description comme « elle parle du produit » est là où H3 commence à improviser.

Comment obtenir un plan sans aucune parole ?

Enlève le dialogue et décris le personnage qui fait l’action en silence, bouche fermée, et donne à l’ambiance un son calme et concret qui dure tout du long. Si des voix indésirables apparaissent encore, essaie un plan plus court, une autre génération, ou coupe la piste et ajoute ton propre son en montage.

Liens et sources

Modèles de ce guide

Écrit par
Mark White

Guides associés

Modèles vidéo
MiniMax H3 prompts vidéo : la structure officielle
Comment MiniMax veut qu’un prompt H3 soit écrit : la ligne d’alignement pour les vidéos ancrées sur une image, les trois champs principaux, les plans et les coupures, les mouvements de caméra, les identifiants des locuteurs et les balises de dialogue, le paysage sonore et la musique. Résumé du guide officiel d’écriture de prompts.
Par Captain
2026-09-14
ComfyUI
Nœuds ComfyUI : documentation et dépannage
Documentation claire pour les nœuds ComfyUI les plus utilisés : ce que fait chaque nœud, toutes les entrées et sorties, comment les connecter, les réglages importants, et les erreurs qu’ils génèrent avec la solution pour chacune.
Par Captain
2026-06-02
Services cloud
PirateDiffusion : utilise n’importe quel modèle depuis Telegram, pas besoin de GPU
Les commandes importantes du bot Telegram PirateDiffusion : /render avec les mots-clés du modèle, pondération avec (( )) et [[ ]], #recipes, /adetailer, /highdef et /facelift pour l’upscaling, /remix, /inpaint, les workflows ComfyUI avec /wf /run:, et les nouvelles compétences // qui choisissent le modèle pour toi.
Par Captain
2026-10-03
Modèles
Meilleur mouvement humain pour MiniMax H3 : mouvements du corps naturels et cohérents
Le Better Motion LoRA d'AdaptiveVision fait bouger les personnages MiniMax H3 (et LTX) de façon naturelle et cohérente. Apprends le poids, la résolution, le nombre d'étapes et comment écrire des prompts courts pour le mouvement.
Par Captain
2026-10-01

Autres guides

Services cloud
Forfait fixe vs jetons : pourquoi les forfaits illimités comme Graydient.ai offrent la meilleure valeur pour les créateurs d’IA en 2026
Une comparaison des coûts classés, avec les prix relevés le 8 octobre 2026, entre les forfaits illimités à tarif fixe comme Graydient.ai et les tarifs à base de jetons et crédits de Midjourney, Leonardo, fal.ai, Replicate, Runway et Kling : ce que coûtent vraiment 1 000 images et 1 000 vidéos par mois sur chacun, et pourquoi un tarif fixe pour des images, vidéos, audios, chat LLM Grok et applications web illimités est la meilleure option pour les créateurs qui font beaucoup d’essais.
Par Captain
2026-10-08
Modèles
FLUX.1 Dev : comment le guider, meilleurs réglages et idées créatives
Un guide pratique pour FLUX.1 Dev de Black Forest Labs : comment utiliser des instructions en langage naturel, réglages de guidage et d’étapes, empilement de LoRA, rendu de texte et idées de prompts qui exploitent ses points forts.
Par Captain
2026-09-30
Modèles
Stable Diffusion XL 1.0 : prompts, réglages et ce qu'il fait encore de mieux
Comment tirer le meilleur parti du modèle de base officiel SDXL 1.0 : résolutions natives, réglages CFG et sampler, le refiner, prompts négatifs et idées de styles où SDXL brille encore.
Par Captain
2026-10-01
Modèles
Stable Diffusion 1.5 : le modèle classique, bien utilisé
Stable Diffusion 1.5 vaut toujours le coup : la bonne résolution, CFG et sampler, comment utiliser sa grande bibliothèque de LoRAs et embeddings, et des idées de prompts créatifs adaptés à un modèle 512 pixels.
Par Captain
2026-10-02
Modèles
FLUX.2 Dev : comment utiliser le nouveau modèle de Black Forest Labs
FLUX.2 Dev permet des prompts plus longs, un meilleur texte, un réalisme renforcé et une édition multi-références. Ce guide explique le workflow turbo, les réglages de guidance et de résolution, la structure du prompt et des idées qui tirent parti de ses nouvelles capacités.
Par Captain
2026-10-03
Modèles
Qwen-Image : longues invites, texte parfait et affiches bilingues
Qwen-Image est le modèle à utiliser quand les mots dans l’image comptent. Apprends à écrire ses longues invites descriptives, à rendre le texte anglais et chinois avec précision, à régler le CFG et les étapes, et à explorer des idées créatives avec beaucoup de mise en page.
Par Captain
2026-09-29