Model
Trends
.ai
Model
Trends
.ai
model AI sumber terbuka terbaik

Prompting MiniMax H3: text to video, image to video, reference video and audio

Topik: Prompting
Oleh Mark White
Diterbitkan 2026-09-20
How to direct MiniMax H3 from a chat command: the WHO + WHERE + ACTION + CAMERA + SOUND recipe for text to video, animating a still with image to video, giving every reference picture a job in reference mode, and getting clean dialogue instead of mumbling. With copy-and-try prompts and the author's PDF.
Maklumat terkini
Panduan ini ialah snapshot. Sumber di bawah dikemas kini oleh pembuatnya; semak di sana untuk butiran terbaharu.
MiniMax's official prompt writing guide

Gambaran keseluruhan

MiniMax H3
menghasilkan klip pendek dengan suara, bunyi dan muzik sendiri dari satu prompt. Di
PirateDiffusion
ia berjalan sebagai workflow: taip arahan, letak penerangan adegan selepasnya, dan lampirkan gambar bila babak harus bermula dari atau meminjam dari imej. Enam saat adalah satu detik, bukan filem penuh, jadi setiap prompt di bawah menggambarkan satu adegan kecil dengan permulaan, perubahan dan pengakhiran jelas.
Teks ke video tidak perlukan imej: kata-kata kamu bina subjek, latar dan aksi. Resipinya WHO + WHERE + ACTION + CAMERA + SOUND. Terangkan subjek dan latar, beri satu aksi utama dan reaksi, pilih apa kamera buat, dan tamatkan dengan bunyi yang kamu mahu.
Imej ke video bermula dari gambar yang kamu muat naik dan panggil dengan /image1: diikuti nama. Resipinya jadi STARTING IMAGE + MOVEMENT + REACTION + CAMERA + SOUND: kekalkan identiti, pakaian dan latar sedia ada, terangkan bagaimana subjek bergerak, apa yang bertindak balas pada pergerakan itu dan di mana babak berakhir.
Rujukan ke video guna workflow sama dengan jenis prompt berbeza: sehingga empat imej bekalkan ciri terpilih (muka dan rambut, badan dan pakaian, latar, satu prop) bukan untuk tentukan babak pembukaan, dan kamu juga boleh balas video pendek yang dimuat naik sekitar 5 hingga 10 saat untuk pinjam aksi, masa, kamera dan latar.
Audio ditulis, bukan dimuat naik. Untuk workflow teks dan imej asas format prompt rasmi ada tiga medan: integrated_multimodal_description untuk adegan, aksi, pembicara dan dialog tepat; overall_soundscape untuk suasana dan bunyi fizikal; dan non_diegetic_music untuk skor, set kepada N/A bila kamu tidak mahu muzik. Perkataan yang diucap masuk dalam tag <d>[English] ... </d>, nota suara dan cara penyampaian di luar tag, dan setiap pembicara kekal dengan ID konsisten seperti (S1). Arahan ucapan samar adalah tempat mula gumaman.

Rujukan

Nama
Jenis
Apakah ia
/workflow /run:omni-eros-h3
command
Mulakan workflow H3 di PirateDiffusion. Penerangan adegan diletak selepas arahan.
/size:768x896
setting
Lebar x tinggi klip dalam piksel.
/length:145
setting
Frame, bukan saat. Pada 24 fps default, 145 frame lebih kurang enam saat.
/image1:name
setting
Guna gambar yang dimuat naik. Dalam imej ke video ia babak pembukaan; dalam mod rujukan ia bekalkan ciri yang kamu tetapkan. Sehingga empat imej (/image1 hingga /image4).
Reply to a video
reference
Balas video yang dimuat naik 5 hingga 10 saat bagi kawal aksi, masa, kamera dan latar, atau pinjam hanya pergerakan yang kamu sebut. Rujukan audio tidak disokong.
WHO + WHERE + ACTION + CAMERA + SOUND
recipe
Resipi teks ke video: subjek dan latar, satu aksi utama dan reaksi, satu tugas kamera, kemudian bunyi.
STARTING IMAGE + MOVEMENT + REACTION + CAMERA + SOUND
recipe
Resipi imej ke video: nyatakan apa dalam gambar, kemudian arahkan apa berlaku seterusnya.
integrated_multimodal_description
text
Adegan, aksi, pembicara dan dialog tepat mereka, shot demi shot.
overall_soundscape
text
Suasana dan bunyi fizikal yang kedengaran sepanjang shot.
non_diegetic_music
text
Skor latar. Tulis N/A bila kamu tidak mahu muzik.
<d>[English] ... </d>
tag
Balut perkataan yang diucap tepat. Nota suara dan cara penyampaian di luar tag.
(S1), (S2)
speaker ID
Label konsisten untuk setiap pembicara, digunakan setiap kali orang itu bercakap.
AD
Tiada pemasangan diperlukan - jalankan model AI di awan
BitVector Prism ialah cara paling mudah untuk bermula: pilih model, taip prompt dan jana dalam aplikasi web yang bersih, tanpa apa-apa untuk dikonfigurasi. BitVector juga tersedia di Discord dan di web (SpyGlass).

Langkah demi langkah

  1. Pilih mod. Tiada gambar: teks ke video. Gambar yang jadi frame pertama: imej ke video dengan /image1:. Gambar atau video yang pinjam ciri atau gerakan untuk babak baru: mod rujukan, arahan sama, prompt berbeza.
  2. Ganti label mood dengan tingkah laku. "Dia lega" beritahu H3 emosi; "kunci terbuka, bahunya turun dan dia menghela nafas" beri sebab dan reaksi nampak. Pilih dua atau tiga tingkah laku berkait bukan arahkan setiap otot.
  3. Tunjuk sebab dan akibat. Buat pergerakan fizikal: kaki sentuh lantai, lutut bengkok, berat badan bertukar, kemudian badan stabil. Untuk pendaratan, terangkan strut mampat selepas sentuhan.
  4. Beri kamera satu tugas jelas. Tentukan pandangan mula, pergerakan dan destinasi: "tolak perlahan dari pandangan pinggang ke atas ke mukanya." Close-up tak boleh tunjuk seluruh bilik; pilih apa paling penting dan kekalkan objek penting dalam frame.
  5. Terangkan cahaya yang cipta rupa. Ganti timbunan perkataan kualiti dengan pilihan nampak: "cahaya hangat dari lampu meja pada mukanya, cahaya sejuk dari tingkap belakangnya." Pilih satu gaya konsisten.
  6. Untuk imej ke video, mula dari apa yang ada. Nyatakan keadaan pembukaan ringkas ("dia duduk dengan kedua-dua tangan pegang mug"), kemudian tambah pergerakan berlapis: satu aksi utama, kemudian reaksi kecil disebabkan itu (rambut ikut pusingan, lengan lipat). Sesuaikan framing dengan tugas dan tamatkan dengan reaksi hidup bukan frame beku.
  7. Untuk mod rujukan, beri setiap rujukan tugas sebelum terangkan adegan. Imej 1: muka dan rambut. Imej 2: badan dan pakaian. Imej 3: latar. Imej 4: prop atau pandangan berguna lain. Kata imej mana menang bila dua bertentangan, dan tambah "jangan paparkan gambar rujukan atau salin pose dan latar mereka" bila butiran itu tak patut pindah.
  8. Tulis audio terakhir dan beri ruang. Baca dialog kuat dengan jeda yang dimaksudkan; untuk enam saat mula dengan satu baris pendek. Terangkan tekstur suara dan cara penyampaian, kemudian suasana dan muzik berasingan, dan biar aksi utama selesai sebelum klip tamat.
  9. Kalau ucapan jadi tak jelas, permudahkan: satu pembicara, satu ayat pendek lengkap, perkataan sebenar bukan "dia bercakap tentang produk", dan tanda baca sebelum </d>.
  10. Terangkan jeda. "Dia tutup mulut dan periksa objek diam-diam" tambah bunyi latar senyap dan konkrit sepanjang masa hentikan H3 isi sunyi dengan kata tambahan.
  11. Dalam mod audio rujukan penuh, ikat suara dengan jelas: <Audio 1> bekalkan hanya timbre vokal <Subject 1> (S1), dan kata rakaman asal tak guna semula. Mod ini ada format enam bahagian sendiri; lihat panduan rujukan rasmi dalam pautan bawah.

Contoh

Teks ke video: salin dan cuba

/workflow /run:omni-eros-h3 /size:768x896 /length:145
One continuous medium shot inside a battered spaceship cockpit. A reptilian pilot in a faded orange flight suit pulls a landing lever. The cockpit shudders once. His shoulders relax and he says in a low, gravelly voice, "Still in one piece." The camera stays fixed. Amber instrument lights illuminate his face. Sound: low engine rumble, one heavy landing thump and the spoken line. No music. End on his relieved smile.

Teks ke video: naik taraf prompt

Vague: A cinematic mechanic is surprised by a machine.
Stronger: Medium shot of a mechanic at a workbench. A brass device suddenly chirps. She freezes with the screwdriver raised, looks at the device, then breaks into a relieved smile. The camera stays fixed, keeping her hands and the device visible. Warm bench light. One chirp over quiet ventilation; no speech or music. Hold on her smile.

Imej ke video: salin dan cuba (orang dewasa duduk di meja; gantikan namehere dengan nama imej yang kamu muat naik)

/workflow /run:omni-eros-h3 /size:768x896 /length:145 /image1:namehere
Use image 1 as the opening scene. Keep the seated adult, clothing, table and background consistent. The subject looks up toward the camera, pauses in recognition, then gives a warm smile. Their shoulders relax as they say softly, "There you are." Keep the camera fixed at eye level. End with the smile settling naturally. Sound: quiet room ambience and that line only. No music.

Imej ke video: naik taraf prompt

Vague: Make her move naturally and look happy.
Stronger: Keep the seated subject and the existing room. She looks up from the mug, meets the camera with a brief pause, then smiles. Her shoulders relax while both hands stay around the mug. The camera remains fixed. Quiet room tone; no dialogue or music. Let the smile settle through the final moment.

Rujukan ke video: satu imej identiti, babak baru

/workflow /run:omni-eros-h3 /size:768x896 /length:145 /image1:namehere
Use image 1 only for the adult character identity: face, hair and body proportions. Create a new medium shot in a spaceship workshop. The character wears a charcoal utility jacket and presses one button on a brass device. It chirps; the character smiles with relief. Keep the camera fixed with warm bench lighting. Do not display the reference photograph or reuse its background or pose. Sound: ventilation and one electronic chirp. No speech or music.

Rujukan ke video: tukar watak dalam video yang dibalas

Vague: Use these images and put her in the video.
Stronger: Images 1 and 2 define one replacement character: face and hair from image 1; body proportions and outfit from image 2. Replace the woman standing on the left in the replied-to video. The video controls her actions, expressions, timing, camera and setting. The images provide no pose or camera instructions. Keep the other people consistent with the source.

Audio: prompt permulaan dalam format tiga medan rasmi

integrated_multimodal_description: [Shot 1] A woman stands beside a workbench, holding a small wooden box. With a warm, measured voice, the woman (S1) says: <d>[English] This is where the story begins.</d> She closes her mouth and silently opens the box, looking inside for the rest of the shot.
overall_soundscape: A low workshop ventilation hum continues throughout. The wooden lid creaks softly as it opens.
non_diegetic_music: N/A

Petua

  • Mula dengan satu aksi, satu pilihan kamera dan satu baris pendek. Beri masa reaksi untuk sampai.
  • Kalau satu beat hilang, buang aksi bertanding sebelum tambah arahan. Tukar satu perkara dalam render seterusnya supaya kamu tahu apa yang bantu.
  • Pilih pergerakan yang gambar boleh sokong: potret dekat sesuai pandangan, senyuman atau baris pendek; imej badan penuh bagi ruang berjalan atau menari; interaksi objek perlukan tangan dan objek nampak dari mula.
  • Guna imej jelas dan pergerakan pertama kecil. Bila itu berjaya, tambah satu gerakan kamera atau beat kedua. Tukar semua sekali buat hasil mengecewakan susah diperbaiki.
  • Kalau muka berubah semasa pusing besar, cuba pusing kecil dengan kamera tetap. Kalau objek bengkok atau tergelincir, permudahkan pergerakan tangan dulu, kekalkan imej dan tetapan lain untuk perbandingan itu.
  • Imej muka tak patut tentukan pakaian dan imej badan tak patut gantikan muka. Peranan jelas lebih baik dari senarai panjang arahan "buat tepat". Kamu tak perlu semua empat slot imej kalau kurang rujukan sudah terangkan watak.
  • Dalam mod rujukan, nilai identiti, pergerakan dan audio secara berasingan: klip cantik masih boleh gagal tugas. Perhatikan pusingan, badan bertindih, tangan, tepi pakaian dan pantulan, dan dengar, sebab video yang dibalas mungkin simpan trek asal.
  • Untuk shot tanpa dialog, buang ucapan dan terangkan watak buat aksi diam-diam dengan mulut tertutup.
  • Kalau vokal tak diingini masih ada, cuba shot lebih pendek atau generasi lain. Bila kamu perlukan sunyi pasti, bisukan trek yang dijana dan tambah bunyi kamu dalam suntingan.

Penyelesaian masalah

Klip enam saat kosong, atau pengakhiran terpotong

Mengapa ia berlaku
Prompt minta cerita penuh, beberapa aksi atau dialog panjang dalam 145 frame.

Cara membaikinya
Satu aksi, satu pilihan kamera dan satu baris pendek. Biarkan aksi utama selesai sebelum klip tamat, dan tamat dengan reaksi ("tahan pada senyumannya") bukan peristiwa baru. Kalau satu beat hilang, buang aksi bertanding sebelum tambah arahan.

Muka berubah atau objek bengkok semasa imej ke video

Mengapa ia berlaku
Pusingan besar, imej mula yang sesak atau kecil, atau pergerakan tangan terlalu rumit untuk frame ada.

Cara membaikinya
Pilih imej jelas dengan muka dan tangan boleh dibaca dan ruang arah pergerakan. Cuba pusing kecil dengan kamera tetap, permudahkan pergerakan tangan, dan tukar hanya itu antara render.

Mod rujukan salin pose atau latar foto, atau campur dua muka

Mengapa ia berlaku
Imej tak diberi peranan, atau dua rujukan rupa bertentangan dan prompt tak kata mana menang.

Cara membaikinya
Tetapkan satu tugas setiap imej (imej 1 kawal muka dan rambut, imej 2 kawal pakaian sahaja), tambah "jangan paparkan gambar rujukan atau salin pose dan latar", dan kalau dua rujukan masih bertentangan cuba satu rujukan kuat dulu sebelum tambah lagi.

Video yang dibalas simpan trek asal

Mengapa ia berlaku
Rujukan audio tak disokong, dan video yang dibalas mungkin simpan trek asal; arahan visual jelas tak set kelakuan audio.

Cara membaikinya
Terangkan suara baru, dialog dan kesan dalam prompt, dengar hasil sebelum anggap ia berubah, dan bila kamu perlukan pasti bisukan trek dan tambah bunyi kamu dalam suntingan.

Gibberish, kata tambahan dan bunyi vokal pelik mula

Mengapa ia berlaku
Gumaman rawak, kata tambahan dan bunyi vokal pelik mula dilaporkan pengguna H3 lain juga. Cadangan komuniti boleh bantu, tapi tiada pembaikan prompt universal yang disahkan.

Cara membaikinya
Satu pembicara dan satu ayat pendek lengkap, tanda baca sebelum </d>, aksi diam jelas untuk jeda dengan bunyi latar konkrit, dan ikatan suara jelas dalam mod rujukan penuh. Kalau vokal masih muncul, guna shot lebih pendek atau generasi lain, atau bisukan trek dan tambah bunyi dalam suntingan.

AD
PirateDiffusion
Tiada pemasangan diperlukan - jalankan model AI di awan
PirateDiffusion hanya di Telegram dan dibina untuk profesional: beribu-ribu model, LoRA dan aliran kerja yang dipacu oleh arahan sembang, dengan penjanaan tanpa had pada pelan harga tetap.

Soalan

Adakah /length dalam saat?

Tidak, dalam frame. Pada 24 fps default, 145 frame lebih kurang enam saat. Anggap itu satu detik dengan permulaan, perubahan dan pengakhiran.

Apa beza imej ke video dan mod rujukan?

Arahan sama jalankan kedua-dua; prompt tentukan. Dalam imej ke video gambar adalah babak pembukaan dan semua dalamnya dikekalkan. Dalam mod rujukan gambar bekalkan hanya ciri yang kamu tetapkan (muka, pakaian, latar, prop) dan kamu terangkan komposisi pembukaan, aksi dan latar baru.

Bolehkah saya guna video rujukan?

Boleh. Muat naik video pendek sekitar 5 hingga 10 saat dan balas dengan arahan. Kata apa tugasnya: untuk tukar watak, imej kawal rupa dan video kawal aksi, masa, kamera dan latar; untuk babak baru, sebut hanya pergerakan yang kamu mahu pinjam.

Bolehkah saya beri H3 sampel suara?

Tidak pada workflow asas: rujukan audio tak disokong di situ, jadi terangkan suara, dialog dan kesan dengan kata-kata. Mod audio rujukan penuh, diterangkan dalam panduan rujukan MiniMax, ikat klip audio ke pembicara dengan format prompt enam bahagian sendiri.

Perlukah saya tulis dialog perkataan demi perkataan?

Ya. Tulis perkataan sebenar dalam tag <d>[English] ... </d>. Penerangan seperti "dia bercakap tentang produk" adalah tempat H3 mula berimprovisasi.

Bagaimana saya dapat shot tanpa ucapan langsung?

Buang dialog dan terangkan watak buat aksi diam-diam dengan mulut tertutup, dan beri suasana bunyi senyap dan konkrit yang berterusan. Kalau vokal tak diingini masih ada, cuba shot lebih pendek, generasi lain, atau bisukan trek dan tambah audio sendiri dalam suntingan.

Pautan dan sumber

Model dalam panduan ini

Ditulis oleh
Mark White

Panduan berkaitan

Model video
Arahan video MiniMax H3: struktur rasmi
Bagaimana MiniMax mahu arahan H3 ditulis: baris penjajaran untuk video berasaskan imej, tiga medan utama, tembakan dan potongan, pergerakan kamera, ID pembicara dan tag dialog, suasana bunyi dan muzik. Diringkaskan dari panduan penulisan arahan rasmi.
Oleh Captain
2026-09-14
ComfyUI
Nod ComfyUI: dokumentasi dan penyelesaian masalah
Dokumentasi dalam bahasa mudah untuk nod ComfyUI yang paling banyak digunakan: apa fungsi setiap nod, setiap input dan output, cara menyambungnya, tetapan penting, dan ralat yang muncul beserta cara membaikinya.
Oleh Captain
2026-06-02
Perkhidmatan awan
PirateDiffusion: jalankan mana-mana model dari Telegram, tiada GPU diperlukan
Perintah penting dalam bot Telegram PirateDiffusion: /render dengan kata pencetus model, pemberatan (( )) dan [[ ]], #recipes, /adetailer, peningkatan /highdef dan /facelift, /remix, /inpaint, aliran kerja ComfyUI dengan /wf /run:, dan kemahiran baru // yang memilih model untuk kamu.
Oleh Captain
2026-10-03
Model
Pergerakan Manusia Lebih Baik untuk MiniMax H3: pergerakan badan yang semula jadi dan konsisten
Better Motion LoRA dari AdaptiveVision membuat watak MiniMax H3 (dan LTX) bergerak dengan cara yang semula jadi dan konsisten. Pelajari tentang berat, resolusi, jumlah langkah dan cara menulis arahan pergerakan pendek.
Oleh Captain
2026-10-01

Lagi panduan

Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29
Model
SDXL-Lightning: penjanaan empat langkah pada mana-mana checkpoint SDXL
LoRA SDXL-Lightning dari ByteDance menukar render SDXL 30 langkah menjadi hanya 4 langkah. Ketahui bilangan langkah, CFG yang perlu digunakan, sampler, dan cara gabungkan dengan checkpoint dan LoRA gaya kegemaran kamu.
Oleh Captain
2026-09-30