Penjanaan video AI untuk pemula: imej-ke-video, teks-ke-video dan klip pertama dengan Wan, LTX-2 dan H3
Topik: Model video
Oleh Lookout
Diterbitkan 2026-04-29
Minggu pertama dengan model video terbuka: perbezaan antara teks-ke-video dan imej-ke-video dan kenapa mula dengan yang kedua, tiga keluarga model yang patut dipelajari (Wan 2.2, LTX-2, MiniMax H3), bilangan bingkai dan resolusi yang sesuai, cara menulis arahan gerakan, apa yang boleh dijangka dari kad 16 atau 24 GB berbanding awan, dan cara mengubah klip lima saat menjadi sesuatu yang lebih panjang.
Gambaran keseluruhan
Model video adalah model imej dengan paksi masa: gelung denoising yang sama dijalankan pada sekumpulan bingkai sekaligus, jadi semua yang kamu tahu tentang arahan, benih dan denoise boleh digunakan, begitu juga kosnya, didarab dengan bilangan bingkai. Akibat praktikal untuk pemula ada tiga. Mula dengan imej-ke-video (I2V), sebab imej yang baik dari model imej menetapkan komposisi dan gaya dan model video hanya perlu cipta gerakan. Simpan klip pendek (kira-kira lima saat), sebab itulah yang model dilatih. Dan jangka untuk jalankan model besar di awan kecuali kamu ada kad 24 GB.
Tiga keluarga terbuka meliputi kebanyakan keperluan pada 2026.
Wan 2.2
(Alibaba) adalah serba boleh: model 5B yang berjalan pada 12-16 GB dan model dua-pakar 14B dengan kualiti terbuka terbaik, plus ekosistem
LoRA
besar untuk gerakan dan gaya.
LTX-2
(Lightricks) pantas dan hasilkan audio segerak tapi perlukan 24-32 GB.
MiniMax H3
adalah model audio-video dengan dialog dan kesan bunyi, biasanya digunakan melalui aliran kerja hos; panduan arahan H3 oleh Mark White di laman ini mendalam tentangnya.
Hunyuan
Video 1.5 adalah alternatif ringan kepada
Wan
14B.
Katalog menyenaraikan setiap model video dan LoRA mereka dengan asas dan saiz sasaran (5B atau 14B, pakar bunyi tinggi atau rendah), dan halaman model tunjuk klip contoh dengan arahan mereka. Butang Run buka model di
PirateDiffusion
, di mana arahan aliran kerja hasilkan klip dari balasan kepada imej kamu, atau di
BitVector
.
Rujukan
Nama | Jenis | Apakah ia |
|---|---|---|
I2V (image to video) | mode | Animasi imej pegun. Mod terbaik untuk mula: komposisi sudah betul; arahan hanya terangkan gerakan. |
T2V (text to video) | mode | Dari arahan sahaja. Lebih variasi, kurang kawalan; guna untuk idea dan B-roll. |
FLF2V / first-last frame | mode | Dua bingkai utama; model isi gerakan di antara. Peralihan terkawal. |
Frames and fps | setting | Wan: 81 bingkai pada 16 fps (5 s); LTX-2: 97-121 bingkai pada 24-25 fps; H3: 145 bingkai pada ~24 fps. Memori bertambah ikut bingkai. |
Resolution | setting | Wan 2.2: 832x480 atau 480x832 (pantas), 1280x720 (24 GB+); LTX-2 sehingga 1080p+ dengan 32 GB. Potret untuk orang, landskap untuk pemandangan. |
Motion prompt | prompt | Satu gerakan subjek plus satu gerakan kamera: "dia berpaling ke tingkap dan tersenyum; tolak perlahan". Elak senaraikan butiran pemandangan yang sudah ada dalam imej. |
setting | Wan 2.2 14B: 20 langkah dibahagi 10/10 antara pakar, CFG 3.5, shift 5; 5B: 20-30 langkah, CFG 5; LTX-2: 25-30 langkah dengan jadual sendiri; LoRA terdistilasi (lightx2v) bawa Wan ke 4-8 langkah pada CFG 1. | |
Motion LoRAs | file | Gerakan kamera, tarian, isyarat, fizik; padan dengan 5B/14B dan pakar. Halaman di sini namakan sasaran. |
Interpolation and upscale | post | RIFE atau FILM ke 32-60 fps; ESRGAN bingkai demi bingkai atau SeedVR untuk resolusi. |
AD

Klip pertama kamu tanpa GPU
BitVector Prism animasikan imej pegun dengan model Wan dari panduan ini dalam pelayar: muat naik imej, tulis ayat gerakan, muat turun klip. Tiada pemasangan, boleh guna dari laptop.
Langkah demi langkah
- Buat atau pilih imej pegun: render 1024x1024 atau 832x1216 dengan subjek jelas dan latar belakang ringkas. Muka lebih besar dari sepersepuluh bingkai animasi terbaik.
- Buka halaman model Wan 2.2 I2V di laman ini, salin pola arahan gerakan contoh, dan tekan butang Run (PirateDiffusion: balas imej kamu dengan arahan /workflow; BitVector: muat naik dan pilih model).
- Tulis arahan gerakan satu ayat untuk subjek dan satu untuk kamera. Jangan sebut pakaian, warna atau pencahayaan; imej sudah ada itu.
- Jana pada 832x480 (landskap) atau 480x832 (potret), 81 bingkai, langkah lalai. Tonton keseluruhan klip; nilai gerakan, bukan ketajaman.
- Ulang pada arahan gerakan sahaja: kata kerja lebih perlahan ("perlahan", "lembut") kurangkan gerakan liar; satu arahan kamera elak lompatan.
- Secara tempatan, dengan kad 16 GB:Wan 2.2 5Bfp8 atau GGUF, 832x480, 49-81 bingkai, pengekod teks pada CPU. Dengan 24 GB: 14B fp8 pada 480p, 720p dengan pengekod dialihkan. Lihat panduanVRAMuntuk video AI.
- Klip lebih panjang: ambil bingkai terakhir klip satu sebagai imej mula klip dua dengan arahan gerakan berterusan; gabung dalam editor; interpolasi ke 30 fps dan naikkan resolusi di akhir.
- Tambah bunyi: LTX-2 dan H3 hasilkan audio dengan klip; untuk Wan, tambah muzik atau kesan dalam editor.
Contoh
Arahan gerakan untuk I2V
Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text
Arahan aliran kerja PirateDiffusion
/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)
ComfyUI Wan 2.2 5B pada 16 GB
UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)
Petua
- Kata kerja gerakan lebih penting dari kata sifat: "berpaling, berjalan, angkat, tuang, melambai" setiap satu hasilkan gerakan berbeza dan boleh dipercayai; "cantik sinematik" tak hasil apa-apa.
- Satu gerakan kamera setiap klip: tolak masuk, tarik keluar, pusing kiri, orbit. Dua gerakan bagi kesan goyang.
- Imej potret animasi muka lebih baik; imej landskap animasi persekitaran lebih baik.
- Wan LoRA untuk pakar bunyi tinggi bentuk gerakan; yang bunyi rendah bentuk butiran. Banyak pek ada kedua-duanya; muat setiap satu pada pakarnya.
- LoRA terdistilasi (lightx2v, FastWan) potong Wan dari 20 langkah ke 4-6 pada CFG 1 dengan sedikit kehilangan kualiti; halaman model senaraikan mereka.
- Jangka 3-10 minit setiap klip pada 4090 untuk Wan 14B dan kira-kira 90 saat untuk LTX-2; awan pulangkan kebanyakan klip dalam satu atau dua minit.
Penyelesaian masalah
Klip pegun dengan sedikit berkelip
Mengapa ia berlaku
Tiada kata kerja gerakan dalam arahan, atau berat LoRA pegun terlalu tinggi.
Cara membaikinya
Tambah gerakan subjek dan gerakan kamera; turunkan LoRA ke 0.7.
Muka cair atau berubah identiti
Mengapa ia berlaku
Muka terlalu kecil, terlalu banyak bingkai, atau 480p pada muka terperinci.
Cara membaikinya
Potong lebih dekat, 49-61 bingkai, atau 720p di awan; laluan penambah butiran muka per bingkai sebagai pilihan terakhir.
Kamera melompat atau pemandangan terpotong
Mengapa ia berlaku
Dua arahan kamera, atau kata "potong ke" dalam arahan.
Cara membaikinya
Satu gerakan kamera; letak "potongan lompat" dalam negatif.
Kehabisan memori pada 720p
Mengapa ia berlaku
Bingkai kali resolusi melebihi VRAM.
Cara membaikinya
Turun ke 480p atau kurang bingkai, alihkan pengekod teks; lihat panduan VRAM untuk video AI.
LoRA gerakan tidak berfungsi
Mengapa ia berlaku
Dimuat pada pakar salah atau saiz model salah.
Cara membaikinya
Semak halaman model untuk 5B/14B dan bunyi tinggi/rendah; muat ikut kata pencetusnya.
AD

Wan 2.2 14B, LTX-2 dan H3 dari Telegram
PirateDiffusion jalankan model video besar pada GPU server: balas mana-mana imej dengan arahan aliran kerja dan klip akan kembali dalam chat. Penjanaan tanpa had dengan harga tetap, tak perlu kad 24 GB.
Soalan
Model video mana dulu?
Wan 2.2 I2V: mudah maaf, dokumentasi lengkap, paling banyak LoRA. Panduan mula Wan ada setup penuh.
Boleh buat ini dengan kad 8 GB?
Macam mana dapat bunyi?
LTX-2 dan MiniMax H3 hasilkan audio segerak; panduan arahan H3 Mark White terangkan dialog dan arahan kesan.
Berapa lama klip boleh jadi?
Kira-kira lima saat asalnya. Klip panjang adalah sambungan klip; kualiti merosot selepas enam hingga lapan saat dalam satu laluan.
Model komersial terbaru (Veo, Kling, Wan 3.0) boleh guna tempatan?
Tidak; hanya API. Semua dalam panduan ini berat terbuka dan boleh jalan tempatan atau di rakan awan.
Pautan dan sumber
- Wan 2.2 repository
- LTX-2 (Lightricks)
- Wan family page
- LTX-2 family page
- MiniMax H3 family page
- PirateDiffusion
- BitVector web app
Model dalam panduan ini
Ditulis oleh
Lookout
Panduan berkaitan
Model video
Wan 2.2 video: tetapan teks-ke-video dan imej-ke-video, tetapan dan LoRA
Mendapatkan keputusan pertama dari Wan 2.2: saiz model mana yang perlu dipilih (5B atau 14B), pasangan pakar bunyi tinggi / bunyi rendah, resolusi dan bilangan bingkai yang berfungsi, LoRA lightning yang memendekkan render kepada empat langkah, struktur prompt untuk gerakan, dan cara menjalankannya secara hos apabila kad terlalu kecil.
Oleh Captain
2026-05-24

Model video
Berapa Banyak VRAM yang Anda Perlukan untuk Video AI? Wan 2.2, HunyuanVideo 1.5 dan LTX-2 Mengikut Saiz GPU (2026)
VRAM yang diperlukan untuk menjalankan Wan 2.2, HunyuanVideo 1.5 dan LTX-2 secara tempatan, mengikut saiz GPU, resolusi dan panjang klip: apa yang kad 8, 12-16, 24, 32 dan 48+ GB boleh buat, kenapa video memerlukan kos seratus kali ganda imej, trik offloading yang membolehkan model 14B muat pada 24 GB, masa penjanaan yang realistik, dan bila sewa lebih baik daripada beli.
Oleh P.I. Panda
2026-10-06
Prompting
Prompting MiniMax H3: text to video, image to video, reference video and audio
How to direct MiniMax H3 from a chat command: the WHO + WHERE + ACTION + CAMERA + SOUND recipe for text to video, animating a still with image to video, giving every reference picture a job in reference mode, and getting clean dialogue instead of mumbling. With copy-and-try prompts and the author's PDF.
Oleh Mark White
2026-09-20
Model video
Arahan video MiniMax H3: struktur rasmi
Bagaimana MiniMax mahu arahan H3 ditulis: baris penjajaran untuk video berasaskan imej, tiga medan utama, tembakan dan potongan, pergerakan kamera, ID pembicara dan tag dialog, suasana bunyi dan muzik. Diringkaskan dari panduan penulisan arahan rasmi.
Oleh Captain
2026-09-14
Model
LTX 2.3 Crisp Enhance: detail video lebih tajam dan sinematik
Crisp Enhance LoRA oleh vrgamedevgirl untuk LTX 2.3 tingkatkan ketajaman, detail mikro dan kontras dalam video yang dijana. Pelajari cara seimbangkan dengan Soft Enhance, berat dan idea prompt.
Oleh Captain
2026-10-03
Ralat & penyelesaian
Panduan GPU dan VRAM untuk imej dan video AI: apa yang setiap model perlukan dan apa yang patut dibeli (atau tidak)
Berapa banyak memori grafik yang benar-benar diperlukan oleh setiap keluarga model pada kelajuan yang boleh digunakan (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), apa yang fp8 dan kuantisasi GGUF berikan, kenapa RAM sistem dan cakera juga penting, senarai tahap kad dari 8 hingga 32 GB, nota Mac dan AMD, dan bila sewa lebih murah daripada beli.
Oleh Quartermaster
2026-01-07
Lagi panduan
Perkhidmatan awan
Flat fee vs tokens: why unlimited plans like Graydient.ai are the best value for AI creators in 2026
A ranked cost comparison, with prices checked on 8 October 2026, of flat-fee unlimited plans like Graydient.ai against token and credit pricing from Midjourney, Leonardo, fal.ai, Replicate, Runway and Kling: what 1,000 images and 1,000 videos a month really cost on each, and why one fixed fee for unlimited images, video, audio, Grok LLM chat and web apps is the best value for creators who iterate.
Oleh Captain
2026-10-08
Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Hak cipta terpelihara