Generasi video AI untuk pemula: image-to-video, text-to-video dan klip pertama dengan Wan, LTX-2 dan H3
Topik: Model video
Oleh Lookout
Diterbitkan 2026-04-29
Ikhtisar
Model video adalah model gambar dengan sumbu waktu: loop denoising yang sama berjalan pada blok frame sekaligus, jadi semua yang kamu tahu tentang prompt, seed dan denoise berlaku juga, begitu juga biaya, dikalikan dengan jumlah frame. Konsekuensi praktis untuk pemula ada tiga. Mulai dengan image-to-video (I2V), karena still bagus dari model gambar memperbaiki komposisi dan gaya dan model video hanya perlu membuat gerakan. Jaga klip tetap pendek (sekitar lima detik), karena itu yang dilatih model. Dan harapkan menjalankan model besar di cloud kecuali kamu punya kartu 24 GB.
Tiga keluarga terbuka mencakup sebagian besar kebutuhan di 2026.
Wan 2.2
(Alibaba) adalah serba bisa: model 5B yang berjalan di 12-16 GB dan model dua ahli 14B dengan kualitas terbuka terbaik, plus ekosistem
LoRA
besar untuk gerakan dan gaya.
LTX-2
(Lightricks) cepat dan menghasilkan audio sinkron tapi butuh 24-32 GB.
MiniMax H3
adalah model audio-video dengan dialog dan efek suara, biasanya dipakai lewat workflow hosting; panduan prompt H3 di situs ini oleh Mark White membahasnya secara mendalam.
Hunyuan
Video 1.5 adalah alternatif ringan untuk
Wan
14B.
Katalog mencantumkan setiap model video dan LoRA-nya dengan basis dan ukuran yang ditargetkan (5B atau 14B, ahli noise tinggi atau rendah), dan halaman model menunjukkan contoh klip dengan promptnya. Tombol Run membuka model di
PirateDiffusion
, di mana perintah workflow membuat klip dari balasan ke gambarmu, atau di
BitVector
.
Referensi
Nama | Tipe | Artinya |
|---|---|---|
I2V (image to video) | mode | Animasi sebuah still. Mode pertama terbaik: komposisi sudah benar; prompt hanya menggambarkan gerakan. |
T2V (text to video) | mode | Hanya dari prompt. Lebih banyak variasi, kontrol lebih sedikit; pakai untuk ide dan B-roll. |
FLF2V / first-last frame | mode | Dua keyframe; model mengisi gerakan di antaranya. Transisi terkontrol. |
Frames and fps | setting | Wan: 81 frame pada 16 fps (5 s); LTX-2: 97-121 frame pada 24-25 fps; H3: 145 frame pada ~24 fps. Memori bertambah sesuai frame. |
Resolution | setting | Wan 2.2: 832x480 atau 480x832 (cepat), 1280x720 (24 GB+); LTX-2 sampai 1080p+ dengan 32 GB. Potret untuk orang, lanskap untuk adegan. |
Motion prompt | prompt | Satu gerakan subjek plus satu gerakan kamera: "dia berbalik ke jendela dan tersenyum; dorongan lambat". Hindari daftar detail adegan yang sudah ada di gambar. |
setting | Wan 2.2 14B: 20 langkah dibagi 10/10 antar ahli, CFG 3.5, shift 5; 5B: 20-30 langkah, CFG 5; LTX-2: 25-30 langkah dengan jadwal sendiri; LoRA distilasi (lightx2v) membawa Wan ke 4-8 langkah di CFG 1. | |
Motion LoRAs | file | Gerakan kamera, tarian, gestur, fisika; cocok untuk 5B/14B dan ahli. Halaman di sini menyebut targetnya. |
Interpolation and upscale | post | RIFE atau FILM ke 32-60 fps; ESRGAN per frame atau SeedVR untuk resolusi. |
AD

Klip pertamamu tanpa GPU
BitVector Prism menganimasikan still dengan model Wan dari panduan ini di browser: unggah gambar, tulis kalimat gerakan, unduh klip. Tidak perlu instalasi, bisa dari laptop.
Langkah demi langkah
- Buat atau pilih still: render 1024x1024 atau 832x1216 dengan subjek jelas dan latar sederhana. Wajah lebih besar dari sepersepuluh frame paling bagus dianimasikan.
- Buka halaman model Wan 2.2 I2V di situs ini, salin pola motion prompt contoh, dan tekan tombol Run (PirateDiffusion: balas gambarmu dengan perintah /workflow; BitVector: unggah dan pilih model).
- Tulis motion prompt satu kalimat untuk subjek dan satu untuk kamera. Jangan tentang pakaian, warna atau pencahayaan; itu sudah ada di gambar.
- Hasilkan di 832x480 (lanskap) atau 480x832 (potret), 81 frame, langkah default. Tonton seluruh klip; nilai gerakannya, bukan ketajamannya.
- Ulangi hanya pada motion prompt: kata kerja lebih lambat ("perlahan", "lembut") mengurangi gerakan liar; satu instruksi kamera mencegah loncatan.
- Secara lokal, dengan kartu 16 GB:Wan 2.2 5Bfp8 atau GGUF, 832x480, 49-81 frame, encoder teks di CPU. Dengan 24 GB: 14B fp8 di 480p, 720p dengan encoder dialihkan. Lihat panduanVRAMuntuk video AI.
- Potongan lebih panjang: ambil frame terakhir klip satu sebagai gambar awal klip dua dengan motion prompt yang berlanjut; gabungkan di editor; interpolasi ke 30 fps dan upscale di akhir.
- Tambah suara: LTX-2 dan H3 menghasilkan audio dengan klip; untuk Wan, tambahkan musik atau efek di editor.
Contoh
Motion prompt untuk I2V
Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text
Perintah workflow PirateDiffusion
/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)
ComfyUI Wan 2.2 5B di 16 GB
UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)
Tips
- Kata kerja gerakan lebih penting daripada kata sifat: "berputar, berjalan, mengangkat, menuang, melambaikan" masing-masing menghasilkan gerakan berbeda dan dapat diandalkan; "indah sinematik" tidak menghasilkan apa-apa.
- Satu gerakan kamera per klip: dorong masuk, tarik mundur, pan kiri, orbit. Dua gerakan bikin goyangan.
- Still potret lebih baik untuk animasi wajah; still lanskap lebih baik untuk lingkungan.
- Wan LoRA untuk ahli noise tinggi membentuk gerakan; yang noise rendah membentuk detail. Banyak paket mengirim keduanya; muat masing-masing pada ahlinya.
- LoRA distilasi (lightx2v, FastWan) mengurangi langkah Wan dari 20 ke 4-6 di CFG 1 dengan sedikit kehilangan kualitas; halaman model mencantumkannya.
- Harapkan 3-10 menit per klip di 4090 untuk Wan 14B dan sekitar 90 detik untuk LTX-2; cloud mengembalikan sebagian besar klip dalam satu atau dua menit.
Pemecahan masalah
Klip seperti still dengan sedikit bergetar
Mengapa terjadi
Tidak ada kata kerja gerakan di prompt, atau bobot LoRA statis terlalu tinggi.
Cara memperbaikinya
Tambahkan gerakan subjek dan gerakan kamera; turunkan LoRA ke 0.7.
Wajah meleleh atau berubah identitas
Mengapa terjadi
Wajah terlalu kecil, terlalu banyak frame, atau 480p pada wajah detail.
Cara memperbaikinya
Crop lebih dekat, 49-61 frame, atau 720p di cloud; pass detail wajah per frame adalah pilihan terakhir.
Kamera loncat atau adegan terpotong
Mengapa terjadi
Dua instruksi kamera, atau kata "cut to" di prompt.
Cara memperbaikinya
Satu gerakan kamera; masukkan "jump cut" di negatif.
Kehabisan memori di 720p
Mengapa terjadi
Jumlah frame kali resolusi melebihi VRAM.
Cara memperbaikinya
Turun ke 480p atau frame lebih sedikit, alihkan encoder teks; lihat panduan VRAM untuk video AI.
Motion LoRA tidak berfungsi
Mengapa terjadi
Dimuat di ahli yang salah atau ukuran model salah.
Cara memperbaikinya
Periksa halaman model untuk 5B/14B dan noise tinggi/rendah; muat sesuai dengan kata pemicu.
AD

Wan 2.2 14B, LTX-2 dan H3 dari Telegram
PirateDiffusion menjalankan model video besar di GPU server: balas gambar apa saja dengan perintah workflow dan klip kembali di chat. Generasi tak terbatas dengan harga tetap, tidak perlu kartu 24 GB.
Pertanyaan
Model video mana yang harus dipakai dulu?
Wan 2.2 I2V: mudah, terdokumentasi baik, paling banyak LoRA. Panduan memulai Wan punya setup lengkap.
Bisakah saya lakukan ini di kartu 8 GB?
Klip pendek 480p dengan
Wan 2.1
1.3B atau Wan 2.2 5B GGUF, pelan-pelan. Realistisnya, mulai di cloud.
Bagaimana dapat suara?
LTX-2 dan MiniMax H3 menghasilkan audio sinkron; panduan prompt H3 oleh Mark White menjelaskan dialog dan efek.
Berapa lama klip bisa?
Sekitar lima detik secara native. Potongan lebih panjang adalah klip berantai; kualitas menurun setelah enam sampai delapan detik dalam satu proses.
Apakah model komersial terbaru (Veo, Kling, Wan 3.0) tersedia lokal?
Tidak; hanya API. Semua di panduan ini adalah bobot terbuka dan bisa dijalankan lokal atau di cloud partner.
Tautan dan sumber
- Wan 2.2 repository
- LTX-2 (Lightricks)
- Wan family page
- LTX-2 family page
- MiniMax H3 family page
- PirateDiffusion
- BitVector web app
Model dalam panduan ini
Ditulis oleh
Lookout
Panduan terkait
Model video
Wan 2.2 video: pengaturan text-to-video dan image-to-video, pengaturan dan LoRA
Mendapatkan hasil pertama dari Wan 2.2: memilih ukuran model (5B atau 14B), pasangan ahli high-noise / low-noise, resolusi dan jumlah frame yang cocok, LoRA lightning yang memotong render jadi empat langkah, struktur prompt untuk gerakan, dan cara menjalankannya secara hosted saat kartu terlalu kecil.
Oleh Captain
2026-05-24

Model video
Berapa Banyak VRAM yang Kamu Butuhkan untuk Video AI? Wan 2.2, HunyuanVideo 1.5 dan LTX-2 Berdasarkan Ukuran GPU (2026)
VRAM yang dibutuhkan untuk menjalankan Wan 2.2, HunyuanVideo 1.5 dan LTX-2 secara lokal, berdasarkan ukuran GPU, resolusi, dan durasi klip: apa yang bisa dilakukan kartu 8, 12-16, 24, 32 dan 48+ GB, kenapa video butuh biaya seratus kali lipat dari gambar, trik offloading yang membuat model 14B muat di 24 GB, waktu generasi yang realistis, dan kapan sewa lebih baik daripada beli.
Oleh P.I. Panda
2026-10-06
Prompting
Prompting MiniMax H3: text to video, image to video, reference video and audio
How to direct MiniMax H3 from a chat command: the WHO + WHERE + ACTION + CAMERA + SOUND recipe for text to video, animating a still with image to video, giving every reference picture a job in reference mode, and getting clean dialogue instead of mumbling. With copy-and-try prompts and the author's PDF.
Oleh Mark White
2026-09-20
Model video
Prompt video MiniMax H3: struktur resmi
Cara MiniMax ingin prompt H3 ditulis: baris penyelarasan untuk video yang berfokus pada gambar, tiga bidang inti, pengambilan gambar dan potongan, gerakan kamera, ID pembicara dan tag dialog, lanskap suara dan musik. Dirangkum dari panduan penulisan prompt resmi.
Oleh Captain
2026-09-14
Model
LTX 2.3 Crisp Enhance: detail video lebih tajam dan sinematik
Crisp Enhance LoRA dari vrgamedevgirl untuk LTX 2.3 meningkatkan ketajaman, detail mikro, dan kontras dalam video yang dihasilkan. Pelajari cara menyeimbangkannya dengan Soft Enhance, bobot, dan ide prompt.
Oleh Captain
2026-10-03
Error & perbaikan
Panduan GPU dan VRAM untuk gambar dan video AI: apa yang dibutuhkan setiap model dan apa yang harus dibeli (atau tidak)
Berapa banyak memori grafis yang benar-benar dibutuhkan setiap keluarga model dengan kecepatan yang bisa dipakai (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), apa yang didapat dari kuantisasi fp8 dan GGUF, kenapa RAM sistem dan disk juga penting, daftar kartu dari 8 sampai 32 GB, catatan Mac dan AMD, dan kapan sewa lebih murah daripada beli.
Oleh Quartermaster
2026-01-07
Panduan lainnya
Layanan cloud
Biaya tetap vs token: mengapa paket tanpa batas seperti Graydient.ai adalah nilai terbaik untuk pembuat AI di 2026
Perbandingan biaya berperingkat, dengan harga dicek pada 8 Oktober 2026, dari paket tanpa batas biaya tetap seperti Graydient.ai melawan harga token dan kredit dari Midjourney, Leonardo, fal.ai, Replicate, Runway dan Kling: berapa biaya sebenarnya untuk 1.000 gambar dan 1.000 video per bulan di masing-masing, dan mengapa satu biaya tetap untuk gambar, video, audio, chat Grok LLM dan aplikasi web tanpa batas adalah nilai terbaik untuk pembuat yang sering mengulang.
Oleh Captain
2026-10-08
Model
FLUX.1 Dev: cara memberi prompt, pengaturan terbaik dan ide kreatif
Panduan praktis untuk FLUX.1 Dev dari Black Forest Labs: cara memberi prompt dengan bahasa alami, pengaturan panduan dan langkah, penumpukan LoRA, rendering teks, dan ide prompt yang memanfaatkan keunggulannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, pengaturan, dan apa yang masih terbaik
Cara mendapatkan hasil maksimal dari model dasar resmi SDXL 1.0: resolusi asli, pengaturan CFG dan sampler, refiner, prompt negatif, dan ide gaya di mana SDXL masih unggul.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipicu dengan benar
Stable Diffusion 1.5 masih layak diketahui: resolusi yang tepat, CFG dan sampler, cara menggunakan perpustakaan besar LoRA dan embedding-nya, serta ide prompt kreatif yang cocok untuk model 512 piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev menghadirkan prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat, dan pengeditan multi-referensi. Panduan ini membahas alur kerja turbo, pengaturan panduan dan resolusi, struktur prompt, serta ide yang memanfaatkan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: prompt panjang, teks sempurna, dan poster bilingual
Qwen-Image adalah model yang tepat saat kata-kata dalam gambar penting. Pelajari cara menulis prompt deskriptif panjangnya, menghasilkan teks bahasa Inggris dan Cina dengan akurat, mengatur CFG dan langkah, serta mengeksplorasi ide kreatif dengan tata letak yang padat.
Oleh Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Hak cipta dilindungi