Wan 2.2 video: tetapan teks-ke-video dan imej-ke-video, tetapan dan LoRA
Topik: Model video
Oleh Captain
Diterbitkan 2026-05-24
Gambaran keseluruhan
Wan 2.2
adalah keluarga video terbuka Alibaba dan model video yang paling banyak dimuat turun di laman ini. Ia datang sebagai model hibrid teks-dan-imej-ke-video 5B yang dibina untuk kad pengguna (720p pada 8 hingga 12 GB), dan sebagai model teks-ke-video dan imej-ke-video 14B yang menggunakan dua pakar: model bunyi tinggi yang menetapkan gerakan dan komposisi pada langkah pertama dan model bunyi rendah yang menambah butiran pada langkah terakhir. Pasangan 14B menghasilkan keputusan sinematik yang dikongsi orang; model 5B adalah yang sesuai untuk belajar.
Komuniti telah melatih ratusan
Wan
LoRA
: pergerakan kamera (orbit, dolly, crash zoom), gaya gerakan, watak, kesan, dan LoRA lightning / distilasi yang mengurangkan render 30 langkah kepada 4 hingga 8 langkah dengan sedikit kehilangan. Halaman keluarga Wan menyenaraikan mereka mengikut populariti; LoRA lightning hampir selalu berada di atas.
Pilihan hos sesuai untuk video kerana render mengambil masa lama dan memerlukan
VRAM
banyak:
PirateDiffusion
menjalankan aliran kerja Wan dari Telegram dengan /wf /run, dan
BitVector
menyimpan graf Wan yang telah dipasang dengan LoRA yang ada. Kedua-duanya dipautkan dalam kotak Run pada setiap halaman model Wan.
Rujukan
Nama | Jenis | Apakah ia |
|---|---|---|
Wan2.2-TI2V-5B | model | Satu model untuk teks- dan imej-ke-video, 720p pada 24 fps, maksimum 121 bingkai. fp16 10 GB, fp8 5 GB. Kad 8 hingga 12 GB. |
Wan2.2-T2V-A14B / I2V-A14B | model pair | Pakar bunyi tinggi dan bunyi rendah, 14B setiap satu (27B jumlah, 14B aktif). 480p dan 720p. fp8 kira-kira 14 GB setiap satu; GGUF Q4 kira-kira 8 GB setiap satu. |
umt5-xxl text encoder | file | fp8 berskala (6 GB) atau fp16 (11 GB). Dikongsi oleh semua model Wan. |
Wan 2.1 / 2.2 VAE | file | Model 5B menggunakan VAE 2.2; model 14B menggunakan VAE 2.1. Campuran mereka menghasilkan sampah. |
Resolution | setting | 480x832 atau 832x480 untuk ujian cepat; 720x1280 / 1280x720 untuk akhir. Gandaan 16. |
Frames | setting | 4n+1: 33, 49, 65, 81. 81 bingkai pada 16 fps adalah lima saat. |
Steps / shift / CFG | setting | 20 hingga 30 langkah, shift 5 hingga 8, CFG 3.5 hingga 5 tanpa lightning. Dengan LoRA lightning: 4 hingga 8 langkah, CFG 1, shift 5. |
Lightning / distill LoRA | LoRA berasingan untuk pakar bunyi tinggi dan bunyi rendah; muat setiap satu pada modelnya sendiri. Berat 1.0. | |
Prompt | text | Subjek, tindakan, kamera, pencahayaan, gaya, dalam urutan itu. Terangkan kata kerja gerakan dengan jelas. Prompt negatif digunakan oleh Wan (berbeza dengan Flux ). |
AD

Tiada pemasangan diperlukan - jalankan model AI di awan
BitVector Prism ialah cara paling mudah untuk bermula: pilih model, taip prompt dan jana dalam aplikasi web yang bersih, tanpa apa-apa untuk dikonfigurasi. BitVector juga tersedia di Discord dan di web (SpyGlass).
Langkah demi langkah
- Pasang pemuat: terasComfyUImenyokong Wan 2.2; tambah ComfyUI-GGUF untuk fail berkuantisasi. Kemas kini ComfyUI dahulu.
- Muat turun mengikut kad anda: 5B fp8 bersama VAE 2.2 dan umt5 fp8 pada 8 hingga 12 GB; pasangan 14B fp8 bersama VAE 2.1 pada 24 GB; pasangan 14B GGUF Q4 pada 12 hingga 16 GB.
- Muatkan templat rasmi (Workflow > Browse Templates > Video > Wan 2.2) dan gantikan pemuat dengan fail anda. Untuk GGUF tukar Load Diffusion Model kepada Unet Loader (GGUF).
- Untuk 14B: dua nod KSampler Advanced. Yang pertama menjalankan model bunyi tinggi untuk langkah 0 hingga N/2 (kembali dengan bunyi baki), yang kedua menjalankan model bunyi rendah dari N/2 hingga N. Templat sudah menghubungkan ini.
- Render pertama: 480x832, 33 bingkai, 20 langkah, CFG 4, shift 8, prompt "seekor corgi berlari di sepanjang pantai waktu matahari terbenam, kamera mengikut di sisi, cahaya keemasan, kedalaman medan cetek". Jangka masa 2 hingga 6 minit.
- Tambah LoRA lightning dari halaman keluarga Wan (satu untuk setiap pakar), tetapkan langkah kepada 6 (3 + 3), CFG 1. Render turun kepada kurang dari satu minit pada 480p.
- Imej-ke-video: muat pasangan I2V, masukkan gambar ke dalam WanImageToVideo, kekalkan prompt tentang gerakan dan kamera bukan menerangkan gambar.
- Terlalu perlahan atau terlalu besar: jalankan aliran kerja yang sama pada BitVector, atau pada PirateDiffusion dengan /workflow /show:wan untuk baca medan dan /wf /run:wan prompt anda.
Contoh
Prompt teks-ke-video
A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image
Prompt imej-ke-video (gerakan sahaja)
The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight
PirateDiffusion
/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in
Petua
- Terangkan gerakan dengan kata kerja dan kamera dengan istilah filem (slow dolly in, handheld, static wide shot). Wan mengikuti bahasa kamera dengan sangat baik.
- Simpan prompt negatif: yang rasmi menyenaraikan overexposure, statik, butiran kabur, sari kata, kualiti terburuk, jari tambahan, dan ia membantu.
- Bilangan bingkai lebih mahal daripada resolusi: 81 bingkai pada 480p lebih murah daripada 49 bingkai pada 720p.
- LoRA gerakan untuk Wan ditandai mengikut pakar yang disasarkan; LoRA bunyi rendah sahaja menambah butiran, LoRA bunyi tinggi mengubah gerakan.
- Seed sangat penting dalam video; kekalkan seed tetap semasa anda laraskan prompt, kemudian ubah untuk penggambaran.
- Simpan aliran kerja dengan set LoRA anda sebagai templat; graf Wan panjang dan mudah rosak.
Penyelesaian masalah
Kehabisan memori pada sampler pertama
Mengapa ia berlaku
fp16 14B weights pada kad 24 GB atau lebih kecil.
Cara membaikinya
Pasangan fp8 atau GGUF Q4, kurang bingkai, 480p, --lowvram; atau model 5B.
Video kabur atau bunyi warna
Mengapa ia berlaku
VAE salah (2.2 VAE dengan 14B atau 2.1 VAE dengan 5B), atau LoRA lightning tanpa CFG 1.
Cara membaikinya
Padankan VAE dengan model; dengan LoRA lightning tetapkan CFG 1 dan 4 hingga 8 langkah.
Hampir tiada gerakan
Mengapa ia berlaku
Prompt menerangkan satu adegan, bukan tindakan; atau langkah terlalu sedikit pada pakar bunyi tinggi.
Cara membaikinya
Tambah kata kerja gerakan dan pergerakan kamera; beri pakar bunyi tinggi separuh langkah.
Subjek berubah separuh jalan
Mengapa ia berlaku
Terlalu banyak bingkai untuk resolusi, atau dua LoRA bertentangan.
Cara membaikinya
Pendekkan kepada 49 bingkai, satu LoRA gerakan pada satu masa, tingkatkan langkah pada pakar bunyi rendah.
Pengekodan gagal selepas sampling berjaya
Mengapa ia berlaku
Pengekodan VAE adalah puncak memori untuk video.
Cara membaikinya
Pengekodan Wan VAE secara jubin (pilihan tiled pada nod decode), atau kurang bingkai.
Amaran kunci LoRA tidak dimuatkan
Mengapa ia berlaku
LoRA 2.1 pada 2.2, atau LoRA 14B pada model 5B.
Cara membaikinya
Padankan versi dan saiz; halaman model menyenaraikan kedua-duanya.
AD

Tiada pemasangan diperlukan - jalankan model AI di awan
PirateDiffusion hanya di Telegram dan dibina untuk profesional: beribu-ribu model, LoRA dan aliran kerja yang dipacu oleh arahan sembang, dengan penjanaan tanpa had pada pelan harga tetap.
Soalan
5B atau 14B?
5B untuk belajar dan untuk kad 8 hingga 12 GB; 14B untuk kualiti jika anda ada 24 GB atau jalankan secara hos. Kedua-duanya guna prompt yang sama.
Berapa lama klip?
Sehingga 81 bingkai (5 s pada 16 fps) untuk 14B dan 121 bingkai (5 s pada 24 fps) untuk 5B setiap render; video lebih panjang disambung dari sambungan bingkai terakhir.
Adakah Wan buat audio?
Wan 2.2 S2V menggerakkan pembesar suara dari audio tapi tidak menjana bunyi;
LTX-2
dan
MiniMax H3
menjana audio dengan video (panduan mereka ada di laman ini).
Dari mana datang LoRA lightning?
Keluaran distilasi oleh Lightx2v dan lain-lain; halaman keluarga Wan menyenaraikannya dengan skor populariti dan pakar yang disasarkan.
Bolehkah saya jalankan Wan tanpa GPU?
Boleh: PirateDiffusion dari Telegram, BitVector dalam pelayar. Kedua-duanya simpan aliran kerja dan LoRA yang dipasang.
Pautan dan sumber
- Wan 2.2 on GitHub
- Wan 2.2 weights on Hugging Face
- ComfyUI Wan 2.2 examples
- Wan family page
- Hosted Wan workflows on PirateDiffusion
- BitVector
Model dalam panduan ini
Ditulis oleh
Captain
Panduan berkaitan
Ralat & penyelesaian
CUDA kehabisan memori: berapa banyak VRAM yang diperlukan setiap model AI dan cara memuatkannya
Jadual VRAM untuk SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 dan HunyuanVideo, serta teknik yang membuat model muat: kuantisasi fp8 dan GGUF, pemindahan CPU, VAE berjubin, had resolusi dan bingkai, dan bila perlu berhenti berusaha dan gunakan yang dihoskan.
Oleh Captain
2026-05-18
Ralat & penyelesaian
Ralat ComfyUI dan cara membaikinya: nod merah, model hilang, CUDA kehabisan memori
Mesej ralat ComfyUI yang biasa orang hadapi, maksud setiap satu dan cara baiki yang berkesan: nod tersuai hilang (kotak merah), "Prompt outputs failed validation", CUDA kehabisan memori, jenis model salah dalam pemuat, ralat bentuk mat1 dan mat2, deserialisasi header, ketidakpadanan torch dan xformers.
Oleh Captain
2026-05-12
Model video
Arahan video MiniMax H3: struktur rasmi
Bagaimana MiniMax mahu arahan H3 ditulis: baris penjajaran untuk video berasaskan imej, tiga medan utama, tembakan dan potongan, pergerakan kamera, ID pembicara dan tag dialog, suasana bunyi dan muzik. Diringkaskan dari panduan penulisan arahan rasmi.
Oleh Captain
2026-09-14
Model
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: keluarga model mana yang patut digunakan pada 2026
Perbandingan praktikal keluarga model imej terbuka: mengikuti arahan prompt, realisme, anime dan ilustrasi, rendering teks, kelajuan, VRAM, ekosistem LoRA dan lesen, dengan cadangan untuk setiap jenis kerja dan perkakasan.
Oleh Captain
2026-05-22
Lagi panduan
Perkhidmatan awan
Bayaran tetap vs token: kenapa pelan tanpa had seperti Graydient.ai adalah nilai terbaik untuk pencipta AI pada 2026
Perbandingan kos berperingkat, dengan harga diperiksa pada 8 Oktober 2026, pelan tanpa had bayaran tetap seperti Graydient.ai berbanding harga token dan kredit dari Midjourney, Leonardo, fal.ai, Replicate, Runway dan Kling: berapa kos sebenar 1,000 imej dan 1,000 video sebulan pada setiap satu, dan kenapa satu bayaran tetap untuk imej, video, audio, sembang Grok LLM dan aplikasi web tanpa had adalah nilai terbaik untuk pencipta yang membuat iterasi.
Oleh Captain
2026-10-08
Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Hak cipta terpelihara