Nod WanImageToVideo and Wan 2.x video nodes dalam ComfyUI
WanImageToVideo bina conditioning dan video latent kosong untuk render imej-ke-video Wan 2.1/2.2 dari imej mula, embedding CLIP Vision dan kiraan bingkai; graf sekeliling guna Load Diffusion Model, Load CLIP, Load VAE dan KSampler.
Pek nod: ComfyUI core
Kategori: Video dan animasi
Apa yang dilakukan WanImageToVideo and Wan 2.x video nodes
Wan 2.x (Alibaba) ialah model video terbuka paling banyak digunakan dalam ComfyUI. Node teras WanImageToVideo (I2V), WanFunControlToVideo, WanFunInpaintToVideo, WanVaceToVideo (kawalan dan rujukan VACE) dan WanFirstLastFrameToVideo ambil conditioning positif dan negatif, VAE, lebar/tinggi/panjang dan imej mula (plus output CLIP Vision dari encoder clip_vision_h) dan pulangkan conditioning dengan imej yang dah digabungkan bersama LATENT yang bentuknya betul. Text-ke-video guna EmptyHunyuanLatentVideo sebagai latent sebaliknya.
Yang lain ialah graf biasa: Load Diffusion Model dengan wan2.1_i2v_480p_14B_fp8 (atau pasangan bunyi tinggi/rendah 2.2), Load CLIP dengan umt5_xxl_fp8 (jenis wan), Load VAE dengan wan_2.1_vae, CLIP Text Encode, KSampler (uni_pc atau euler, 20-30 langkah, cfg 5-6, atau cfg 1 dengan LightX2V/CausVid LoRA pada 4-8 langkah), VAE Decode dan Video Combine pada 16 fps. ModelSamplingSD3 dengan shift 5-8 duduk antara model dan sampler.
Input
Nama | Jenis | Apakah ia |
|---|---|---|
positive / negative | CONDITIONING | Conditioning prompt dari CLIP Text Encode (umt5). |
vae | VAE | wan_2.1_vae.safetensors. |
clip_vision_output | CLIP_VISION_OUTPUT | Dari CLIP Vision Encode dengan clip_vision_h (I2V 2.1). |
start_image | IMAGE | Bingkai pertama. |
width / height / length | INT | Resolusi (832x480 atau 1280x720) dan bingkai (81 = 5 s pada 16 fps; 4n+1). |
batch_size | INT | Biasanya 1. |
Output
Nama | Jenis | Apakah ia |
|---|---|---|
positive / negative | CONDITIONING | Conditioning dengan rujukan imej. |
latent | LATENT | Video latent kosong saiz yang diminta untuk KSampler. |
AD

Langkau persediaan: aliran kerja ComfyUI prapasang di awan
BitVector menjalankan aliran kerja ComfyUI sedia ada pada GPU-nya sendiri. Tiada pemasangan, tiada nod yang hilang, tiada kotak merah. Buka di telefon atau komputer riba anda dan jana dalam seminit.
Cara menggunakan WanImageToVideo and Wan 2.x video nodes
- Muat turun model diffusion Wan 2.1 I2V 14B fp8, pengekod teks umt5_xxl_fp8, clip_vision_h dan Wan 2.1 VAE ke folder masing-masing.
- Bina pemuat: Load Diffusion Model, Load CLIP (jenis wan), Load VAE, Load CLIP Vision.
- Muat Imej -> CLIP Vision Encode; sambungkan ia, prompt, VAE dan imej ke WanImageToVideo (832x480, panjang 81).
- ModelSamplingSD3 shift 8 -> KSampler uni_pc, 20 langkah, cfg 5, denoise 1.0.
- VAE Decode -> Video Combine pada 16 fps, h264.
Tetapan dan petua
- Panjang mesti 4n+1 (17, 33, 49, 65, 81).
- LightX2V / CausVid distillation LoRAs bagi 4-6 langkah pada cfg 1: sepuluh kali lebih cepat.
- Wan 2.2 guna dua model (bunyi tinggi, bunyi rendah) dengan dua node KSampler (Advanced) dibahagi ikut langkah; model 5B TI2V ialah fail tunggal untuk kad 8-12 GB.
- Model 480p boleh jalan pada 12 GB dengan fp8 dan --lowvram; 720p perlukan 16-24 GB.
- Prompt negatif penting: prompt negatif Cina rasmi yang panjang (kabur, statik, distorsi) tingkatkan pergerakan.
Penyelesaian masalah WanImageToVideo and Wan 2.x video nodes
Ralat: panjang mesti ... / bentuk latent tak sama
Mengapa ia berlaku
Kiraan bingkai bukan 4n+1, atau lebar/tinggi bukan gandaan 16.
Cara membaikinya
Guna 81 bingkai dan 832x480 atau 1280x720.
Output ialah imej statik tanpa pergerakan
Mengapa ia berlaku
Shift terlalu rendah, cfg terlalu rendah tanpa distillation LoRA, atau prompt sangat pendek.
Cara membaikinya
ModelSamplingSD3 shift 5-8, cfg 5-6 (atau LightX2V LoRA pada cfg 1), dan terangkan pergerakan dalam prompt.
clip_vision_output diperlukan / model CLIP Vision salah
Mengapa ia berlaku
Wan 2.1 I2V perlukan clip_vision_h.safetensors; model SigLIP atau ViT-L dari graf lain tak sama.
Cara membaikinya
Muat clip_vision_h dengan Load CLIP Vision dan encode imej mula. Wan 2.2 5B dan beberapa graf 2.2 tak guna langsung.
Kehabisan memori semasa decode VAE
Mengapa ia berlaku
Decode 81 bingkai pada 720p sekaligus.
Cara membaikinya
Guna VAE Decode (Tiled) dengan tile temporal, turunkan resolusi, atau decode pada 480p dan naikkan resolusi bingkai kemudian.
Load CLIP gagal dengan fail umt5
Mengapa ia berlaku
Dropdown jenis pada Load CLIP tak set ke wan.
Cara membaikinya
Set jenis ke wan (dan guna fail fp8 umt5_xxl untuk jimat memori).
AD

Jalankan aliran kerja ini dari telefon anda
Setiap aliran kerja di halaman ini telah prapasang di BitVector dengan model dan nod tersuai sedia ada. Pilih satu, taip prompt, selesai. Tiada persediaan, tiada apa untuk dimuat turun.
Soalan tentang WanImageToVideo and Wan 2.x video nodes
Model Wan mana patut saya pilih?
Wan 2.2 14B I2V (bunyi tinggi+rendah, fp8) kualiti terbaik; Wan 2.2 5B TI2V sesuai GPU kecil; Wan 2.1 14B I2V 480p pilihan stabil dengan paling banyak LoRA.
Boleh kawal kamera atau pergerakan?
Boleh: Wan Fun Control (video kedalaman/pose), VACE untuk rujukan dan inpainting, dan LoRA pergerakan dari katalog.
Text-ke-video?
Guna EmptyHunyuanLatentVideo sebagai latent dengan model Wan T2V; graf lain sama sahaja.
Nod berkaitan
Load Diffusion Model
ComfyUI core
Load Diffusion Model (UNETLoader) memuatkan rangkaian denoising kosong seperti Flux, SD3.5, Wan atau HunyuanVideo dari models/diffusion_models, dengan pilihan weight_dtype untuk fp8 bagi menjimatkan VRAM.
Load VAE
ComfyUI core
Load VAE (VAELoader) memuatkan fail VAE berdiri sendiri dari models/vae supaya checkpoint yang tiada atau mempunyai VAE lemah boleh decode warna dengan jelas, dan supaya model pecah seperti Flux dan Wan dapat decoder mereka.
Video Combine (VideoHelperSuite)
ComfyUI-VideoHelperSuite
Video Combine menukar satu kumpulan IMEJ bingkai menjadi MP4, WebM, GIF atau urutan imej pada kadar bingkai yang dipilih, dengan audio pilihan, kiraan ulang dan ping-pong, nod output standard untuk setiap aliran kerja video.
KSampler (Advanced)
ComfyUI core
KSampler (Advanced) ialah KSampler dengan kawalan julat langkah: add_noise, start_at_step, end_at_step dan return_with_leftover_noise, digunakan untuk rantai base + refiner dan pensampelan dua model.
EmptySD3LatentImage
ComfyUI core
EmptySD3LatentImage buat latent kosong 16-saluran yang diperlukan oleh Flux, SD3 dan SD3.5; ia gantikan Empty Latent Image dalam aliran kerja tu.
AD

Penat membaiki nod? Biarkan awan melakukannya
BitVector mengekalkan beratus-ratus aliran kerja ComfyUI yang dipasang, dikemas kini dan diuji pada GPU awan yang pantas. Tiada Python, tiada ralat CUDA, tiada had VRAM. Berfungsi dari mana-mana pelayar.
Lagi nod ComfyUI
CLIP Text Encode (Prompt)
ComfyUI core
CLIP Text Encode menukar prompt teks kepada CONDITIONING menggunakan pengekod teks model. Satu node pegang prompt positif, satu lagi pegang prompt negatif.
ComfyUI Manager
ComfyUI-Manager
ComfyUI Manager ialah sambungan yang memasang, mengemas kini dan membaiki pek nod dan model tersuai dari dalam antara muka, menyelesaikan nod yang hilang dalam aliran kerja yang diimport dan menyimpan snapshot tetapan anda.
KSampler
ComfyUI core
KSampler menjalankan gelung denoising: ia mengambil model, prompt dan latent dan menghasilkan imej latent siap, dikawal oleh seed, langkah, cfg, sampler, scheduler dan denoise.
Load Checkpoint
ComfyUI core
Load Checkpoint (CheckpointLoaderSimple) buka fail model .safetensors atau .ckpt dan bagi tiga bahagian yang setiap workflow perlukan: MODEL diffusion, pengekod teks CLIP dan VAE.
Save Image
ComfyUI core
Save Image menulis tensor IMAGE ke ComfyUI/output sebagai PNG, dengan keseluruhan aliran kerja disematkan dalam metadata fail supaya gambar boleh ditarik balik ke ComfyUI untuk memulihkan graf.
VAE Decode
ComfyUI core
VAE Decode menukar LATENT yang diambil sampelnya menjadi imej PIXEL menggunakan VAE; VAE Decode (Tiled) buat benda yang sama tapi dalam jubin untuk imej yang sangat besar.

Model
Trends
.ai
© ModelTrends.ai
|
Dibuat di Jepun
|
© 2026