Model
Trends
.ai
Model
Trends
.ai
les meilleurs modèles d'IA open source

Nœud WanImageToVideo and Wan 2.x video nodes dans ComfyUI

WanImageToVideo crée le conditioning et le latent vidéo vide pour un rendu image-à-vidéo Wan 2.1/2.2 à partir d'une image de départ, d'un embedding CLIP Vision et du nombre de frames ; le graphe autour utilise Load Diffusion Model, Load CLIP, Load VAE et KSampler.
Pack de nœuds : ComfyUI core
Catégorie : Vidéo et animation

Ce que fait WanImageToVideo and Wan 2.x video nodes

Wan 2.x (Alibaba) est le modèle vidéo open source le plus utilisé dans ComfyUI. Les nœuds principaux WanImageToVideo (I2V), WanFunControlToVideo, WanFunInpaintToVideo, WanVaceToVideo (contrôle et référence VACE) et WanFirstLastFrameToVideo prennent le conditioning positif et négatif, le VAE, une largeur/hauteur/longueur et l'image de départ (plus une sortie CLIP Vision du encodeur clip_vision_h) et renvoient un conditioning avec l'image intégrée ainsi qu'un LATENT de la bonne forme. Le text-to-video utilise EmptyHunyuanLatentVideo comme latent à la place.
Le reste est un graphe normal : Load Diffusion Model avec wan2.1_i2v_480p_14B_fp8 (ou la paire 2.2 bruit haut/bas), Load CLIP avec umt5_xxl_fp8 (type wan), Load VAE avec wan_2.1_vae, CLIP Text Encode, KSampler (uni_pc ou euler, 20-30 étapes, cfg 5-6, ou cfg 1 avec un LightX2V/CausVid LoRA à 4-8 étapes), VAE Decode et Video Combine à 16 fps. ModelSamplingSD3 avec shift 5-8 se place entre le modèle et le sampler.

Entrées

Nom
Type
Rôle
positive / negative
CONDITIONING
Conditioning du prompt depuis CLIP Text Encode (umt5).
vae
VAE
wan_2.1_vae.safetensors.
clip_vision_output
CLIP_VISION_OUTPUT
Depuis CLIP Vision Encode avec clip_vision_h (I2V 2.1).
start_image
IMAGE
La première image.
width / height / length
INT
Résolution (832x480 ou 1280x720) et nombre de frames (81 = 5 s à 16 fps ; 4n+1).
batch_size
INT
Généralement 1.

Sorties

Nom
Type
Rôle
positive / negative
CONDITIONING
Conditioning avec la référence image.
latent
LATENT
Latent vidéo vide de la taille demandée pour KSampler.
AD
Oubliez l'installation : des workflows ComfyUI préinstallés sur le cloud
BitVector exécute des workflows ComfyUI prêts à l'emploi sur ses propres GPU. Rien à installer, aucun nœud manquant, aucune case rouge. Ouvrez-le sur votre téléphone ou votre portable et générez en une minute.

Comment utiliser WanImageToVideo and Wan 2.x video nodes

  1. Télécharge le modèle de diffusion Wan 2.1 I2V 14B fp8, l'encodeur texte umt5_xxl_fp8, clip_vision_h et le VAE Wan 2.1 dans leurs dossiers.
  2. Crée les loaders : Load Diffusion Model, Load CLIP (type wan), Load VAE, Load CLIP Vision.
  3. Charge Image -> CLIP Vision Encode ; connecte-le, les prompts, le VAE et l'image à WanImageToVideo (832x480, longueur 81).
  4. ModelSamplingSD3 shift 8 -> KSampler uni_pc, 20 étapes, cfg 5, débruitage 1.0.
  5. VAE Decode -> Video Combine à 16 fps, h264.

Réglages et conseils

  • La longueur doit être 4n+1 (17, 33, 49, 65, 81).
  • Les LoRAs de distillation LightX2V / CausVid permettent 4-6 étapes à cfg 1 : dix fois plus rapide.
  • Wan 2.2 utilise deux modèles (bruit haut, bruit bas) avec deux nœuds KSampler (Advanced) séparés par étapes ; le modèle 5B TI2V est un seul fichier pour cartes 8-12 GB.
  • Le modèle 480p fonctionne sur 12 GB avec fp8 et --lowvram ; le 720p demande 16-24 GB.
  • Le prompt négatif compte : le long négatif officiel chinois (flou, statique, distorsion) améliore le mouvement.

Dépannage de WanImageToVideo and Wan 2.x video nodes

Erreur : la longueur doit être ... / incompatibilité de forme dans le latent

Pourquoi cela arrive
Un nombre de frames qui n'est pas 4n+1, ou une largeur/hauteur pas multiple de 16.

Comment le corriger
Utilise 81 frames et 832x480 ou 1280x720.

La sortie est une image fixe sans mouvement

Pourquoi cela arrive
Shift trop bas, cfg trop bas sans LoRA de distillation, ou prompt très court.

Comment le corriger
ModelSamplingSD3 shift 5-8, cfg 5-6 (ou un LightX2V LoRA à cfg 1), et décris le mouvement dans le prompt.

clip_vision_output requis / mauvais modèle CLIP Vision

Pourquoi cela arrive
Wan 2.1 I2V a besoin de clip_vision_h.safetensors ; les modèles SigLIP ou ViT-L d'autres graphes ne correspondent pas.

Comment le corriger
Charge clip_vision_h avec Load CLIP Vision et encode l'image de départ. Wan 2.2 5B et certains graphes 2.2 ne l'utilisent pas du tout.

Manque de mémoire au décodage VAE

Pourquoi cela arrive
Décoder 81 frames en 720p d'un coup.

Comment le corriger
Utilise VAE Decode (Tiled) avec un tile temporel, baisse la résolution, ou décode en 480p puis upscale les frames après.

Load CLIP échoue avec le fichier umt5

Pourquoi cela arrive
Le menu déroulant type sur Load CLIP n'est pas réglé sur wan.

Comment le corriger
Mets le type sur wan (et utilise le fichier fp8 umt5_xxl pour économiser la mémoire).

AD
Lancez ce workflow depuis votre téléphone
Chaque workflow de cette page est préinstallé sur BitVector, modèles et nœuds personnalisés déjà en place. Choisissez-en un, tapez un prompt, c'est fait. Zéro configuration, rien à télécharger.

Questions sur WanImageToVideo and Wan 2.x video nodes

Quel modèle Wan choisir ?

Wan 2.2 14B I2V (bruit haut+bas, fp8) est la meilleure qualité ; Wan 2.2 5B TI2V convient aux petites GPU ; Wan 2.1 14B I2V 480p est le choix stable avec le plus de LoRAs.

Je peux contrôler la caméra ou le mouvement ?

Oui : Wan Fun Control (vidéo profondeur/pose), VACE pour références et inpainting, et les LoRAs de mouvement du catalogue.

Text-to-video ?

Utilise EmptyHunyuanLatentVideo comme latent avec le modèle Wan T2V ; le reste du graphe est identique.

Nœuds liés

Load Diffusion Model
ComfyUI core
Load Diffusion Model (UNETLoader) charge un réseau de débruitage nu comme Flux, SD3.5, Wan ou HunyuanVideo depuis models/diffusion_models, avec une option weight_dtype pour fp8 afin d’économiser de la VRAM.
Load VAE
ComfyUI core
Load VAE (VAELoader) charge un fichier VAE autonome depuis models/vae pour qu’un checkpoint avec un VAE manquant ou faible décode des couleurs propres, et pour que les modèles divisés comme Flux et Wan aient leur décodeur.
Video Combine (VideoHelperSuite)
ComfyUI-VideoHelperSuite
Video Combine transforme un lot d'images (frames) en MP4, WebM, GIF ou une séquence d'images à une fréquence d'images choisie, avec audio optionnel, nombre de boucles et ping-pong. C'est le nœud de sortie standard pour tous les flux vidéo.
KSampler (Advanced)
ComfyUI core
KSampler (Avancé) est KSampler avec contrôle de la plage d'étapes : add_noise, start_at_step, end_at_step et return_with_leftover_noise, utilisé pour les chaînes base + affinement et l'échantillonnage à deux modèles.
EmptySD3LatentImage
ComfyUI core
EmptySD3LatentImage crée le latent vide à 16 canaux dont Flux, SD3 et SD3.5 ont besoin ; il remplace Empty Latent Image dans ces workflows.
AD
Marre de réparer des nœuds ? Laissez faire le cloud
BitVector garde des centaines de workflows ComfyUI installés, à jour et testés sur des GPU cloud rapides. Pas de Python, pas d'erreurs CUDA, pas de limite de VRAM. Depuis n'importe quel navigateur.

Autres nœuds ComfyUI

CLIP Text Encode (Prompt)
ComfyUI core
CLIP Text Encode transforme un prompt texte en CONDITIONING en utilisant l'encodeur texte du modèle. Un nœud contient le prompt positif, un autre le prompt négatif.
ComfyUI Manager
ComfyUI-Manager
ComfyUI Manager est l’extension qui installe, met à jour et répare les packs de nœuds personnalisés et les modèles directement depuis l’interface, résout les nœuds manquants dans les workflows importés et sauvegarde ta configuration.
KSampler
ComfyUI core
KSampler exécute la boucle de débruitage : il prend le modèle, les prompts et un latent, et produit l'image latente finale, contrôlée par la graine, les étapes, le cfg, le sampler, le scheduler et le débruitage.
Load Checkpoint
ComfyUI core
Load Checkpoint (CheckpointLoaderSimple) ouvre un fichier modèle .safetensors ou .ckpt et fournit les trois parties dont chaque workflow a besoin : le MODEL de diffusion, l'encodeur texte CLIP et le VAE.
Save Image
ComfyUI core
Save Image enregistre le tenseur IMAGE dans ComfyUI/output au format PNG, avec tout le workflow intégré dans les métadonnées du fichier pour que l’image puisse être glissée dans ComfyUI et restaurer le graphe.
VAE Decode
ComfyUI core
VAE Decode convertit le LATENT échantillonné en IMAGE pixelisée avec le VAE ; VAE Decode (Tiled) fait la même chose en tuiles pour les images très grandes.