Wan 2.2 vidéo : configuration, réglages et LoRAs pour texte-à-vidéo et image-à-vidéo
Sujet : Modèles vidéo
Par Captain
Publié le 2026-05-24
Obtenir les premiers résultats avec Wan 2.2 : quel modèle choisir (5B ou 14B), la paire d’experts bruit élevé / bruit faible, les résolutions et nombres d’images qui fonctionnent, les LoRAs lightning qui réduisent les rendus à quatre étapes, la structure du prompt pour le mouvement, et comment l’utiliser en hébergé quand la carte est trop petite.
Aperçu
Wan 2.2
est la famille vidéo open d’Alibaba et le modèle vidéo le plus téléchargé sur ce site. Il existe en modèle hybride texte-et-image-à-vidéo 5B conçu pour les cartes grand public (720p sur 8 à 12 Go), et en modèles texte-à-vidéo et image-à-vidéo 14B qui utilisent deux experts : un modèle à bruit élevé qui pose le mouvement et la composition dans les premières étapes, et un modèle à bruit faible qui ajoute les détails dans les dernières étapes. La paire 14B produit les résultats cinématographiques que les gens partagent ; le modèle 5B est celui pour apprendre.
La communauté a entraîné des centaines de
LoRAs
Wan
: mouvements de caméra (orbite, dolly, zoom crash), styles de mouvement, personnages, effets, et les LoRAs lightning / distillation qui réduisent les rendus de 30 étapes à 4 à 8 étapes avec peu de perte. La page famille Wan les classe par popularité ; les LoRAs lightning sont presque toujours en haut.
Les options hébergées conviennent bien à la vidéo car les rendus sont longs et gourmands en
VRAM
:
PirateDiffusion
exécute les workflows Wan depuis Telegram avec /wf /run, et
BitVector
garde les graphes Wan préinstallés avec les LoRAs en place. Les deux sont liés dans la boîte Run de chaque page de modèle Wan.
Référence
Nom | Type | Rôle |
|---|---|---|
Wan2.2-TI2V-5B | model | Un modèle pour texte-et-image-à-vidéo, 720p à 24 fps, 121 images max. fp16 10 Go, fp8 5 Go. Cartes de 8 à 12 Go. |
Wan2.2-T2V-A14B / I2V-A14B | model pair | Experts à bruit élevé et faible, 14B chacun (27B total, 14B actifs). 480p et 720p. fp8 environ 14 Go chacun ; GGUF Q4 environ 8 Go chacun. |
umt5-xxl text encoder | file | fp8 scaled (6 Go) ou fp16 (11 Go). Partagé par tous les modèles Wan. |
Wan 2.1 / 2.2 VAE | file | Le modèle 5B utilise le VAE 2.2 ; les modèles 14B utilisent le VAE 2.1. Les mélanger donne des résultats nuls. |
Resolution | setting | 480x832 ou 832x480 pour tests rapides ; 720x1280 / 1280x720 pour les versions finales. Multiples de 16. |
Frames | setting | 4n+1 : 33, 49, 65, 81. 81 images à 16 fps font cinq secondes. |
Steps / shift / CFG | setting | 20 à 30 étapes, shift 5 à 8, CFG 3.5 à 5 sans lightning. Avec LoRAs lightning : 4 à 8 étapes, CFG 1, shift 5. |
Lightning / distill LoRA | LoRA | LoRAs séparés pour les experts à bruit élevé et faible ; charger chacun sur son propre modèle. Poids 1.0. |
Prompt | text | Sujet, action, caméra, éclairage, style, dans cet ordre. Décrire les verbes de mouvement explicitement. Le prompt négatif est utilisé par Wan (contrairement à Flux ). |
AD

Aucune installation requise – exécutez les modèles IA dans le cloud
BitVector Prism est la façon la plus simple de commencer : choisissez un modèle, tapez un prompt et générez dans une application web épurée, sans rien configurer. BitVector est aussi disponible sur Discord et sur le web (SpyGlass).
Pas à pas
- Installe les loaders : le cœurComfyUIsupporte Wan 2.2 ; ajoute ComfyUI-GGUF pour les fichiers quantifiés. Mets ComfyUI à jour d’abord.
- Télécharge selon ta carte : 5B fp8 plus le VAE 2.2 et umt5 fp8 sur 8 à 12 Go ; la paire 14B fp8 plus le VAE 2.1 sur 24 Go ; la paire 14B GGUF Q4 sur 12 à 16 Go.
- Charge le template officiel (Workflow > Browse Templates > Video > Wan 2.2) et remplace les loaders par tes fichiers. Pour GGUF, remplace Load Diffusion Model par Unet Loader (GGUF).
- Pour 14B : deux nœuds KSampler Advanced. Le premier lance le modèle à bruit élevé pour les étapes 0 à N/2 (retourne avec le bruit restant), le second lance le modèle à bruit faible de N/2 à N. Le template est déjà câblé pour ça.
- Premier rendu : 480x832, 33 images, 20 étapes, CFG 4, shift 8, prompt « a corgi runs along a beach at sunset, camera tracks alongside, golden light, shallow depth of field ». Attends 2 à 6 minutes.
- Ajoute les LoRAs lightning depuis la page famille Wan (un pour chaque expert), règle les étapes à 6 (3 + 3), CFG 1. Les rendus tombent à moins d’une minute en 480p.
- Image-à-vidéo : charge la paire I2V, donne l’image à WanImageToVideo, garde le prompt sur le mouvement et la caméra plutôt que de décrire l’image.
- Trop lent ou trop gros : lance le même workflow sur BitVector, ou sur PirateDiffusion avec /workflow /show:wan pour lire les champs et /wf /run:wan ton prompt.
Exemples
Prompt texte-à-vidéo
A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image
Prompt image-à-vidéo (mouvement seulement)
The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight
PirateDiffusion
/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in
Astuces
- Décris le mouvement avec des verbes et la caméra avec des mots de cinéma (slow dolly in, handheld, static wide shot). Wan suit très bien le langage caméra.
- Garde le prompt négatif : l’officiel liste surexposition, statique, détails flous, sous-titres, pire qualité, doigts en trop, et ça aide.
- Le nombre d’images coûte plus cher que la résolution : 81 images en 480p est moins cher que 49 images en 720p.
- Les LoRAs de mouvement pour Wan sont tagués selon l’expert ciblé ; un LoRA low-noise ajoute du détail, un LoRA high-noise change le mouvement.
- La seed compte beaucoup en vidéo ; garde-la fixe pendant que tu ajustes le prompt, puis varie-la pour les prises.
- Sauvegarde le workflow avec ton set de LoRA comme template ; les graphes Wan sont longs et faciles à casser.
Dépannage
Manque de mémoire au premier sampler
Pourquoi cela arrive
Poids 14B fp16 sur une carte de 24 Go ou moins.
Comment le corriger
Paire fp8 ou GGUF Q4, moins d’images, 480p, --lowvram ; ou le modèle 5B.
Vidéo floue ou bruit coloré
Pourquoi cela arrive
Mauvais VAE (2.2 VAE avec 14B ou 2.1 VAE avec 5B), ou LoRA lightning sans CFG 1.
Comment le corriger
Associe le VAE au modèle ; avec LoRAs lightning règle CFG 1 et 4 à 8 étapes.
Presque pas de mouvement
Pourquoi cela arrive
Le prompt décrit une scène, pas une action ; ou trop peu d’étapes sur l’expert bruit élevé.
Comment le corriger
Ajoute des verbes de mouvement et des mouvements de caméra ; donne la moitié des étapes à l’expert bruit élevé.
Le sujet change en cours de vidéo
Pourquoi cela arrive
Trop d’images pour la résolution, ou deux LoRAs conflictuels.
Comment le corriger
Réduis à 49 images, un LoRA de mouvement à la fois, augmente les étapes sur l’expert bruit faible.
Échec du décodage après un échantillonnage réussi
Pourquoi cela arrive
Le décodage VAE est le pic mémoire pour la vidéo.
Comment le corriger
Décodage Wan VAE en tuiles (option tiled sur le nœud decode), ou moins d’images.
Avertissements de clé LoRA non chargée
Pourquoi cela arrive
Un LoRA 2.1 sur 2.2, ou un LoRA 14B sur le modèle 5B.
Comment le corriger
Associe version et taille ; la page du modèle les nomme toutes les deux.
AD

Aucune installation requise – exécutez les modèles IA dans le cloud
PirateDiffusion est réservé à Telegram et conçu pour les pros : des milliers de modèles, LoRA et workflows pilotés par commandes de chat, avec génération illimitée à prix fixe.
Questions
5B ou 14B ?
5B pour apprendre et pour cartes 8 à 12 Go ; 14B pour la qualité si tu as 24 Go ou que tu utilises l’hébergé. Les deux prennent les mêmes prompts.
Quelle durée pour un clip ?
Jusqu’à 81 images (5 s à 16 fps) pour 14B et 121 images (5 s à 24 fps) pour 5B par rendu ; les vidéos plus longues sont assemblées par continuation à partir de la dernière image.
Wan fait-il du son ?
Wan 2.2 S2V anime un orateur à partir de l’audio mais ne génère pas de son ;
LTX-2
et
MiniMax H3
génèrent l’audio avec la vidéo (leurs guides sont sur ce site).
D’où viennent les LoRAs lightning ?
Des releases de distillation par Lightx2v et d’autres ; la page famille Wan les liste avec leur popularité et l’expert ciblé.
Puis-je utiliser Wan sans GPU ?
Oui : PirateDiffusion depuis Telegram, BitVector dans le navigateur. Les deux gardent les workflows et LoRAs installés.
Liens et sources
- Wan 2.2 on GitHub
- Wan 2.2 weights on Hugging Face
- ComfyUI Wan 2.2 examples
- Wan family page
- Hosted Wan workflows on PirateDiffusion
- BitVector
Modèles de ce guide
Écrit par
Captain
Guides associés
Erreurs et solutions
CUDA mémoire insuffisante : combien de VRAM chaque modèle IA nécessite et comment l’adapter
Un tableau de VRAM pour SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 et HunyuanVideo, et les techniques pour faire tenir un modèle : quantification fp8 et GGUF, déchargement CPU, VAE en tuiles, limites de résolution et de frames, et quand arrêter de lutter et passer à l’hébergement.
Par Captain
2026-05-18
Erreurs et solutions
Erreurs ComfyUI et comment les réparer : nœuds rouges, modèles manquants, mémoire CUDA insuffisante
Les messages d'erreur ComfyUI que les gens rencontrent en premier, ce que chacun signifie et la solution qui marche : nœuds personnalisés manquants (boîtes rouges), « Prompt outputs failed validation », mémoire CUDA insuffisante, mauvais type de modèle dans un chargeur, erreurs de forme mat1 et mat2, désérialisation d'en-tête, incompatibilités torch et xformers.
Par Captain
2026-05-12
Modèles vidéo
MiniMax H3 prompts vidéo : la structure officielle
Comment MiniMax veut qu’un prompt H3 soit écrit : la ligne d’alignement pour les vidéos ancrées sur une image, les trois champs principaux, les plans et les coupures, les mouvements de caméra, les identifiants des locuteurs et les balises de dialogue, le paysage sonore et la musique. Résumé du guide officiel d’écriture de prompts.
Par Captain
2026-09-14
Modèles
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image : quelle famille de modèles utiliser en 2026
Une comparaison pratique des familles de modèles d’image open source : suivi des prompts, réalisme, anime et illustration, rendu du texte, vitesse, VRAM, écosystème LoRA et licence, avec une recommandation pour chaque type de travail et matériel.
Par Captain
2026-05-22
Autres guides
Modèles
FLUX.1 Dev : comment le guider, meilleurs réglages et idées créatives
Un guide pratique pour FLUX.1 Dev de Black Forest Labs : comment utiliser des instructions en langage naturel, réglages de guidage et d’étapes, empilement de LoRA, rendu de texte et idées de prompts qui exploitent ses points forts.
Par Captain
2026-09-30
Modèles
Stable Diffusion XL 1.0 : prompts, réglages et ce qu'il fait encore de mieux
Comment tirer le meilleur parti du modèle de base officiel SDXL 1.0 : résolutions natives, réglages CFG et sampler, le refiner, prompts négatifs et idées de styles où SDXL brille encore.
Par Captain
2026-10-01
Modèles
Stable Diffusion 1.5 : le modèle classique, bien utilisé
Stable Diffusion 1.5 vaut toujours le coup : la bonne résolution, CFG et sampler, comment utiliser sa grande bibliothèque de LoRAs et embeddings, et des idées de prompts créatifs adaptés à un modèle 512 pixels.
Par Captain
2026-10-02
Modèles
FLUX.2 Dev : comment utiliser le nouveau modèle de Black Forest Labs
FLUX.2 Dev permet des prompts plus longs, un meilleur texte, un réalisme renforcé et une édition multi-références. Ce guide explique le workflow turbo, les réglages de guidance et de résolution, la structure du prompt et des idées qui tirent parti de ses nouvelles capacités.
Par Captain
2026-10-03
Modèles
Qwen-Image : longues invites, texte parfait et affiches bilingues
Qwen-Image est le modèle à utiliser quand les mots dans l’image comptent. Apprends à écrire ses longues invites descriptives, à rendre le texte anglais et chinois avec précision, à régler le CFG et les étapes, et à explorer des idées créatives avec beaucoup de mise en page.
Par Captain
2026-09-29
Modèles
SDXL-Lightning : génération en quatre étapes sur n'importe quel checkpoint SDXL
Le LoRA SDXL-Lightning de ByteDance transforme un rendu SDXL de 30 étapes en un rendu de 4 étapes. Découvre le nombre d'étapes, le CFG à utiliser, le sampler, et comment le combiner avec tes checkpoints et LoRAs de style préférés.
Par Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Fabriqué au Japon
|
© 2026