Model
Trends
.ai
Model
Trends
.ai
les meilleurs modèles d'IA open source

De combien de VRAM as-tu besoin pour la vidéo IA ? Wan 2.2, HunyuanVideo 1.5 et LTX-2 selon la taille du GPU (2026)

Sujet : Modèles vidéo
Par P.I. Panda
Publié le 2026-10-06
Share

Aperçu

Réponse courte : 8 Go suffisent pour des clips courts en basse résolution avec
Wan 2.1
1.3B ou un
Wan 2.2 5B
quantifié. 24 Go est le vrai point de départ pour de la vidéo 720p avec les meilleurs modèles open actuels. 32 Go font tourner
Wan 2.2
14B et
LTX-2
en 720p sans astuces. Les versions en pleine précision des plus gros modèles demandent encore 48 à 80 Go, donc des cartes datacenter ou le cloud.
La vidéo demande beaucoup plus de mémoire que les images parce qu’une image 1024x1024 fait environ un million de pixels, alors qu’un clip de 5 secondes à 24 images par seconde fait 120 images : le modèle travaille sur plus de cent fois plus de pixels en même temps, et doit garder chaque image cohérente avec les autres, donc il ne peut pas les faire une par une. Trois choses font monter la mémoire et se multiplient : la taille et la précision du modèle (pleine, FP8 ou GGUF), la résolution (720p a environ 2,25 fois plus de pixels que 480p) et la durée du clip (à peu près proportionnelle). Un modèle qui tient en mémoire à 480p pour 3 secondes peut manquer de mémoire à 720p pour 5 secondes sur la même carte.
Ce guide couvre les modèles vidéo open-weight que tu peux télécharger et faire tourner toi-même. Les chiffres sont des plages pratiques tirées des fiches officielles et des tests communautaires, vérifiés au 6 octobre 2026 ; les résultats varient selon la version de
ComfyUI
, le workflow et la mémoire système disponible pour l’externalisation. Pour les modèles d’image, regarde le guide compagnon sur les besoins en
VRAM
par modèle ; les deux sont mis à jour chaque mois.

Référence

Nom
Type
Rôle
Wan 2.1
T2V 1.3B
8 GB: 480p, ~5 s clips | 12 GB+: comfortable
Option 8 Go. Environ 8,19 Go utilisés, sortie 480p, environ 4 minutes par clip de 5 secondes sur un RTX 4090. Qualité clairement en dessous des plus gros modèles. Apache 2.0.
Wan 2.2
TI2V 5B
8 GB: GGUF Q8 with offloading, slow | 12-16 GB: quantised at 720p | 24 GB: full precision (official minimum)
Texte ou image vers 720p à 24 fps. Alibaba indique 24 Go (un RTX 4090) comme minimum en pleine précision et moins de 9 minutes pour un clip 720p de 5 secondes. Le Q8 GGUF fait environ 5,4 Go ; ComfyUI externalise le reste vers la RAM système. Apache 2.0.
Wan 2.2
A14B (T2V and I2V)
12-16 GB: GGUF Q4-Q5 with offloading, short clips | 24 GB: FP8 at 480p, 720p with the text encoder offloaded | 32 GB: FP8 at 720p | 80 GB: full precision
La meilleure qualité open. Mixture of experts : 27 milliards de paramètres au total, 14 milliards actifs, un expert pour les étapes bruyantes au début et un pour les détails ; un seul expert est en VRAM à la fois. FP8 fait environ 14,3 Go par expert, GGUF Q4-Q5 environ 10-11 Go. Le besoin officiel de 80 Go est pour la pleine précision sans externalisation. Apache 2.0.
12-16 GB: ~14 GB minimum with offloading | 24 GB: quantised at 720p | 32 GB: comfortable | 28-48 GB: full precision 720p
Tencent, novembre 2025, 8,3 milliards de paramètres, 480p ou 720p avec un
upscaler
intégré vers 1080p ; 80 Go recommandés pour la meilleure qualité. Ce n’est pas le
HunyuanVideo
original (13B), qui demande 60-80 Go en pleine précision ; beaucoup de guides anciens les confondent.
LTX-2
(19B) /
LTX-2.3
(22B)
16 GB: draft previews in FP8 (distilled pipeline) | 24 GB: FP4, clips up to ~97 frames | 32 GB: FP8 (official minimum) | 48 GB+: BF16 (~43 GB file)
Lightricks, poids janvier et mars 2026. Vidéo avec audio synchronisé, jusqu’en 4K, et rapide : environ 90 secondes pour un clip de 5 secondes sur un RTX 4090. Le compromis est la mémoire ; Lightricks recommande aussi 100 Go+ d’espace disque libre.
System RAM
32 GB workable minimum | 64 GB comfortable for 14B models on 12-24 GB cards
L’externalisation déplace une partie du modèle vers la RAM classique, donc la mémoire système compte plus pour la vidéo que pour les images.
Disk
fast NVMe SSD
Les modèles vidéo font plusieurs dizaines de Go chacun ; charger depuis un disque lent ajoute des minutes à chaque changement de modèle.
Wan
2.5-3.0, Kling, Veo, Runway, Seedance
API only
Pas de poids téléchargeables, donc pas de chiffre VRAM ; tu paies à la seconde de vidéo. Wan 2.2 est le plus récent
Wan
avec poids (en octobre 2026).
AD
Vidéo sans carte 24 Go
BitVector Prism fait tourner les modèles vidéo Wan et LTX de ce guide sur ses propres GPU : choisis le modèle, télécharge une image ou tape un prompt, récupère le clip dans le navigateur. Rien à installer, pas d’externalisation.

Pas à pas

  1. Regarde ta VRAM : Gestionnaire des tâches Windows > Performance > GPU > Mémoire GPU dédiée ; nvidia-smi sous Linux. Regarde aussi ta RAM système ; 32 Go est le minimum pour l’externalisation.
  2. Choisis la ligne du modèle qui correspond à ta carte dans le tableau : 8 Go c’est Wan 2.1 1.3B ou Wan 2.2 5B GGUF ; 12-16 Go ajoute Wan 2.2 14B GGUF et
    HunyuanVideo 1.5
    avec externalisation ; 24 Go est la carte vidéo courante (5B pleine précision, 14B FP8, LTX-2 FP4) ; 32 Go fait tout tourner en 720p en FP8.
  3. Télécharge la précision indiquée sur la page du modèle pour ta catégorie (FP8 pour 24-32 Go, GGUF Q4-Q5 pour 12-16 Go) plutôt que l’original BF16.
  4. Commence en 480p avec des clips courts (49-81 images). Ajuste le mouvement et la composition, puis monte en résolution ou refais en 720p. Passer de 480p à 720p double à peu près la mémoire par image, donc un workflow à 14 Go en 480p peut demander 24 Go ou plus en 720p.
  5. Pour Wan 2.2 14B sur 24 Go, déplace l’encodeur texte T5/UMT5 vers la RAM système (dispositif CPU sur le loader, ou externalisation automatique de ComfyUI). Sinon un clip 720p peut dépasser 24 Go en cours de route.
  6. Pour tout ce qui dépasse 5-6 secondes, génère en segments et enchaîne-les : la dernière image d’un clip devient l’image de départ du suivant. La plupart des modèles open sont réglés pour environ 5 secondes et perdent en qualité au-delà.
  7. Si un clip ne tient toujours pas, baisse d’abord le nombre d’images avant la résolution, utilise un décodage VAE en tuiles, et ferme le navigateur et les jeux qui utilisent le GPU.
  8. Si tu as besoin de Wan 2.2 14B ou LTX-2 en 720p souvent et que tu as moins de 24 Go, utilise le cloud :
    PirateDiffusion
    fait tourner Wan,
    LTX
    et H3 sur des GPU serveurs via Telegram ;
    BitVector
    via une appli web.

Exemples

Wan 2.2 14B image-à-vidéo sur 24 Go (ComfyUI)

UNETLoader x2: wan2.2_i2v_high_noise_14B_fp8_scaled, wan2.2_i2v_low_noise_14B_fp8_scaled | CLIPLoader: umt5_xxl_fp8_e4m3fn_scaled, device: cpu | Load VAE: wan_2.1_vae
WanImageToVideo: 832x480, 81 frames | KSamplerAdvanced high (steps 0-10, cfg 3.5) -> KSamplerAdvanced low (steps 10-20, cfg 3.5) | shift 5 | VAE Decode (Tiled)

Wan 2.2 5B sur une carte 8-12 Go

UnetLoaderGGUF: wan2.2_ti2v_5B_Q8_0.gguf | CLIPLoader: umt5_xxl_fp8 (cpu) | 1280x704 is the native 720p shape; start at 832x480, 49 frames, 20 steps
python main.py --lowvram

Le même clip dans le cloud

/workflow /run:wan22-i2v slow dolly in, she looks up and smiles, soft wind in her hair /length:81 (reply to your image on PirateDiffusion)

Astuces

  • Temps rapportés pour un clip unique de 5 secondes : Wan 2.1 1.3B 480p environ 4 minutes sur RTX 4090 ; Wan 2.2 5B 720p moins de 9 minutes (officiel) ; Wan image-to-video environ 12,7 minutes sur 4090 contre environ 7 sur 5090 (environ 45 % plus rapide dans un test publié) ; LTX-2 environ 90 secondes sur 4090. L’externalisation peut rendre ces temps plusieurs fois plus longs.
  • Le chiffre de 80 Go donné par Alibaba pour Wan 2.2 A14B est pour la pleine précision sans externalisation ; FP8 et GGUF avec l’encodeur texte en RAM système est la façon dont tout le monde l’utilise vraiment.
  • Deux experts 14B signifient deux fichiers : vérifie sur la page du modèle sur quel expert un
    LoRA
    a été entraîné (bruit élevé ou faible) ; le charger sur le mauvais ne sert à rien.
  • LTX-2 échange mémoire contre vitesse et audio ; si tu peux faire tenir FP8 sur 32 Go, c’est la voie open la plus rapide vers un clip fini avec son.
  • Une 5090 lancée à 1 999 dollars mais vendue environ 4 500-6 000 en octobre 2026 ne peut toujours pas faire tourner les modèles en pleine précision. Pour de la vidéo occasionnelle, louer un GPU 48 ou 80 Go à l’heure, ou un forfait cloud fixe, est moins cher et bien plus rapide que l’externalisation sur une carte plus petite.
  • Les pages Wan, Hunyuan et LTX sur ce site listent toutes les variantes téléchargeables avec leur taille de fichier ; une variante a besoin de sa taille plus 3-4 Go libres en VRAM pour tourner à vitesse normale.

Dépannage

CUDA out of memory en plein clip 720p sur 24 Go

Pourquoi cela arrive
L’encodeur texte est encore en VRAM avec l’expert 14B actif.

Comment le corriger
Charge l’encodeur UMT5 sur le CPU, ou baisse à 480p ; vois le guide
CUDA out of memory
pour la checklist complète.

Tient en mémoire mais prend 40 minutes

Pourquoi cela arrive
Externalisation lourde vers la RAM système, ou un GGUF Q4 sur une carte qui pourrait faire du FP8.

Comment le corriger
Raccourcis le clip, baisse la résolution, ou utilise la plus grande précision qui reste en mémoire ; vérifie que la "mémoire GPU partagée" dans le Gestionnaire des tâches reste proche de zéro.

Le guide HunyuanVideo dit 60-80 Go

Pourquoi cela arrive
Il s’agit du HunyuanVideo original 13B, pas du HunyuanVideo 1.5 (8,3B).

Comment le corriger
Utilise la 1.5 : environ 14 Go avec externalisation, 24 Go confortable.

LTX-2 ne charge pas sur 16 Go

Pourquoi cela arrive
Seul le pipeline preview distillé FP8 tient ; le modèle complet demande 24 Go (FP4) ou 32 Go (FP8).

Comment le corriger
Utilise la preview distillée pour les brouillons et rends les versions finales sur une carte plus grosse ou dans le cloud.

Le clip long se dégrade après 6 secondes

Pourquoi cela arrive
Les modèles open sont réglés pour environ 5 secondes ; mémoire et qualité baissent au-delà.

Comment le corriger
Enchaîne des segments de 5 secondes à partir de la dernière image ; monte en résolution et interpole ensuite.

Impossible de trouver les poids Wan 2.5 ou 3.0

Pourquoi cela arrive
Ce sont des versions API uniquement.

Comment le corriger
Wan 2.2 est le plus récent Wan que tu peux faire tourner en local ; la page famille Wan suit les changements.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 et H3 via Telegram
PirateDiffusion héberge les gros modèles vidéo en pleine précision et envoie le clip fini dans ta discussion. Génération illimitée à prix fixe mensuel, moins qu’un mois au prix de la 5090 par an.

Questions

Puis-je faire de la vidéo IA avec 8 Go de VRAM ?

Oui, mais seulement des clips courts en basse résolution. Wan 2.1 1.3B fait des clips 480p en environ 8 Go, et Wan 2.2 5B tourne en GGUF avec externalisation. Wan 2.2 14B, HunyuanVideo et LTX-2 demandent plus.

24 Go suffisent-ils pour la vidéo IA ?

Pour la plupart des gens, oui. Une carte 24 Go fait tourner Wan 2.2 5B en pleine précision, Wan 2.2 14B en FP8 (720p avec l’encodeur texte externalisé), HunyuanVideo 1.5 et LTX-2 en FP4. C’est la carte la plus courante pour la vidéo locale.

Pourquoi Wan 2.2 dit-il qu’il a besoin de 80 Go ?

C’est le chiffre pour le modèle 14B en pleine précision sans externalisation. Avec FP8 ou GGUF et l’encodeur texte en RAM système, ça tourne sur 24 Go, et sur 12-16 Go plus lentement.

Une RTX 5090 vaut-elle le coup pour la vidéo IA ?

Si tu fais souvent de la vidéo, les 8 Go en plus par rapport à une 4090 (32 contre 24) te permettent de tourner confortablement Wan 2.2 14B et LTX-2 FP8 en 720p, et c’est environ 45 % plus rapide. À deux ou trois fois son prix de lancement à 1 999 dollars, louer est moins cher pour ceux qui ne génèrent pas de vidéo tous les jours.

HunyuanVideo demande-t-il plus de VRAM que Wan ?

HunyuanVideo 1.5 (8,3B) demande moins que Wan 2.2 14B : environ 14 Go avec externalisation. Le HunyuanVideo original (13B) demande beaucoup plus, donc vérifie de quelle version parle un guide.

Combien de RAM système ?

32 Go est le minimum pour Wan 2.2 et HunyuanVideo avec externalisation ; 64 Go est confortable pour les modèles 14B sur une carte 12-24 Go.

Liens et sources

Modèles de ce guide

Écrit par
P.I. Panda

Guides associés

Erreurs et solutions
Exigences en VRAM pour tous les modèles d’IA image et vidéo populaires (2026) : pleine précision, FP8 et GGUF
Combien de VRAM tu as besoin pour SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein et Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 et LTX-2, en pleine précision, FP8 et GGUF 4 bits, avec la carte confortable et la licence pour chacun, ce que chaque taille de GPU de 8 à 48 Go peut faire, et l’ordre des solutions quand un modèle ne rentre pas.
Par P.I. Panda
2026-10-06
Modèles vidéo
Wan 2.2 vidéo : configuration, réglages et LoRAs pour texte-à-vidéo et image-à-vidéo
Obtenir les premiers résultats avec Wan 2.2 : quel modèle choisir (5B ou 14B), la paire d’experts bruit élevé / bruit faible, les résolutions et nombres d’images qui fonctionnent, les LoRAs lightning qui réduisent les rendus à quatre étapes, la structure du prompt pour le mouvement, et comment l’utiliser en hébergé quand la carte est trop petite.
Par Captain
2026-05-24
Erreurs et solutions
CUDA mémoire insuffisante : combien de VRAM chaque modèle IA nécessite et comment l’adapter
Un tableau de VRAM pour SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 et HunyuanVideo, et les techniques pour faire tenir un modèle : quantification fp8 et GGUF, déchargement CPU, VAE en tuiles, limites de résolution et de frames, et quand arrêter de lutter et passer à l’hébergement.
Par Captain
2026-05-18
Erreurs et solutions
Guide GPU et VRAM pour l’image et la vidéo IA : ce dont chaque modèle a besoin et quoi acheter (ou pas)
La quantité de mémoire graphique dont chaque famille de modèles a vraiment besoin à une vitesse utilisable (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), ce que la quantification fp8 et GGUF t’apporte, pourquoi la RAM système et le disque comptent aussi, une liste de cartes de 8 à 32 Go, des notes sur Mac et AMD, et le moment où louer devient moins cher qu’acheter.
Par Quartermaster
2026-01-07
Modèles
LTX 2.3 Crisp Enhance : détails vidéo plus nets et plus cinématographiques
Le LoRA Crisp Enhance de vrgamedevgirl pour LTX 2.3 augmente la netteté, les micro-détails et le contraste dans les vidéos générées. Apprends à le doser avec son pendant Soft Enhance, les poids et des idées de prompt.
Par Captain
2026-10-03
Services cloud
PirateDiffusion : utilise n’importe quel modèle depuis Telegram, pas besoin de GPU
Les commandes importantes du bot Telegram PirateDiffusion : /render avec les mots-clés du modèle, pondération avec (( )) et [[ ]], #recipes, /adetailer, /highdef et /facelift pour l’upscaling, /remix, /inpaint, les workflows ComfyUI avec /wf /run:, et les nouvelles compétences // qui choisissent le modèle pour toi.
Par Captain
2026-10-03

Autres guides

Services cloud
Forfait fixe vs jetons : pourquoi les forfaits illimités comme Graydient.ai offrent la meilleure valeur pour les créateurs d’IA en 2026
Une comparaison des coûts classés, avec les prix relevés le 8 octobre 2026, entre les forfaits illimités à tarif fixe comme Graydient.ai et les tarifs à base de jetons et crédits de Midjourney, Leonardo, fal.ai, Replicate, Runway et Kling : ce que coûtent vraiment 1 000 images et 1 000 vidéos par mois sur chacun, et pourquoi un tarif fixe pour des images, vidéos, audios, chat LLM Grok et applications web illimités est la meilleure option pour les créateurs qui font beaucoup d’essais.
Par Captain
2026-10-08
Modèles
FLUX.1 Dev : comment le guider, meilleurs réglages et idées créatives
Un guide pratique pour FLUX.1 Dev de Black Forest Labs : comment utiliser des instructions en langage naturel, réglages de guidage et d’étapes, empilement de LoRA, rendu de texte et idées de prompts qui exploitent ses points forts.
Par Captain
2026-09-30
Modèles
Stable Diffusion XL 1.0 : prompts, réglages et ce qu'il fait encore de mieux
Comment tirer le meilleur parti du modèle de base officiel SDXL 1.0 : résolutions natives, réglages CFG et sampler, le refiner, prompts négatifs et idées de styles où SDXL brille encore.
Par Captain
2026-10-01
Modèles
Stable Diffusion 1.5 : le modèle classique, bien utilisé
Stable Diffusion 1.5 vaut toujours le coup : la bonne résolution, CFG et sampler, comment utiliser sa grande bibliothèque de LoRAs et embeddings, et des idées de prompts créatifs adaptés à un modèle 512 pixels.
Par Captain
2026-10-02
Modèles
FLUX.2 Dev : comment utiliser le nouveau modèle de Black Forest Labs
FLUX.2 Dev permet des prompts plus longs, un meilleur texte, un réalisme renforcé et une édition multi-références. Ce guide explique le workflow turbo, les réglages de guidance et de résolution, la structure du prompt et des idées qui tirent parti de ses nouvelles capacités.
Par Captain
2026-10-03
Modèles
Qwen-Image : longues invites, texte parfait et affiches bilingues
Qwen-Image est le modèle à utiliser quand les mots dans l’image comptent. Apprends à écrire ses longues invites descriptives, à rendre le texte anglais et chinois avec précision, à régler le CFG et les étapes, et à explorer des idées créatives avec beaucoup de mise en page.
Par Captain
2026-09-29