Model
Trends
.ai
Model
Trends
.ai
les meilleurs modèles d'IA open source

Exigences en VRAM pour tous les modèles d’IA image et vidéo populaires (2026) : pleine précision, FP8 et GGUF

Sujet : Erreurs et solutions
Par P.I. Panda
Publié le 2026-10-06
Combien de VRAM tu as besoin pour SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein et Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 et LTX-2, en pleine précision, FP8 et GGUF 4 bits, avec la carte confortable et la licence pour chacun, ce que chaque taille de GPU de 8 à 48 Go peut faire, et l’ordre des solutions quand un modèle ne rentre pas.

Aperçu

Réponse courte : 8 Go de
VRAM
font tourner
SDXL
et les petits modèles rapides comme
Z-Image Turbo
et
FLUX.2 Klein 4B
. 12 Go font tourner
FLUX.1
et
Qwen-Image
une fois quantifiés. 24 Go font tourner presque tous les modèles d’image plus
Wan 2.2
vidéo en FP8. Les plus gros modèles récents,
FLUX.2 Dev
et
LTX-2
en pleine qualité, demandent 32 Go ou plus.
Le tableau ci-dessous liste tous les modèles ouverts populaires avec la mémoire nécessaire en pleine précision, en FP8 et en fichier GGUF 4 bits, générant environ en 1024x1024. Différents testeurs comptent l’encodeur de texte différemment, donc considère chaque chiffre comme une fourchette plutôt qu’une limite stricte. Trois choses que le tableau ne montre pas : SDXL reste le modèle le moins cher à bien faire tourner (la base tient dans 8 Go, mais
LoRAs
,
ControlNet
et le suréchantillonnage ajoutent de la mémoire, c’est pourquoi 12 Go est le chiffre confortable) ; FLUX.2 Klein 4B est le meilleur choix pour les petites cartes en ce moment (environ 13 Go en pleine précision, environ la moitié en FP8, licence Apache 2.0) ; et FLUX.2 Dev n’est pas un modèle pour la maison en pleine précision (un utilisateur
ComfyUI
a fait tourner FP8 sur une RTX 3060 12 Go, en utilisant environ 70 Go de RAM système pour y arriver).
La précision change tout. BF16/FP16, c’est la qualité et la taille pleine, environ 2 Go de VRAM par milliard de paramètres. FP8 divise ça par deux, environ 1 Go par milliard, et la plupart des gens ne voient pas la différence entre FP8 et pleine précision. Les fichiers GGUF (Q8, Q5, Q4 et moins) réduisent encore plus les modèles : Q8 est proche de la qualité pleine, Q4 sacrifie un peu de détail pour un fichier beaucoup plus petit, et en dessous de Q4 la qualité chute vite. Le modèle n’est pas la seule chose en mémoire : les encodeurs de texte (T5 pour FLUX.1, un modèle de langue pour Qwen-Image et
FLUX.2
), le VAE, les LoRAs, ControlNet et l’image elle-même prennent aussi de la place, et ComfyUI déplace automatiquement certains de ces éléments vers la RAM système, ce qui explique pourquoi deux personnes avec la même carte ont des chiffres différents. Chiffres vérifiés au 6 octobre 2026 selon les fiches modèles et tests communautaires ; mis à jour chaque mois.

Référence

Model
Full precision
FP8
4-bit / GGUF
Comfortable card
Stable Diffusion 1.5
0.9B
CreativeML OpenRAIL-M. Tourne sur presque tout.
Full precision
4 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
6-8 GB
SDXL et fine-tunes : Pony, Illustrious, NoobAI
3.5B
OpenRAIL++ (les fine-tunes varient). 12 Go laissent de la place pour LoRAs, ControlNet et suréchantillonnage dans un seul workflow.
Full precision
6-8 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
12 GB
SD 3.5 Large
8.1B
Licence Stability Community.
Full precision
16-24 GB
FP8
lower
than full precision
4-bit / GGUF
lower
than FP8
Comfortable card
24 GB
Z-Image Turbo
6B
Apache 2.0. 8 étapes ; le modèle rapide pour petites cartes.
Full precision
~16 GB
FP8
~8 GB
4-bit / GGUF
~6 GB
Comfortable card
8-12 GB
FLUX.2 Klein 4B
4B
Apache 2.0, usage commercial autorisé. Meilleur choix pour cartes 8 Go en 2026.
Full precision
~13 GB
FP8
~8 GB
4-bit / GGUF
~4-5 GB
Comfortable card
8-12 GB
FLUX.2 Klein 9B
9B
Licence non commerciale FLUX (sorties utilisables commercialement).
Full precision
~29 GB
FP8
~17 GB
4-bit / GGUF
~8-9 GB
Comfortable card
16-24 GB
FLUX.1 Schnell
12B
Apache 2.0. 4 étapes.
Full precision
~24 GB
FP8
~12 GB
4-bit / GGUF
~6-8 GB
Comfortable card
12-16 GB
FLUX.1 Dev
12B
Licence non commerciale. L’encodeur T5 en fp8 économise environ 4 Go à lui seul.
Full precision
~24 GB
plus avec l’encodeur de texte chargé
FP8
~12-18 GB
4-bit / GGUF
~7 GB
Comfortable card
16-24 GB
Qwen-Image
20B
Apache 2.0. Rendu de texte puissant ; nécessite son encodeur Qwen2.5-VL en FP8 sur moins de 32 Go.
Full precision
~41 GB
FP8
~20 GB
4-bit / GGUF
~12-13 GB
Comfortable card
24 GB
FLUX.2 Dev
32B
Licence non commerciale. Attends-toi à des générations lentes sans carte 32 Go.
Full precision
~90 GB
avec son encodeur de texte
FP8
32 GB
tient sur une carte 32 Go
4-bit / GGUF
12-16 GB
déchargement lourd
Comfortable card
32 GB+
HunyuanImage 3.0
80B MoE
Licence Tencent Community. Datacenter uniquement ; utilise-le via un service hébergé.
Full precision
multi-GPU
à toutes les précisions
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
datacenter
Wan 2.1 T2V 1.3B
1.3B
Video 480p
Apache 2.0.
Full precision
8.19 GB
officiel
FP8
8 GB
en pratique
4-bit / GGUF
n/a
Comfortable card
12 GB
Wan 2.2 TI2V 5B
5B
Video 720p
Apache 2.0.
Full precision
GPU grand public
officiel, testé sur RTX 4090
FP8
n/a
4-bit / GGUF
8 GB
GGUF Q8
Comfortable card
24 GB
Wan 2.2 A14B T2V/I2V
2 x 14B
Video 720p
Apache 2.0. Deux experts 14B, un en VRAM à la fois, c’est pourquoi les cartes 24 Go le gèrent. Wan 2.5-3.0 sont API uniquement.
Full precision
80 GB
officiel, GPU unique
FP8
~14 GB
par expert
4-bit / GGUF
12-16 GB
GGUF
Comfortable card
24-32 GB
HunyuanVideo 1.5
8.3B
Video 720p, 1080p avec son suréchantillonneur
Licence Tencent Community.
Full precision
14 GB
officiel, avec déchargement
FP8
14 GB
en pratique
4-bit / GGUF
n/a
Comfortable card
24 GB+
80 GB pour la meilleure qualité
LTX-2 / LTX-2.3
19B / 22B
Video jusqu’à 4K
Licence LTX-2 Community. Audio synchronisé.
Full precision
32 GB+
officiel
FP8
n/a
4-bit / GGUF
24 GB
FP4
Comfortable card
32 GB
AD
Chaque ligne de ce tableau, sans VRAM requise
BitVector Prism fait tourner SDXL, Z-Image, FLUX.1, FLUX.2 et Qwen-Image en pleine précision sur ses propres GPU. Choisis un modèle sur ce site, tape un prompt, génère dans le navigateur. Rien à télécharger.

Pas à pas

  1. Trouve ta VRAM (Gestionnaire des tâches > Performance > GPU, ou nvidia-smi) et associe-la à un niveau ci-dessous ; puis choisis des modèles dont la colonne « carte confortable » est à ce niveau ou en dessous.
  2. 6-8 Go (RTX 3060 Ti, 4060, 2070) :
    SD 1.5
    et SDXL incluant
    Pony
    et Illustrious avec un ou deux LoRAs ; Z-Image Turbo et FLUX.2 Klein 4B en FP8 ou GGUF ; FLUX.1 en GGUF Q4, lentement ;
    Wan 2.1
    1.3B en 480p et Wan 2.2 5B en GGUF avec déchargement.
  3. 12 Go (RTX 3060 12 Go, 4070, 5070) : tout ce qui précède, plus rapide, avec de la place pour ControlNet et le suréchantillonnage ;
    FLUX.1 Dev
    et Schnell en FP8 ou GGUF ; Qwen-Image en GGUF Q4 ;
    FLUX.2 Klein 9B
    en GGUF ; Wan 2.2 A14B en GGUF Q4 avec déchargement à basse résolution et clips courts.
  4. 16 Go (RTX 4060 Ti 16 Go, 4070 Ti Super, 5070 Ti, 5080) : FLUX.1 Dev en FP8 avec marge ; Z-Image Turbo et Klein 4B en pleine précision ; Qwen-Image en GGUF Q4-Q5 ;
    HunyuanVideo
    1.5 avec déchargement ; Wan 2.2 A14B en GGUF Q5 en 720p (retours communautaires).
  5. 24 Go (RTX 3090, 4090) : presque tous les modèles d’image sauf FLUX.2 Dev en pleine précision ; Qwen-Image en FP8 ou Q8 ; Wan 2.2 A14B en FP8 et Wan 2.2 5B en pleine précision ; LTX-2 en FP4 ; la plupart des entraînements LoRA pour SDXL et Flux.
  6. 32 Go (RTX 5090) : FLUX.2 Dev en FP8 ; LTX-2 et
    LTX-2.3
    en FP8 ; Wan 2.2 A14B en 720p sans manquer de mémoire en plein clip.
  7. 48 Go et plus (RTX 6000 Ada, A100, H100) : Qwen-Image, LTX-2 et FLUX.2 Dev en pleine précision avec de la marge ; vidéo longue ou haute résolution, génération par lots et entraînement sérieux.
  8. Télécharge la précision adaptée à ton niveau depuis la page du modèle sur ce site (elle liste chaque variante avec sa taille de fichier), charge les encodeurs de texte en FP8, et garde 32 Go de RAM système (64 Go pour les plus gros modèles) pour le déchargement.

Exemples

FLUX.1 Dev sur une carte 12 Go (ComfyUI)

Load Diffusion Model: flux1-dev-fp8-e4m3fn (11.9 GB) or UnetLoaderGGUF flux1-dev-Q6_K (9.8 GB) | DualCLIPLoader: clip_l + t5xxl_fp8_e4m3fn_scaled | Load VAE: ae
1024x1024, 20 steps, euler, simple, guidance 3.5 | VAE Decode (Tiled) if the last step fails

Qwen-Image sur 16 Go

UnetLoaderGGUF: qwen_image_Q4_K_M.gguf (~12.5 GB) | CLIPLoader: qwen_2.5_vl_7b_fp8_scaled, device cpu | Load VAE: qwen_image_vae
1328x1328 native; start at 1024x1024, 20 steps, cfg 2.5

Les mêmes modèles sans carte du tout

/render <flux-dev> a studio photo of a vintage camera on a walnut desk, soft window light /size:1024x1024 (PirateDiffusion, Telegram)

Astuces

  • Quand tu vois
    CUDA out of memory
    , fais ça dans l’ordre : passe à une version FP8 ou GGUF du même modèle (la plus grosse économie) ; baisse la résolution ou la durée du clip (la mémoire augmente avec le nombre de pixels, passer de 1536 à 1024 px réduit beaucoup) ; utilise un décodage VAE en tuiles ; charge l’encodeur de texte en FP8 ou garde-le sur le CPU ; ferme les autres applis GPU (navigateurs et jeux prennent aussi de la VRAM).
  • Le déchargement fonctionne mais tu perds en vitesse et tu utilises la RAM système : un modèle peut tourner sur une carte « trop petite » pour lui, plusieurs fois plus lent, et tu peux avoir besoin de 32-64 Go ou plus de RAM système.
  • Licences en bref : Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image et
    Wan
    2.1/2.2 sont Apache 2.0 (usage commercial autorisé) ; FLUX.1 Dev, FLUX.2 Dev et Klein 9B ont la licence non commerciale de Black Forest Labs, qui interdit l’usage du modèle dans un produit ou service commercial mais permet d’utiliser commercialement les images générées. Les licences changent ; la page du modèle donne le lien vers la licence actuelle.
  • Acheter une carte 32 Go pour faire tourner FLUX.2 Dev ou LTX-2 pour un projet de week-end ne vaut généralement pas le coup ; si le modèle que tu veux est dans les lignes 24 Go+, louer à l’heure ou un forfait cloud fixe est souvent moins cher et plus rapide que le déchargement sur une petite carte.
  • Règle par milliard de paramètres : 2 Go en BF16, 1 Go en FP8, environ 0,6 Go en Q4, plus 2-5 Go pour l’encodeur, le VAE et le latent.
  • Pour la vidéo, la résolution et la durée du clip comptent autant que le modèle ; le guide compagnon sur la VRAM pour la vidéo IA détaille ça.

Dépannage

CUDA out of memory sur une carte que le tableau dit compatible

Pourquoi cela arrive
Encodeur de texte en pleine précision, une pile LoRA, ControlNet ou une haute résolution en plus du modèle.

Comment le corriger
Encodeur FP8, un LoRA, résolution native, VAE en tuiles ; le guide CUDA out of memory a la version longue.

La génération est très lente même si rien ne plante

Pourquoi cela arrive
Déchargement automatique vers la RAM système.

Comment le corriger
Descends à la précision suivante (FP8 vers Q6, Q6 vers Q4) jusqu’à ce que la mémoire GPU partagée reste proche de zéro.

FLUX.2 Dev « fonctionne » sur 12 Go mais demande 70 Go de RAM

Pourquoi cela arrive
Poids FP8 échangés depuis la mémoire système.

Comment le corriger
Utilise Klein 4B/9B localement et FLUX.2 Dev sur le cloud ou une carte 32 Go.

On ne voit pas la différence FP8/pleine précision, alors pourquoi Q4 paraît flou ?

Pourquoi cela arrive
Q4 perd plus de détails que FP8 ; en dessous de Q4 la qualité chute vite.

Comment le corriger
Utilise Q6 ou Q8 quand c’est possible ; Q4 pour les brouillons.

Confusion sur la licence de FLUX

Pourquoi cela arrive
Schnell et Klein 4B sont Apache 2.0 ; Dev, FLUX.2 Dev et Klein 9B sont non commerciaux.

Comment le corriger
Vérifie la colonne licence et la fiche modèle avant d’utiliser un modèle dans un produit.

AD
PirateDiffusion
Les lignes 24 Go+, depuis ton téléphone
PirateDiffusion héberge FLUX.2 Dev, Qwen-Image, Wan 2.2 14B et LTX-2 sur du matériel serveur et les fait tourner via commandes Telegram. Génération illimitée à prix fixe mensuel ; pas de carte, pas de déchargement, pas 70 Go de RAM.

Questions

Puis-je faire tourner Flux avec 8 Go de VRAM ?

Oui, avec un fichier quantifié. FLUX.1 en GGUF Q4 demande environ 7 Go, et FLUX.2 Klein 4B en FP8 environ 8 Go. Attends-toi à des générations plus lentes qu’avec une carte 12 ou 16 Go. FLUX.1 en pleine précision demande environ 24 Go.

12 Go suffisent-ils pour SDXL ?

Oui. SDXL tient dans 8 Go ; 12 Go te laissent de la place pour LoRAs, ControlNet et le suréchantillonnage dans le même workflow.

Combien de VRAM Wan 2.2 demande-t-il ?

Ça dépend de la version. Le modèle 5B tourne sur 8 Go en fichier GGUF et confortablement sur 24 Go. Le modèle A14B demande officiellement 80 Go sans déchargement, mais sa version FP8 tourne bien sur 24 Go et les versions GGUF tournent sur 12-16 Go avec déchargement.

La RAM système compte-t-elle ?

Oui, dès que tu commences à décharger. 32 Go est un minimum raisonnable pour Flux et Wan, et les plus gros modèles (FLUX.2 Dev sur une carte 12 Go, par exemple) peuvent utiliser 64 Go ou plus.

Quels modèles puis-je utiliser commercialement ?

Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image et Wan 2.1/2.2 (Apache 2.0). FLUX.1 Dev, FLUX.2 Dev et Klein 9B sont non commerciaux pour le modèle lui-même, mais les images générées peuvent être utilisées commercialement. Vérifie toujours la fiche modèle.

Y a-t-il un Wan plus récent que je peux faire tourner chez moi ?

Non. Wan 2.2 est la dernière version Wan avec poids téléchargeables ; Wan 2.5, 2.6, 2.7 et 3.0 sont uniquement via API.

Liens et sources

Modèles de ce guide

Écrit par
P.I. Panda

Guides associés

Modèles vidéo
De combien de VRAM as-tu besoin pour la vidéo IA ? Wan 2.2, HunyuanVideo 1.5 et LTX-2 selon la taille du GPU (2026)
VRAM nécessaire pour faire tourner Wan 2.2, HunyuanVideo 1.5 et LTX-2 en local, selon la taille du GPU, la résolution et la durée du clip : ce que peuvent faire les cartes de 8, 12-16, 24, 32 et 48+ Go, pourquoi la vidéo coûte cent fois plus qu’une image, les astuces d’externalisation qui permettent de faire tourner des modèles 14B sur 24 Go, les temps de génération réalistes, et quand louer est mieux qu’acheter.
Par P.I. Panda
2026-10-06
Erreurs et solutions
CUDA mémoire insuffisante : combien de VRAM chaque modèle IA nécessite et comment l’adapter
Un tableau de VRAM pour SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 et HunyuanVideo, et les techniques pour faire tenir un modèle : quantification fp8 et GGUF, déchargement CPU, VAE en tuiles, limites de résolution et de frames, et quand arrêter de lutter et passer à l’hébergement.
Par Captain
2026-05-18
Erreurs et solutions
Guide GPU et VRAM pour l’image et la vidéo IA : ce dont chaque modèle a besoin et quoi acheter (ou pas)
La quantité de mémoire graphique dont chaque famille de modèles a vraiment besoin à une vitesse utilisable (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), ce que la quantification fp8 et GGUF t’apporte, pourquoi la RAM système et le disque comptent aussi, une liste de cartes de 8 à 32 Go, des notes sur Mac et AMD, et le moment où louer devient moins cher qu’acheter.
Par Quartermaster
2026-01-07
Modèles
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image : quelle famille de modèles utiliser en 2026
Une comparaison pratique des familles de modèles d’image open source : suivi des prompts, réalisme, anime et illustration, rendu du texte, vitesse, VRAM, écosystème LoRA et licence, avec une recommandation pour chaque type de travail et matériel.
Par Captain
2026-05-22
Erreurs et solutions
Erreurs ComfyUI et comment les réparer : nœuds rouges, modèles manquants, mémoire CUDA insuffisante
Les messages d'erreur ComfyUI que les gens rencontrent en premier, ce que chacun signifie et la solution qui marche : nœuds personnalisés manquants (boîtes rouges), « Prompt outputs failed validation », mémoire CUDA insuffisante, mauvais type de modèle dans un chargeur, erreurs de forme mat1 et mat2, désérialisation d'en-tête, incompatibilités torch et xformers.
Par Captain
2026-05-12
Services cloud
PirateDiffusion : utilise n’importe quel modèle depuis Telegram, pas besoin de GPU
Les commandes importantes du bot Telegram PirateDiffusion : /render avec les mots-clés du modèle, pondération avec (( )) et [[ ]], #recipes, /adetailer, /highdef et /facelift pour l’upscaling, /remix, /inpaint, les workflows ComfyUI avec /wf /run:, et les nouvelles compétences // qui choisissent le modèle pour toi.
Par Captain
2026-10-03
Applications
BitVector : Vector pour Discord, Spyglass sur le web et Prism chat
Comment utiliser des modèles hébergés et des workflows ComfyUI depuis Discord avec le bot Vector, depuis n'importe quel navigateur avec Spyglass, et en discutant avec Prism : liaison de compte, /ai render et /ai workflow, média initial pour image-à-image et image-à-vidéo, compétences, et les corrections des erreurs courantes.
Par Captain
2026-10-03

Autres guides

Modèles
FLUX.1 Dev : comment le guider, meilleurs réglages et idées créatives
Un guide pratique pour FLUX.1 Dev de Black Forest Labs : comment utiliser des instructions en langage naturel, réglages de guidage et d’étapes, empilement de LoRA, rendu de texte et idées de prompts qui exploitent ses points forts.
Par Captain
2026-09-30
Modèles
Stable Diffusion XL 1.0 : prompts, réglages et ce qu'il fait encore de mieux
Comment tirer le meilleur parti du modèle de base officiel SDXL 1.0 : résolutions natives, réglages CFG et sampler, le refiner, prompts négatifs et idées de styles où SDXL brille encore.
Par Captain
2026-10-01
Modèles
Stable Diffusion 1.5 : le modèle classique, bien utilisé
Stable Diffusion 1.5 vaut toujours le coup : la bonne résolution, CFG et sampler, comment utiliser sa grande bibliothèque de LoRAs et embeddings, et des idées de prompts créatifs adaptés à un modèle 512 pixels.
Par Captain
2026-10-02
Modèles
FLUX.2 Dev : comment utiliser le nouveau modèle de Black Forest Labs
FLUX.2 Dev permet des prompts plus longs, un meilleur texte, un réalisme renforcé et une édition multi-références. Ce guide explique le workflow turbo, les réglages de guidance et de résolution, la structure du prompt et des idées qui tirent parti de ses nouvelles capacités.
Par Captain
2026-10-03
Modèles
Qwen-Image : longues invites, texte parfait et affiches bilingues
Qwen-Image est le modèle à utiliser quand les mots dans l’image comptent. Apprends à écrire ses longues invites descriptives, à rendre le texte anglais et chinois avec précision, à régler le CFG et les étapes, et à explorer des idées créatives avec beaucoup de mise en page.
Par Captain
2026-09-29
Modèles
SDXL-Lightning : génération en quatre étapes sur n'importe quel checkpoint SDXL
Le LoRA SDXL-Lightning de ByteDance transforme un rendu SDXL de 30 étapes en un rendu de 4 étapes. Découvre le nombre d'étapes, le CFG à utiliser, le sampler, et comment le combiner avec tes checkpoints et LoRAs de style préférés.
Par Captain
2026-09-30