Model
Trends
.ai
Model
Trends
.ai
les meilleurs modèles d'IA open source

Glossaire de génération d’images et vidéos IA : 60 termes de checkpoint à VAE, expliqués en une ligne chacun

Sujet : Prompting
Par Captain
Publié le 2026-04-15
Share

Aperçu

Chaque communauté invente son vocabulaire et celle-ci en a créé un grand rapidement. Le glossaire ci-dessous est la référence que les autres guides de ce site utilisent ; chaque terme a une phrase, la famille ou l’outil auquel il appartient quand c’est important, et le guide plus long à lire ensuite. Les termes sont regroupés : modèles et architectures, fichiers, réglages, techniques, prompting, vidéo, matériel.
Les familles sur ce site (
Flux
,
SDXL
,
Wan
, etc.) sont expliquées sur leurs pages dédiées, et chaque page de modèle montre les termes utilisés : son type, sa famille, ses mots-clés, ses réglages recommandés. Si un mot sur une page de modèle n’est pas ici, le chat communautaire lié depuis la FAQ est l’endroit pour demander.

Référence

Nom
Type
Rôle
Checkpoint
/ base model
file
Les poids complets du modèle dans un seul fichier (ou quelques fichiers pour les modèles de l’ère Flux). Fonctionne seul. Voir
checkpoint
vs
LoRA
vs embedding.
Fine-tune
model
Un checkpoint réentraîné sur de nouvelles données (DreamShaper,
Illustrious
, Pony). Même architecture que son modèle de base.
Merge
model
Un checkpoint créé en moyennant d’autres. Hérite de la famille.
LoRA
/ LyCORIS / DoRA
file
Un petit ajout qui modifie le comportement d’un checkpoint ; nécessite un mot-clé et un poids. Voir le guide LoRA.
Embedding
/ textual inversion
file
Un token appris pour l’encodeur de texte, tapé par son nom ; surtout des embeddings négatifs sur
SD 1.5
et SDXL.
VAE
component
Encodeur/décodeur entre pixels et latents ; un mauvais VAE donne des couleurs délavées.
Text encoder (CLIP, T5, LLM)
component
Transforme le prompt en nombres ; décide du dialecte du prompt (tags vs phrases).
U-Net / DiT / MMDiT
architecture
Le design du débruiteur : U-Net dans SD 1.5 et SDXL, diffusion transformer dans Flux,
Qwen
, Wan,
Z-Image
.
MoE (mixture of experts)
architecture
Plusieurs sous-modèles dont un seul tourne à chaque étape (
Wan 2.2
experts bruit fort/faible, HunyuanImage 3).
Diffusion / flow matching
training
Apprendre à enlever le bruit étape par étape ; flow matching est la formulation plus directe depuis 2024+. Voir comment fonctionnent les modèles.
Distilled (Turbo, Lightning, Schnell, Klein, Hyper)
model
Entraîné pour fonctionner en 1-8 étapes avec
CFG
1 ; plus rapide, moins flexible.
Guidance-distilled
model
CFG intégré (
Flux dev
) ; une valeur de guidance remplace CFG et le prompt négatif ne sert plus.
fp16 / bf16 / fp8 / NF4 / GGUF Q4-Q8
precision
Comment les poids sont stockés ; une précision plus basse signifie fichiers et
VRAM
plus petits, qualité légèrement moindre. Voir le guide VRAM.
format
Format safe tensor uniquement vs pickle qui exécute du code. Voir téléchargements sûrs.
Steps
setting
Nombre d’itérations de débruitage ; 20-30 normal, 4-8 distillé.
CFG
scale
setting
À quel point le prompt influence la génération ; 5-7 SDXL, 1 Flux. Voir explication des réglages.
Sampler
/ scheduler
setting
Méthode numérique et courbe de bruit (Euler, DPM++ 2M ; Karras, simple, beta).
Seed
setting
Le bruit de départ ; seed fixe, image répétable.
Denoise
setting
En
img2img
et inpainting, combien de l’image d’entrée peut changer (0-1).
Shift / sigma
setting
Où un modèle flow passe ses étapes (Flux, Wan, Z-Image).
Latent
concept
L’image compressée sur laquelle travaille le débruiteur (taille 1/8 ou 1/16).
Resolution / native size
concept
512 (SD 1.5), 1024 (SDXL, Flux) ; multiples de 8 ou 16.
Hires-fix
technique
Deuxième passage de diffusion à une taille plus grande pendant la génération. Voir
upscaling
.
Upscaler
(ESRGAN, SwinIR)
technique
Réseau d’agrandissement de pixels lancé après la génération.
technique
Générer à partir d’une image existante plus du bruit. Voir img2img et inpainting.
Inpainting
/ outpainting
technique
Régénérer une zone masquée / étendre la toile.
ControlNet
/ T2I-Adapter
technique
Contrôle de la structure à partir de pose, profondeur ou contours. Voir explication
ControlNet
.
IP-Adapter / Redux / reference
technique
Conditionnement de style ou d’identité basé sur une image.
Face detailer / ADetailer
technique
Masque automatique du visage plus inpainting à plus haute résolution.
Tiled diffusion / Ultimate SD Upscale
technique
Grandes images en tuiles qui se chevauchent avec un Tile ControlNet.
prompting
Ce qu’il faut dessiner / ce qu’il faut éviter (SD et SDXL seulement). Voir bases du prompt et négatifs.
Trigger word
prompting
Le token sous lequel une LoRA a été entraînée ; nécessaire pour qu’elle agisse.
Weight (word:1.3)
prompting
Accentuation de l’attention sur les modèles CLIP.
Quality tags / score tags
prompting
masterpiece, best quality (Illustrious) ; score_9 (Pony). Anime SDXL seulement.
Token limit (77)
prompting
Taille des chunks CLIP ; raison pour laquelle les longs prompts sont coupés sur SD et SDXL.
Prompt bleeding
prompting
Un attribut qui s’attache au mauvais objet.
T2I / T2V / I2V / TI2V / V2V
video
Texte vers image / texte vers vidéo / image vers vidéo / les deux / vidéo vers vidéo.
Frames and fps
video
81 frames à 16 fps font 5 secondes sur Wan ; la mémoire augmente avec les frames.
High-noise / low-noise expert
video
Les deux modèles 14B de Wan 2.2 pour les étapes tôt et tard ; les LoRAs ciblent l’un ou l’autre.
First / last frame
video
Conditionnement sur images clés (FLF2V) pour un mouvement contrôlé.
VACE / Fun
ControlNet
video
Modèles d’édition et de contrôle vidéo dans la famille Wan.
Frame interpolation (RIFE, FILM)
video
Générer des frames intermédiaires pour augmenter les fps.
VRAM
/ offloading / block swap
hardware
Mémoire GPU ; déplacer des parties du modèle vers la RAM système quand ça ne rentre pas. Voir guide VRAM.
CUDA / MPS / ROCm
hardware
Backends de calcul NVIDIA / Apple / AMD.
Workflow (
ComfyUI
)
tool
Un graphe de nœuds sauvegardé ; intégré dans les PNG
ComfyUI
. Voir guide débutant ComfyUI.
Custom node
tool
Extension ComfyUI ; installée avec le Manager.
Heat score
this site
À quel point un modèle est populaire en ce moment, d’après téléchargements, utilisations et recherches ; expliqué dans la FAQ.
AD
Apprends en faisant, pas en lisant
BitVector Prism étiquette ses réglages avec les mêmes mots que ce glossaire et précharge les bonnes valeurs par modèle. Ouvre-le à côté de cette page et teste chaque terme sur une vraie image. Pas d’installation.

Pas à pas

  1. Lis une page de modèle de haut en bas avec le glossaire ouvert : type, famille, mots-clés, ligne de réglages sous chaque exemple.
  2. Choisis les trois termes qui t’ont embrouillé et lis le guide lié pour chacun ; les guides sont écrits pour que ce glossaire suffise comme contexte.
  3. Quand tu rencontres un nouveau terme dans un fil de forum, vérifie s’il s’agit d’un fichier, d’un réglage, d’une technique ou d’un terme vidéo ; la plupart des confusions viennent du mélange de ces catégories.
  4. Reviens quand une nouvelle famille apparaît ; les pages hub ajoutent leurs propres termes (experts Wan 2.2, guidance Flux) et cette liste est mise à jour avec eux.

Exemples

Une ligne de réglages sur une page de modèle, décodée

"<lora:zavy-cinematic-xl:0.7> zavy cinematic, ... | 1024x1024 | DPM++ 2M Karras | 28 steps | CFG 6 | seed 4471"
LoRA at weight 0.7 with its trigger word; native SDXL size; sampler + scheduler; 28 denoising steps; CFG 6; fixed seed

Un nom de workflow Wan 2.2, décodé

wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors -> Wan 2.2, image to video, the high-noise expert, 14B parameters, fp8 precision, safetensors format

Astuces

  • Trois mots causent la plupart des erreurs de débutants : famille (une LoRA doit correspondre), mot-clé (une LoRA en a besoin) et débruitage (img2img dépend entièrement de ça).
  • Quand deux guides ne sont pas d’accord sur CFG, ils parlent de familles différentes ; vérifie laquelle.
  • "Modèle" signifie checkpoint dans la plupart des phrases, mais ici "modèle" désigne toute entrée du catalogue, y compris les LoRAs ; le label de type te dit lequel.
  • Les termes vidéo sont les mêmes idées avec un axe temps ; si tu connais T2I et img2img, tu connais T2V et I2V.
  • Les partenaires cloud utilisent le même vocabulaire : les flags de
    PirateDiffusion
    sont /steps, /guidance, /seed, /size ; le panneau
    BitVector
    utilise les mêmes noms.

Dépannage

Deux sources utilisent le même mot différemment

Pourquoi cela arrive
Les termes ont dérivé entre les ères SD 1.5, SDXL et Flux ("guidance" vs "CFG").

Comment le corriger
Ancre-toi sur la famille : CFG pour SD/SDXL, guidance pour Flux.

"Modèle" sur Civitai ne veut pas dire la même chose qu’ici

Pourquoi cela arrive
Civitai regroupe les versions sous un même modèle ; ce site liste chaque version séparément.

Comment le corriger
Fais correspondre par hash, pas par nom.

Un réglage nommé sur une page de modèle manque dans mon UI

Pourquoi cela arrive
Noms différents dans l’UI (force de débruitage vs denoise ; étapes hires vs second passage).

Comment le corriger
La ligne du glossaire donne les alias ; le guide des nœuds ComfyUI fait le lien avec les noms des nœuds.

AD
PirateDiffusion
Chaque terme est une commande
PirateDiffusion transforme le vocabulaire en flags Telegram : /steps, /guidance, /seed, /size, tags LoRA et [[negatives]]. Des milliers de modèles, rendus illimités, prix fixe.

Questions

Un checkpoint, c’est la même chose qu’un modèle ?

Dans le langage courant oui. Strictement, un checkpoint est le fichier sauvegardé d’un modèle.

Quelle est la différence entre guidance et CFG ?

CFG est une guidance sans classifieur appliquée à l’exécution sur SD et SDXL ; Flux dev l’intègre et expose un seul nombre de guidance à la place.

Où sont les mots spécifiques à la vidéo ?

Dans le groupe vidéo ci-dessus et sur les pages des familles Wan,
LTX
et H3 ; le guide de démarrage vidéo les explique.

Faut-il tout savoir ça pour faire des images ?

Non. Famille, mot-clé et débruitage couvrent 80 % des problèmes ; le reste tu l’apprends au fur et à mesure.

Liens et sources

Modèles de ce guide

Écrit par
Captain

Guides associés

Services cloud
Commencer avec la génération d'images IA : ta première image en dix minutes
Un démarrage simple pour les débutants complets : ce qu'est un modèle, les trois façons de l'utiliser (application web, chatbot, ton propre PC), comment écrire un premier prompt, ce que signifient les réglages et comment distinguer un bon résultat d’un coup de chance.
Par Captain
2025-08-14
Modèles
Comment fonctionnent les modèles d’images génératives IA : diffusion, latents et encodeurs de texte expliqués simplement
Le fonctionnement de Stable Diffusion, SDXL, Flux et des modèles vidéo sans les maths : quel rôle joue le bruit, pourquoi les modèles travaillent dans un espace latent compressé, ce que font l’encodeur de texte et le VAE, ce que changent vraiment les étapes et la guidance, et pourquoi les données d’entraînement déterminent ce qu’un modèle peut dessiner.
Par Quartermaster
2025-08-28
Modèles
Checkpoint vs LoRA vs embedding vs ControlNet : à quoi sert chaque fichier
Les six types de fichiers modèles que tu vas rencontrer, ce que chacun modifie, leur taille, où les mettre et quand les utiliser : checkpoints et fine-tunes, LoRAs et leurs cousins LyCORIS, embeddings d'inversion textuelle, ControlNets et IP-Adapters, VAEs et upscalers.
Par Quartermaster
2025-10-08
Prompting
Steps, CFG, échantillonneurs, planificateurs et graines : explication des réglages de génération avec des valeurs sûres par défaut
Ce que chaque réglage dans le panneau de génération modifie, les valeurs qui fonctionnent selon la famille de modèles (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), quels échantillonneurs valent la peine d’être connus, pourquoi les modèles distillés cassent les règles habituelles, et comment utiliser les graines pour changer une chose à la fois.
Par Quartermaster
2025-11-19
Modèles vidéo
Génération vidéo IA pour débutants : image en vidéo, texte en vidéo et le premier clip avec Wan, LTX-2 et H3
Une première semaine avec des modèles vidéo ouverts : la différence entre texte en vidéo et image en vidéo et pourquoi commencer par cette dernière, les trois familles de modèles à connaître (Wan 2.2, LTX-2, MiniMax H3), les nombres d’images et résolutions qui fonctionnent, comment écrire un prompt de mouvement, à quoi s’attendre avec une carte 16 ou 24 Go par rapport au cloud, et comment transformer des clips de cinq secondes en quelque chose de plus long.
Par Lookout
2026-04-29

Autres guides

Services cloud
Forfait fixe vs jetons : pourquoi les forfaits illimités comme Graydient.ai offrent la meilleure valeur pour les créateurs d’IA en 2026
Une comparaison des coûts classés, avec les prix relevés le 8 octobre 2026, entre les forfaits illimités à tarif fixe comme Graydient.ai et les tarifs à base de jetons et crédits de Midjourney, Leonardo, fal.ai, Replicate, Runway et Kling : ce que coûtent vraiment 1 000 images et 1 000 vidéos par mois sur chacun, et pourquoi un tarif fixe pour des images, vidéos, audios, chat LLM Grok et applications web illimités est la meilleure option pour les créateurs qui font beaucoup d’essais.
Par Captain
2026-10-08
Modèles
FLUX.1 Dev : comment le guider, meilleurs réglages et idées créatives
Un guide pratique pour FLUX.1 Dev de Black Forest Labs : comment utiliser des instructions en langage naturel, réglages de guidage et d’étapes, empilement de LoRA, rendu de texte et idées de prompts qui exploitent ses points forts.
Par Captain
2026-09-30
Modèles
Stable Diffusion XL 1.0 : prompts, réglages et ce qu'il fait encore de mieux
Comment tirer le meilleur parti du modèle de base officiel SDXL 1.0 : résolutions natives, réglages CFG et sampler, le refiner, prompts négatifs et idées de styles où SDXL brille encore.
Par Captain
2026-10-01
Modèles
Stable Diffusion 1.5 : le modèle classique, bien utilisé
Stable Diffusion 1.5 vaut toujours le coup : la bonne résolution, CFG et sampler, comment utiliser sa grande bibliothèque de LoRAs et embeddings, et des idées de prompts créatifs adaptés à un modèle 512 pixels.
Par Captain
2026-10-02
Modèles
FLUX.2 Dev : comment utiliser le nouveau modèle de Black Forest Labs
FLUX.2 Dev permet des prompts plus longs, un meilleur texte, un réalisme renforcé et une édition multi-références. Ce guide explique le workflow turbo, les réglages de guidance et de résolution, la structure du prompt et des idées qui tirent parti de ses nouvelles capacités.
Par Captain
2026-10-03
Modèles
Qwen-Image : longues invites, texte parfait et affiches bilingues
Qwen-Image est le modèle à utiliser quand les mots dans l’image comptent. Apprends à écrire ses longues invites descriptives, à rendre le texte anglais et chinois avec précision, à régler le CFG et les étapes, et à explorer des idées créatives avec beaucoup de mise en page.
Par Captain
2026-09-29