Como funcionam os modelos de imagem generativa de IA: difusão, latentes e codificadores de texto explicados de forma simples
Tema: Modelos
Por Quartermaster
Publicado em 2025-08-28
Os mecanismos por trás do Stable Diffusion, SDXL, Flux e os modelos de vídeo sem a matemática: o que o ruído tem a ver com isso, por que os modelos funcionam em um espaço latente comprimido, o que o codificador de texto e o VAE fazem, o que os passos e a orientação realmente mudam, e por que os dados de treinamento decidem o que um modelo pode desenhar.
Visão geral
Todo modelo de imagem atual é um removedor de ruído. Durante o treinamento, ele vê milhões de imagens com quantidades crescentes de ruído aleatório adicionadas, junto com a legenda de cada imagem, e aprende a prever qual ruído foi adicionado. Na geração, o processo roda ao contrário: começa com ruído puro, pergunta ao modelo qual ruído está ali dado seu prompt, remove um pouco dele, repete vinte ou trinta vezes, e uma imagem que corresponde à legenda aparece. Esse é o truque todo; "difusão" é o nome desse processo gradual de adicionar e remover ruído.
Trabalhar com pixels em tamanho real seria muito lento, então desde o Stable Diffusion 1.x a remoção de ruído acontece em um espaço comprimido chamado latente. Uma rede pequena separada, o VAE, comprime uma imagem 1024x1024 em uma grade 128x128 de números e a expande de volta no final. O removedor de ruído (um U-Net no
SD 1.5
e
SDXL
, um transformador no
Flux
,
Qwen
,
Z-Image
e nos modelos de vídeo) nunca vê pixels. Por isso os tamanhos de imagem precisam ser múltiplos de 8 ou 16, e por isso a etapa de decodificação do VAE no final pode ficar sem memória sozinha.
O prompt entra por um codificador de texto, que transforma palavras em uma lista de números que o removedor de ruído pode usar como base. O SD 1.5 usa um codificador CLIP com limite de 77 tokens, o SDXL usa dois, o Flux adiciona um grande modelo de linguagem T5, e os modelos de 2025 e 2026 (
Qwen Image
,
FLUX.2
, Z-Image,
Wan 2.2
) usam LLMs completos como codificadores. Essa mudança explica a maior parte da diferença em como os prompts são escritos: listas de tags para modelos baseados em CLIP, frases naturais para os baseados em LLM. Um
LoRA
, por fim, é um pequeno conjunto de correções nos pesos do removedor de ruído (e às vezes no codificador) que direciona o que ele desenha; ele não adiciona conhecimento novo do nada, só reequilibra o que o modelo base já aprendeu.
Referência
Nome | Tipo | O que é |
|---|---|---|
Denoiser (U-Net / DiT) | component | |
VAE | component | Comprime imagens para latentes e de volta. Um VAE errado ou ausente gera imagens desbotadas ou com tom roxo. Flux e famílias mais novas trazem seus próprios VAEs de 16 canais. |
Text encoder | component | CLIP-L, CLIP-G, T5-XXL ou um LLM (Qwen2.5-VL, Mistral, Gemma). Decide como o prompt é entendido e o tamanho que pode ter. |
Scheduler / sampler | setting | A programação de quanto ruído remover em cada passo e o método numérico usado. Muda textura e velocidade de convergência, não o conteúdo. |
Steps | setting | Quantas iterações de remoção de ruído. Modelos destilados (Turbo, Lightning, Schnell, Klein) são treinados para precisar de 1 a 8. |
CFG / guidance | setting | Orientação sem classificador: o quanto a previsão condicionada pelo prompt é afastada da não condicionada. Muito alto queima as cores; modelos destilados com orientação ( Flux dev ) usam um único valor de orientação. |
Latent size | setting | Tamanho da imagem dividido por 8 (SD) ou 16 (Flux, Wan). Modelos desenham melhor perto da resolução em que foram treinados. |
Flow matching | training method | Substituto de 2024+ para os agendamentos clássicos de ruído da difusão (Flux, SD3, Wan, Z-Image). Mesma ideia, caminho mais direto do ruído para a imagem, menos passos necessários. |
AD

Veja a teoria na prática, sem configuração
BitVector Prism deixa você alternar entre modelos SDXL, Flux e Qwen em um app web, para rodar o mesmo prompt em três arquiteturas e ver as diferenças descritas aqui em um minuto.
Passo a passo
- Ruído entra: osamplercria uma grade latente de números aleatórios a partir da seed. Mude a seed e tudo depois muda.
- Prompt entra: o codificador de texto transforma suas palavras emembeddings. Nos modelos CLIP, tudo além de 77 tokens é dividido ou descartado; nos baseados em LLM um parágrafo é tranquilo.
- Cada passo: o removedor de ruído roda duas vezes no SD e SDXL (com e sem o prompt); a diferença, multiplicada pelo CFG, direciona o latente para o prompt. O Flux dev roda uma vez com um valor de orientação embutido.
- O sampler subtrai o ruído previsto conforme o agendamento (Karras, exponencial, simples, beta). Depois do último passo o latente é uma imagem limpa em forma comprimida.
- Decodificar: o VAE expande o latente para pixels. A decodificação tiled do VAE existe porque essa etapa sozinha pode ultrapassar a memória de uma placa de 8 GB em tamanhos grandes.
- Passagens opcionais: hires-fix adiciona um pouco de ruído de novo e remove ruído em tamanho maior;img2imgcomeça de uma imagem existente em vez de ruído puro; inpainting limita a mudança a uma máscara.
- Modelos de vídeo adicionam um eixo de tempo ao latente (um clipe de 5 segundos é um latente 3D) e o resto é o mesmo loop, por isso precisam de dez vezes mais memória.
Exemplos
O mesmo prompt em três arquiteturas diferentes
SD 1.5 (CLIP, 77 tokens): "portrait of an old sailor, grey beard, wool cap, harbour background, film photo"
SDXL (two CLIPs): same words, 1024x1024, CFG 6, 28 steps
Flux dev (CLIP-L + T5): "A weathered old sailor with a grey beard and a navy wool cap stands at a harbour railing at dusk; shallow depth of field, Kodak Portra look." guidance 3.5, 24 steps
Nós do ComfyUI mapeados para os componentes
Load Checkpoint -> MODEL (denoiser), CLIP (text encoder), VAE
CLIP Text Encode (prompt) -> KSampler (sampler, steps, CFG, seed) -> VAE Decode -> Save Image
Dicas
- Um modelo não pode desenhar o que não estava nos dados de treinamento. Por isso os fine-tunes de anime conhecem milhares de personagens e os modelos de foto não, e por isso existe um LoRA para quase toda lacuna.
- Fine-tunes (DreamShaper, Juggernaut,Illustrious, Pony) têm a mesma arquitetura da base com pesos diferentes; um LoRA para a base geralmente funciona no fine-tune, um LoRA para um fine-tune muito diferente (Pony) muitas vezes não.
- Modelos destilados trocam flexibilidade por velocidade. SDXL Lightning com 4 passos serve para rascunhos; o modelo completo com 28 passos é melhor para finais.
- O codificador de texto costuma ser o maior arquivo. Flux com T5-XXL fp16 precisa de 9 GB só para o codificador, por isso existem versões fp8 e GGUF.
- Destilação de orientação (Flux dev) e CFG não são a mesma coisa. Usar CFG 7 no Flux dev gera imagens queimadas; use as configurações da página do modelo.
- Tudo aqui roda nos parceiros na nuvem exatamente como localmente; a diferença é só quem tem a GPU.
Solução de problemas
Imagens saem cinza, desbotadas ou com tom roxo
Por que acontece
VAE ausente ou incompatível, ou estouro de VAE fp16 no SDXL.
Como corrigir
Carregue o VAE que pertence à família; no SDXL use o VAE com correção fp16.
Prompt longo é parcialmente ignorado
Por que acontece
Limite de tokens do CLIP no SD 1.5 e SDXL.
Como corrigir
Coloque as palavras importantes primeiro, ou mude para um modelo Flux, Qwen ou Z-Image com codificador LLM.
Cores queimadas e contraste extremo
Por que acontece
CFG muito alto para o modelo, ou CFG usado em modelo destilado com orientação.
Como corrigir
Reduza o CFG para 5 a 7 no SDXL; use orientação 3 a 4 e CFG 1 no Flux dev.
Repetição ou duplicação de sujeitos em tamanhos grandes
Por que acontece
Latente muito maior que a resolução de treinamento; o modelo se repete.
Como corrigir
Gere no tamanho nativo e faça upscale, ou use hires-fix com 0.4 de remoção de ruído.
Falta de memória só no final
Por que acontece
Etapa de decodificação do VAE em tamanho completo.
Como corrigir
AD

Todas as arquiteturas em um cluster de GPU
PirateDiffusion hospeda SD 1.5, SDXL, Flux, FLUX.2, Qwen, Z-Image e os modelos de vídeo lado a lado no Telegram, com geração ilimitada por preço fixo. Sem matemática de VRAM, sem arquivos VAE para achar.
Perguntas
O modelo está copiando imagens do seu conjunto de treinamento?
Ele armazena pesos, não imagens, e não pode recuperar uma foto do treinamento. Quase-duplicatas de imagens muito frequentes podem aparecer (pinturas famosas, logos), o que é um motivo para evitar pedir por elas.
Por que modelos novos precisam de mais memória se a ideia é a mesma?
Removedores de ruído maiores (12 bilhões de parâmetros no Flux contra 0,9 no SD 1.5), codificadores de texto maiores e latentes maiores. Versões quantizadas fp8 e GGUF ajudam a reduzir isso.
Qual a diferença entre checkpoint e modelo?
Checkpoint é o arquivo salvo de um modelo (removedor de ruído, muitas vezes com codificador e VAE juntos). As pessoas usam os termos como sinônimos.
Por que a mesma seed gera imagem diferente em outro PC?
GPU diferente, precisão (fp16 vs bf16) ou implementação do sampler; o ruído é o mesmo, mas a conta muda um pouco. Mesmo computador, mesmas configurações, mesma imagem.
Mais passos sempre ajudam?
Não. A maioria dos samplers converge entre 25 e 30 passos; passar disso é perder tempo. Modelos destilados pioram com mais passos.
Links e fontes
- Denoising Diffusion Probabilistic Models (Ho et al., 2020)
- High-Resolution Image Synthesis with Latent Diffusion Models (Rombach et al., 2022)
- Flow Matching for Generative Modeling (Lipman et al., 2022)
- Flux family page
- SD 1.5 family page
- BitVector web app
Modelos deste guia
Modelos Stable Diffusion 1.5
Modelos Stable Diffusion XL 1.0
Modelos Flux
Modelos Qwen
Modelos Zimage
Modelos Wan
Escrito por
Quartermaster
Guias relacionados
Serviços na nuvem
Começando com geração de imagens por IA: sua primeira imagem em dez minutos
Um começo simples para quem nunca mexeu: o que é um modelo, as três formas de usar um (app web, chat bot, seu próprio PC), como escrever seu primeiro prompt, o que significam as configurações e como saber se o resultado é bom ou só sorte.
Por Captain
2025-08-14
Prompting
Passos, CFG, samplers, schedulers e seeds: as configurações de geração explicadas com padrões seguros
O que cada configuração no painel de geração muda, os valores que funcionam para cada família de modelo (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), quais samplers vale a pena conhecer, por que modelos destilados quebram as regras comuns e como usar seeds para mudar uma coisa de cada vez.
Por Quartermaster
2025-11-19
Modelos
Checkpoint vs LoRA vs embedding vs ControlNet: qual arquivo faz o quê
Os seis tipos de arquivos de modelo que você vai encontrar, o que cada um muda, o tamanho, onde colocar e quando usar: checkpoints e fine-tunes, LoRAs e seus primos LyCORIS, embeddings de inversão textual, ControlNets e IP-Adapters, VAEs e upscalers.
Por Quartermaster
2025-10-08
Modelos
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: qual família de modelo usar em 2026
Uma comparação prática das famílias de modelos de imagem abertos: fidelidade ao prompt, realismo, anime e ilustração, renderização de texto, velocidade, VRAM, ecossistema LoRA e licença, com uma recomendação para cada tipo de trabalho e hardware.
Por Captain
2026-05-22
Mais guias
Modelos
FLUX.1 Dev: como criar prompts, melhores configurações e ideias criativas
Um guia prático para FLUX.1 Dev da Black Forest Labs: como criar prompts em linguagem natural, configurações de orientação e passos, empilhamento de LoRA, renderização de texto e ideias de prompt que aproveitam seus pontos fortes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configurações e no que ele ainda é melhor
Como tirar o máximo proveito do modelo base oficial SDXL 1.0: resoluções nativas, configurações de CFG e sampler, o refinador, prompts negativos e ideias de estilos onde o SDXL ainda se destaca.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: o modelo clássico, usado do jeito certo
Stable Diffusion 1.5 ainda vale a pena conhecer: a resolução certa, CFG e sampler, como usar sua enorme biblioteca de LoRAs e embeddings, e ideias criativas de prompt para um modelo de 512 pixels.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: criando prompts para o modelo mais novo da Black Forest Labs
FLUX.2 Dev traz prompts maiores, texto melhor, realismo mais forte e edição com múltiplas referências. Este guia cobre o fluxo turbo, configurações de orientação e resolução, estrutura do prompt e ideias que aproveitam suas novas forças.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts longos, texto perfeito e pôsteres bilíngues
Qwen-Image é o modelo ideal quando as palavras na imagem importam. Aprenda a escrever seus prompts longos e descritivos, renderizar texto em inglês e chinês com precisão, ajustar CFG e passos, e explorar ideias criativas com muitos elementos no layout.
Por Captain
2026-09-29
Modelos
SDXL-Lightning: geração em quatro passos em qualquer checkpoint SDXL
O LoRA SDXL-Lightning da ByteDance transforma uma renderização SDXL de 30 passos em uma de 4 passos. Saiba a quantidade de passos, o CFG que você deve usar, o sampler e como combinar com seus checkpoints e LoRAs de estilo favoritos.
Por Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Feito no Japão
|
© 2026