Model
Trends
.ai
Model
Trends
.ai
los mejores modelos de IA de código abierto

Cómo funcionan los modelos generativos de imágenes AI: difusión, latentes y codificadores de texto explicados de forma sencilla

Tema: Modelos
Por Quartermaster
Publicado el 2025-08-28
Share

Resumen

Todos los modelos de imagen actuales son un eliminador de ruido. Durante el entrenamiento se les muestran millones de imágenes con cantidades crecientes de ruido aleatorio añadido, junto con el texto de cada imagen, y aprenden a predecir qué ruido se añadió. En el momento de la generación, el proceso va hacia atrás: se empieza con ruido puro, se le pregunta al modelo qué ruido hay ahí según tu prompt, se quita un poco, se repite veinte o treinta veces, y aparece una imagen que coincide con el texto. Ese es todo el truco; "difusión" es el nombre de este proceso gradual de añadir ruido y luego quitarlo.
Trabajar con píxeles a tamaño completo sería demasiado lento, así que desde Stable Diffusion 1.x la eliminación de ruido ocurre en un espacio comprimido llamado latente. Una red pequeña aparte, el VAE, comprime una imagen de 1024x1024 en una cuadrícula de números de 128x128 y la expande al final. El eliminador de ruido (un U-Net en
SD 1.5
y
SDXL
, un transformador en
Flux
,
Qwen
,
Z-Image
y los modelos de video) nunca ve píxeles. Por eso los tamaños de imagen deben ser múltiplos de 8 o 16, y por qué el paso de decodificación del VAE al final puede quedarse sin memoria por sí solo.
El prompt entra a través de un codificador de texto, que convierte las palabras en una lista de números con los que el eliminador de ruido puede condicionarse. SD 1.5 usa un codificador CLIP con límite de 77 tokens, SDXL usa dos, Flux añade un gran modelo de lenguaje T5, y los modelos de 2025 y 2026 (
Qwen Image
,
FLUX.2
, Z-Image,
Wan 2.2
) usan LLM completos como codificadores. Ese cambio explica la mayor parte de la diferencia en cómo se escriben los prompts: listas de etiquetas para modelos basados en CLIP, frases naturales para los basados en LLM. Finalmente, un
LoRA
es un pequeño conjunto de correcciones a los pesos del eliminador de ruido (y a veces al codificador) que dirige lo que dibuja; no añade conocimiento nuevo de la nada, solo reequilibra lo que el modelo base ya aprendió.

Referencia

Nombre
Tipo
Qué es
Denoiser (U-Net / DiT)
component
La red principal. Predice el ruido en un latente dado el prompt y el paso. U-Net en SD 1.5 y SDXL; transformador de difusión (DiT / MMDiT) en Flux, FLUX.2, Qwen, Z-Image,
Wan
,
LTX
, H3.
VAE
component
Comprime imágenes a latentes y las vuelve a expandir. Un VAE incorrecto o faltante da imágenes lavadas o con tono púrpura. Flux y familias más nuevas traen sus propios VAEs de 16 canales.
Text encoder
component
CLIP-L, CLIP-G, T5-XXL o un LLM (Qwen2.5-VL, Mistral, Gemma). Decide cómo se entiende el prompt y cuánto puede durar.
Scheduler /
sampler
setting
El programa de cuánto ruido quitar en cada paso y el método numérico usado. Cambia la textura y la velocidad de convergencia, no el contenido.
Steps
setting
Cuántas iteraciones de eliminación de ruido. Los modelos destilados (Turbo, Lightning, Schnell, Klein) están entrenados para necesitar de 1 a 8.
CFG
/ guidance
setting
Guía sin clasificador: cuánto se aleja la predicción condicionada por el prompt de la no condicionada. Muy alto quema colores; los modelos con guía destilada (
Flux dev
) usan un solo valor de guía.
Latent size
setting
Tamaño de imagen dividido por 8 (SD) o 16 (Flux, Wan). Los modelos dibujan mejor cerca de la resolución en la que fueron entrenados.
Flow matching
training method
El reemplazo desde 2024+ para los horarios clásicos de ruido de difusión (Flux, SD3, Wan, Z-Image). Misma idea, camino más directo de ruido a imagen, menos pasos necesarios.
AD
Ve la teoría en práctica, sin configuración
BitVector Prism te permite cambiar entre modelos SDXL, Flux y Qwen en una sola app web, para que puedas pasar el mismo prompt por tres arquitecturas y ver las diferencias que aquí se describen en un minuto.

Paso a paso

  1. Ruido inicial: el
    sampler
    crea una cuadrícula latente de números aleatorios desde la semilla. Cambia la semilla y todo lo que sigue cambia.
  2. Prompt: el codificador de texto convierte tus palabras en
    embeddings
    . En modelos CLIP todo lo que pase de 77 tokens se divide o descarta; en modelos basados en LLM un párrafo está bien.
  3. Cada paso: el eliminador de ruido se ejecuta dos veces en SD y SDXL (con y sin prompt); la diferencia, escalada por CFG, apunta el latente hacia el prompt. Flux dev corre una vez con un valor de guía incorporado.
  4. El sampler resta el ruido predicho según el programa (Karras, exponencial, simple, beta). Después del último paso el latente es una imagen limpia en forma comprimida.
  5. Decodificación: el VAE expande el latente a píxeles. Existe decodificación tiled del VAE porque este paso solo puede superar la memoria de una tarjeta de 8 GB en tamaños grandes.
  6. Pasadas opcionales: hires-fix vuelve a añadir ruido un poco y elimina ruido a un tamaño mayor;
    img2img
    parte de una imagen existente en vez de ruido puro; inpainting limita el cambio a una máscara.
  7. Los modelos de video añaden un eje de tiempo al latente (un clip de 5 segundos es un latente 3D) y por lo demás es el mismo ciclo, por eso necesitan diez veces la memoria.

Ejemplos

El mismo prompt en tres arquitecturas

SD 1.5 (CLIP, 77 tokens): "portrait of an old sailor, grey beard, wool cap, harbour background, film photo"
SDXL (two CLIPs): same words, 1024x1024, CFG 6, 28 steps
Flux dev (CLIP-L + T5): "A weathered old sailor with a grey beard and a navy wool cap stands at a harbour railing at dusk; shallow depth of field, Kodak Portra look." guidance 3.5, 24 steps

Nodos de ComfyUI mapeados a los componentes

Load Checkpoint -> MODEL (denoiser), CLIP (text encoder), VAE
CLIP Text Encode (prompt) -> KSampler (sampler, steps, CFG, seed) -> VAE Decode -> Save Image

Consejos

  • Un modelo no puede dibujar lo que no estaba en sus datos de entrenamiento. Por eso los fine-tunes de anime conocen miles de personajes y los modelos de fotos no, y por qué existe un LoRA para casi cada vacío.
  • Los fine-tunes (DreamShaper, Juggernaut,
    Illustrious
    , Pony) tienen la misma arquitectura que su base con pesos diferentes; un LoRA para la base suele funcionar en el fine-tune, un LoRA para un fine-tune muy distinto (Pony) a menudo no.
  • Los modelos destilados cambian flexibilidad por velocidad. SDXL Lightning a 4 pasos está bien para borradores; el modelo completo a 28 pasos es mejor para finales.
  • El codificador de texto suele ser el archivo más grande. Flux con T5-XXL fp16 necesita 9 GB solo para el codificador, por eso existen versiones fp8 y GGUF.
  • La destilación de guía (Flux dev) y CFG no son lo mismo. Usar un CFG de 7 en Flux dev da imágenes quemadas; usa los ajustes de la página del modelo.
  • Todo aquí corre en los socios en la nube igual que localmente; la diferencia es solo quién tiene la GPU.

Solución de problemas

Las imágenes salen grises, lavadas o con tono púrpura

Por qué ocurre
VAE faltante o incorrecto, o un desbordamiento de VAE fp16 en SDXL.

Cómo arreglarlo
Carga el VAE que corresponde a la familia; en SDXL usa el VAE con arreglo fp16.

El prompt largo se ignora en parte

Por qué ocurre
Límite de tokens CLIP en SD 1.5 y SDXL.

Cómo arreglarlo
Pon las palabras importantes primero, o cambia a un modelo Flux, Qwen o Z-Image con codificador LLM.

Los colores se queman y el contraste es extremo

Por qué ocurre
CFG demasiado alto para el modelo, o CFG usado en un modelo con guía destilada.

Cómo arreglarlo
Baja el CFG a 5-7 en SDXL; usa guía 3-4 y CFG 1 en Flux dev.

Patrones repetidos o sujetos duplicados en tamaños grandes

Por qué ocurre
Latente mucho más grande que la resolución de entrenamiento; el modelo se repite.

Cómo arreglarlo
Genera en tamaño nativo y luego escala, o usa hires-fix con 0.4 de eliminación de ruido.

Se queda sin memoria solo al final

Por qué ocurre
El paso de decodificación del VAE a tamaño completo.

Cómo arreglarlo
Usa decodificación tiled del VAE, o un tamaño de salida menor seguido de un escalador.

AD
PirateDiffusion
Todas las arquitecturas en un solo clúster GPU
PirateDiffusion aloja SD 1.5, SDXL, Flux, FLUX.2, Qwen, Z-Image y los modelos de video juntos en Telegram, con generación ilimitada a precio fijo. Sin cálculos de VRAM, sin archivos VAE que buscar.

Preguntas

¿El modelo copia imágenes de su conjunto de entrenamiento?

Guarda pesos, no imágenes, y no puede recuperar una foto de entrenamiento. Pueden aparecer casi duplicados de imágenes muy frecuentes (pinturas famosas, logos), por eso es mejor no pedirlas en el prompt.

¿Por qué los modelos nuevos necesitan más memoria si la idea es la misma?

Eliminadores de ruido más grandes (12 mil millones de parámetros para Flux contra 0.9 para SD 1.5), codificadores de texto más grandes y latentes más grandes. Las versiones cuantizadas fp8 y GGUF los reducen.

¿Cuál es la diferencia entre un checkpoint y un modelo?

Un checkpoint es el archivo guardado de un modelo (eliminador de ruido, a menudo con codificador y VAE incluidos). La gente usa las palabras indistintamente.

¿Por qué la misma semilla da una imagen diferente en otro PC?

GPU diferente, precisión (fp16 vs bf16) o implementación del sampler; el ruido es igual pero la aritmética varía un poco. Mismo equipo, mismos ajustes, misma imagen.

¿Más pasos siempre ayudan?

No. La mayoría de los samplers convergen entre 25 y 30 pasos; más allá de eso pierdes tiempo. Los modelos destilados empeoran con más pasos.

Enlaces y fuentes

Modelos de esta guía

Escrito por
Quartermaster

Guías relacionadas

Servicios en la nube
Primeros pasos con la generación de imágenes por IA: tu primera imagen en diez minutos
Una introducción sencilla para principiantes totales: qué es un modelo, las tres formas de usar uno (app web, chat bot, tu propio PC), cómo escribir un primer prompt, qué significan los ajustes y cómo distinguir un buen resultado de uno por suerte.
Por Captain
2025-08-14
Prompting
Pasos, CFG, muestreadores, planificadores y semillas: explicación de los ajustes de generación con valores seguros
Qué cambia cada ajuste en el panel de generación, los valores que funcionan según la familia del modelo (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), qué muestreadores vale la pena conocer, por qué los modelos destilados rompen las reglas habituales y cómo usar semillas para cambiar una cosa a la vez.
Por Quartermaster
2025-11-19
Modelos
Checkpoint vs LoRA vs embedding vs ControlNet: qué hace cada archivo
Los seis tipos de archivos de modelo que vas a encontrar, qué cambia cada uno, qué tamaño tienen, dónde van y cuándo usarlos: checkpoints y fine-tunes, LoRAs y sus primos LyCORIS, embeddings de inversión textual, ControlNets y IP-Adapters, VAEs y upscalers.
Por Quartermaster
2025-10-08
Modelos
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: qué familia de modelos usar en 2026
Una comparación práctica de las familias de modelos de imagen abiertos: seguimiento del prompt, realismo, anime e ilustración, renderizado de texto, velocidad, VRAM, ecosistema LoRA y licencia, con una recomendación para cada tipo de trabajo y hardware.
Por Captain
2026-05-22

Más guías

Servicios en la nube
Tarifa fija vs tokens: por qué los planes ilimitados como Graydient.ai son la mejor opción para creadores de IA en 2026
Una comparación de costos ordenada, con precios revisados el 8 de octubre de 2026, de planes ilimitados con tarifa fija como Graydient.ai frente a precios por tokens y créditos de Midjourney, Leonardo, fal.ai, Replicate, Runway y Kling: cuánto cuestan realmente 1,000 imágenes y 1,000 videos al mes en cada uno, y por qué una tarifa fija para imágenes, video, audio, chat Grok LLM y apps web ilimitadas es la mejor opción para creadores que hacen muchas pruebas.
Por Captain
2026-10-08
Modelos
FLUX.1 Dev: cómo usar prompts, mejores ajustes e ideas creativas
Una guía práctica de FLUX.1 Dev de Black Forest Labs: cómo usar prompts en lenguaje natural, ajustes de guía y pasos, apilamiento de LoRA, renderizado de texto e ideas para aprovechar sus puntos fuertes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configuraciones y en qué sigue destacando
Cómo sacar el máximo provecho del modelo base oficial SDXL 1.0: resoluciones nativas, configuraciones de CFG y sampler, el refinador, prompts negativos e ideas para estilos donde SDXL todavía brilla.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: el modelo clásico, usado correctamente
Stable Diffusion 1.5 sigue siendo importante: la resolución adecuada, CFG y sampler, cómo usar su enorme biblioteca de LoRAs y embeddings, y ideas creativas para prompts adaptadas a un modelo de 512 píxeles.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: cómo usar el modelo más nuevo de Black Forest Labs
FLUX.2 Dev trae prompts más largos, mejor texto, realismo más fuerte y edición con múltiples referencias. Esta guía cubre el flujo turbo, ajustes de guía y resolución, estructura del prompt e ideas que aprovechan sus nuevas fortalezas.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts largos, texto perfecto y carteles bilingües
Qwen-Image es el modelo al que acudir cuando las palabras en la imagen importan. Aprende a escribir sus prompts largos y descriptivos, a renderizar texto en inglés y chino con precisión, a configurar CFG y pasos, y a explorar ideas creativas con mucho diseño.
Por Captain
2026-09-29