Requisitos de VRAM para todos los modelos populares de IA para imágenes y video (2026): precisión completa, FP8 y GGUF
Tema: Errores y soluciones
Por P.I. Panda
Publicado el 2026-10-06
Cuánta VRAM necesitas para SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein y Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 y LTX-2, en precisión completa, FP8 y GGUF de 4 bits, con la tarjeta y licencia cómodas para cada uno, qué puede correr cada tamaño de GPU de 8 a 48 GB, y el orden de soluciones cuando un modelo no cabe.
Resumen
Respuesta corta: 8 GB de
VRAM
corren
SDXL
y los modelos pequeños y rápidos como
Z-Image Turbo
y
FLUX.2 Klein 4B
. 12 GB corren
FLUX.1
y
Qwen-Image
una vez que están cuantizados. 24 GB corren casi todos los modelos de imagen más
Wan 2.2
video en FP8. Los modelos grandes más nuevos,
FLUX.2 Dev
y
LTX-2
a calidad completa, quieren 32 GB o más.
La tabla abajo lista todos los modelos abiertos populares con la memoria que necesitan en precisión completa, en FP8 y como archivo GGUF de 4 bits, generando a unos 1024x1024. Diferentes testers cuentan el codificador de texto de forma distinta, así que toma cada número como un rango más que un límite fijo. Tres cosas que la tabla oculta: SDXL sigue siendo el modelo más barato para correr bien (la base cabe en 8 GB, pero
LoRAs
,
ControlNet
y el escalado suman memoria, por eso 12 GB es el número cómodo); FLUX.2 Klein 4B es el que mejor cabe en tarjetas pequeñas ahora (unos 13 GB en precisión completa, más o menos la mitad en FP8, Apache 2.0); y FLUX.2 Dev no es un modelo para casa en precisión completa (un usuario de
ComfyUI
corrió FP8 en una RTX 3060 de 12 GB, usando unos 70 GB de RAM del sistema para lograrlo).
La precisión cambia todo. BF16/FP16 es calidad y tamaño completos, unos 2 GB de VRAM por cada mil millones de parámetros. FP8 reduce eso a la mitad, unos 1 GB por mil millones, y la mayoría no nota diferencia entre FP8 y precisión completa. Los archivos GGUF (Q8, Q5, Q4 y menores) reducen aún más los modelos: Q8 está cerca de la calidad completa, Q4 sacrifica algo de detalle para un tamaño mucho menor, y debajo de Q4 la calidad baja rápido. El modelo no es lo único en memoria: los codificadores de texto (T5 para FLUX.1, un modelo de lenguaje para Qwen-Image y
FLUX.2
), el VAE, LoRAs, ControlNet y la imagen misma ocupan espacio, y ComfyUI mueve algunos de estos a la RAM del sistema automáticamente, por eso dos personas con la misma tarjeta reportan números distintos. Cifras revisadas el 6 de octubre de 2026 según las fichas de modelo y pruebas comunitarias; actualizadas mensualmente.
Referencia
Model
Full precision
FP8
4-bit / GGUF
Comfortable card
Stable Diffusion 1.5
0.9B
CreativeML OpenRAIL-M. Corre en casi cualquier cosa.
Full precision
4 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
6-8 GB
SDXL y fine-tunes: Pony, Illustrious, NoobAI
3.5B
OpenRAIL++ (los fine-tunes varían). 12 GB deja espacio para LoRAs, ControlNet y escalado en un solo flujo.
Full precision
6-8 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
12 GB
SD 3.5 Large
8.1B
Licencia Comunidad Stability.
Full precision
16-24 GB
FP8
menor
que precisión completa
4-bit / GGUF
menor
que FP8
Comfortable card
24 GB
Z-Image Turbo
6B
Apache 2.0. 8 pasos; modelo rápido para tarjetas pequeñas.
Full precision
~16 GB
FP8
~8 GB
4-bit / GGUF
~6 GB
Comfortable card
8-12 GB
FLUX.2 Klein 4B
4B
Apache 2.0, uso comercial permitido. Mejor para tarjetas de 8 GB en 2026.
Full precision
~13 GB
FP8
~8 GB
4-bit / GGUF
~4-5 GB
Comfortable card
8-12 GB
FLUX.2 Klein 9B
9B
Licencia No Comercial FLUX (salidas usables comercialmente).
Full precision
~29 GB
FP8
~17 GB
4-bit / GGUF
~8-9 GB
Comfortable card
16-24 GB
FLUX.1 Schnell
12B
Apache 2.0. 4 pasos.
Full precision
~24 GB
FP8
~12 GB
4-bit / GGUF
~6-8 GB
Comfortable card
12-16 GB
FLUX.1 Dev
12B
Licencia no comercial. El codificador T5 en fp8 ahorra unos 4 GB por sí solo.
Full precision
~24 GB
más con el codificador de texto cargado
FP8
~12-18 GB
4-bit / GGUF
~7 GB
Comfortable card
16-24 GB
Qwen-Image
20B
Apache 2.0. Fuerte en renderizado de texto; necesita su codificador Qwen2.5-VL en FP8 en menos de 32 GB.
Full precision
~41 GB
FP8
~20 GB
4-bit / GGUF
~12-13 GB
Comfortable card
24 GB
FLUX.2 Dev
32B
Licencia no comercial. Espera generaciones lentas sin una tarjeta de 32 GB.
Full precision
~90 GB
con su codificador de texto
FP8
32 GB
cabe en una tarjeta de 32 GB
4-bit / GGUF
12-16 GB
offloading pesado
Comfortable card
32 GB+
HunyuanImage 3.0
80B MoE
Licencia Comunidad Tencent. Solo para centros de datos; úsalo a través de un servicio alojado.
Full precision
multi-GPU
en todas las precisiones
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
centro de datos
Wan 2.1 T2V 1.3B
1.3B
Video 480p
Apache 2.0.
Full precision
8.19 GB
oficial
FP8
8 GB
en práctica
4-bit / GGUF
n/a
Comfortable card
12 GB
Wan 2.2 TI2V 5B
5B
Video 720p
Apache 2.0.
Full precision
GPU de consumidor
oficial, probado en RTX 4090
FP8
n/a
4-bit / GGUF
8 GB
GGUF Q8
Comfortable card
24 GB
Wan 2.2 A14B T2V/I2V
2 x 14B
Video 720p
Apache 2.0. Dos expertos 14B, uno en VRAM a la vez, por eso las tarjetas de 24 GB lo manejan. Wan 2.5-3.0 solo API.
Full precision
80 GB
oficial, GPU única
FP8
~14 GB
por experto
4-bit / GGUF
12-16 GB
GGUF
Comfortable card
24-32 GB
HunyuanVideo 1.5
8.3B
Video 720p, 1080p con su escalador
Licencia Comunidad Tencent.
Full precision
14 GB
oficial, con offloading
FP8
14 GB
en práctica
4-bit / GGUF
n/a
Comfortable card
24 GB+
80 GB para mejor calidad
LTX-2 / LTX-2.3
19B / 22B
Video hasta 4K
Licencia Comunidad LTX-2. Audio sincronizado.
Full precision
32 GB+
oficial
FP8
n/a
4-bit / GGUF
24 GB
FP4
Comfortable card
32 GB
AD

Cada fila de esta tabla, sin VRAM requerida
BitVector Prism corre SDXL, Z-Image, FLUX.1, FLUX.2 y Qwen-Image en precisión completa en sus propias GPUs. Elige un modelo de este sitio, escribe un prompt, genera en el navegador. Nada que descargar.
Paso a paso
- Encuentra tu VRAM (Administrador de tareas > Rendimiento > GPU, o nvidia-smi) y compárala con un nivel abajo; luego elige modelos cuya columna "tarjeta cómoda" esté en o por debajo de ese nivel.
- 6-8 GB (RTX 3060 Ti, 4060, 2070):SD 1.5y SDXL incluyendoPonye Illustrious con uno o dos LoRAs; Z-Image Turbo y FLUX.2 Klein 4B en FP8 o GGUF; FLUX.1 en GGUF Q4, lento;Wan 2.11.3B a 480p yWan 2.2 5Ben GGUF con offloading.
- 12 GB (RTX 3060 12GB, 4070, 5070): todo lo anterior, más rápido, con espacio para ControlNet y escalado;FLUX.1 Devy Schnell en FP8 o GGUF; Qwen-Image en GGUF Q4;FLUX.2 Klein 9Ben GGUF; Wan 2.2 A14B en GGUF Q4 con offloading a baja resolución y clips cortos.
- 16 GB (RTX 4060 Ti 16GB, 4070 Ti Super, 5070 Ti, 5080): FLUX.1 Dev en FP8 con margen; Z-Image Turbo y Klein 4B en precisión completa; Qwen-Image en GGUF Q4-Q5;HunyuanVideo 1.5con offloading; Wan 2.2 A14B en GGUF Q5 a 720p (reportes de la comunidad).
- 24 GB (RTX 3090, 4090): casi todos los modelos de imagen excepto FLUX.2 Dev en precisión completa; Qwen-Image en FP8 o Q8; Wan 2.2 A14B en FP8 y Wan 2.2 5B en precisión completa; LTX-2 en FP4; la mayoría de entrenamiento LoRA para SDXL y Flux.
- 32 GB (RTX 5090): FLUX.2 Dev en FP8; LTX-2 yLTX-2.3en FP8; Wan 2.2 A14B a 720p sin quedarse sin memoria a mitad de un clip.
- 48 GB y más (RTX 6000 Ada, A100, H100): Qwen-Image, LTX-2 y FLUX.2 Dev en precisión completa con espacio de sobra; video largo o en alta resolución, generación por lotes y entrenamiento serio.
- Descarga la precisión para tu nivel desde la página del modelo en este sitio (lista cada variante con su tamaño de archivo), carga los codificadores de texto en FP8, y reserva 32 GB de RAM del sistema (64 GB para los modelos más grandes) para offloading.
Ejemplos
FLUX.1 Dev en una tarjeta de 12 GB (ComfyUI)
Load Diffusion Model: flux1-dev-fp8-e4m3fn (11.9 GB) or UnetLoaderGGUF flux1-dev-Q6_K (9.8 GB) | DualCLIPLoader: clip_l + t5xxl_fp8_e4m3fn_scaled | Load VAE: ae
1024x1024, 20 steps, euler, simple, guidance 3.5 | VAE Decode (Tiled) if the last step fails
Qwen-Image en 16 GB
UnetLoaderGGUF: qwen_image_Q4_K_M.gguf (~12.5 GB) | CLIPLoader: qwen_2.5_vl_7b_fp8_scaled, device cpu | Load VAE: qwen_image_vae
1328x1328 native; start at 1024x1024, 20 steps, cfg 2.5
Los mismos modelos sin tarjeta alguna
/render <flux-dev> a studio photo of a vintage camera on a walnut desk, soft window light /size:1024x1024 (PirateDiffusion, Telegram)
Consejos
- Cuando veas error deCUDA out of memory, haz esto en orden: cambia a una versión FP8 o GGUF del mismo modelo (el mayor ahorro); baja la resolución o la duración del clip (la memoria crece con los píxeles, pasar de 1536 a 1024 px reduce mucho); usa decodificación VAE en mosaicos; carga el codificador de texto en FP8 o déjalo en la CPU; cierra otras apps que usen GPU (navegadores y juegos también ocupan VRAM).
- El offloading funciona pero pagas en velocidad y RAM del sistema: un modelo puede correr en una tarjeta "demasiado pequeña" para él, varias veces más lento, y puede que necesites 32-64 GB o más de RAM del sistema.
- Licencias en una línea: Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image yWan2.1/2.2 son Apache 2.0 (uso comercial permitido); FLUX.1 Dev, FLUX.2 Dev y Klein 9B usan licencia no comercial de Black Forest Labs, que prohíbe usar el modelo en un producto o servicio comercial pero permite usar comercialmente las imágenes generadas. Las licencias cambian; la página del modelo enlaza la actual.
- Comprar una tarjeta de 32 GB para correr FLUX.2 Dev o LTX-2 para un proyecto de fin de semana rara vez vale la pena; si el modelo que quieres está en las filas de 24 GB+, rentar por hora o un plan en la nube suele ser más barato y rápido que hacer offloading en una tarjeta pequeña.
- Regla por mil millones de parámetros: 2 GB en BF16, 1 GB en FP8, unos 0.6 GB en Q4, más 2-5 GB para el codificador, VAE y latente.
- Para video, la resolución y duración del clip importan tanto como el modelo; la guía complementaria sobre VRAM para video IA lo explica.
Solución de problemas
CUDA out of memory en una tarjeta que la tabla dice que está bien
Por qué ocurre
Codificador de texto en precisión completa, una pila LoRA, ControlNet o alta resolución encima del modelo.
Cómo arreglarlo
Codificador FP8, un LoRA, resolución nativa, VAE en mosaicos; la guía CUDA out of memory tiene la versión larga.
La generación es muy lenta aunque nada falla
Por qué ocurre
Offloading automático a la RAM del sistema.
Cómo arreglarlo
Baja a la siguiente precisión (FP8 a Q6, Q6 a Q4) hasta que la memoria compartida de GPU quede cerca de cero.
FLUX.2 Dev "funciona" en 12 GB pero necesita 70 GB de RAM
Por qué ocurre
Pesos FP8 intercambiados desde la memoria del sistema.
Cómo arreglarlo
Usa Klein 4B/9B localmente y FLUX.2 Dev en la nube o una tarjeta de 32 GB.
No se nota diferencia entre FP8 y precisión completa, ¿por qué Q4 se ve borroso?
Por qué ocurre
Q4 pierde más detalle que FP8; debajo de Q4 la calidad baja rápido.
Cómo arreglarlo
Usa Q6 o Q8 cuando quepan; Q4 para borradores.
Confusión con la licencia en FLUX
Por qué ocurre
Schnell y Klein 4B son Apache 2.0; Dev, FLUX.2 Dev y Klein 9B son no comerciales.
Cómo arreglarlo
Revisa la columna de licencia y la ficha del modelo antes de usar un modelo en un producto.
AD

Las filas de 24 GB+, desde tu teléfono
PirateDiffusion aloja FLUX.2 Dev, Qwen-Image, Wan 2.2 14B y LTX-2 en hardware de servidor y los corre desde comandos en Telegram. Generación ilimitada por un precio fijo mensual; sin tarjeta, sin offloading, sin 70 GB de RAM.
Preguntas
¿Puedo correr Flux con 8 GB de VRAM?
Sí, con un archivo cuantizado. FLUX.1 en GGUF Q4 necesita unos 7 GB, y FLUX.2 Klein 4B en FP8 unos 8 GB. Espera generaciones más lentas que en una tarjeta de 12 o 16 GB. FLUX.1 en precisión completa necesita unos 24 GB.
¿12 GB son suficientes para SDXL?
Sí. SDXL cabe en 8 GB; 12 GB te dan espacio para LoRAs, ControlNet y escalado en el mismo flujo de trabajo.
¿Cuánta VRAM necesita Wan 2.2?
Depende de la versión. El modelo 5B corre en 8 GB como archivo GGUF y cómodamente en 24 GB. El modelo A14B oficialmente necesita 80 GB sin offloading, pero su versión FP8 corre bien en 24 GB y las versiones GGUF corren en 12-16 GB con offloading.
¿Importa la RAM del sistema?
Sí, cuando empiezas a hacer offloading. 32 GB es un mínimo sensato para Flux y Wan, y los modelos más grandes (FLUX.2 Dev en una tarjeta de 12 GB, por ejemplo) pueden usar 64 GB o más.
¿Qué modelos puedo usar comercialmente?
Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image y Wan 2.1/2.2 (Apache 2.0). FLUX.1 Dev, FLUX.2 Dev y Klein 9B son no comerciales para el modelo en sí, aunque las imágenes que generes pueden usarse comercialmente. Siempre revisa la ficha del modelo.
¿Hay un Wan más nuevo que pueda correr en casa?
No. Wan 2.2 es la versión más nueva con pesos descargables; Wan 2.5, 2.6, 2.7 y 3.0 son solo API.
Enlaces y fuentes
- Wan 2.2 A14B model card
- FLUX.2 Klein 9B licence
- ComfyUI GGUF loaders
- Flux family page
- FLUX.2 family page
- Qwen Image family page
- Z-Image family page
- Wan family page
- PirateDiffusion
- BitVector web app
Modelos de esta guía
Modelos Stable Diffusion 1.5
Modelos Stable Diffusion XL 1.0
Modelos Zimage
Modelos Flux
Modelos Flux 2 / Klein
Modelos Qwen
Modelos Wan
Modelos Hunyuan
Modelos Ltx2
Escrito por
P.I. Panda
Guías relacionadas

Modelos de vídeo
¿Cuánta VRAM necesitas para video AI? Wan 2.2, HunyuanVideo 1.5 y LTX-2 según tamaño de GPU (2026)
VRAM necesaria para ejecutar Wan 2.2, HunyuanVideo 1.5 y LTX-2 localmente, según tamaño de GPU, resolución y duración del clip: qué pueden hacer tarjetas de 8, 12-16, 24, 32 y 48+ GB, por qué el video cuesta cien veces más que una imagen, los trucos de descarga que permiten usar modelos 14B en 24 GB, tiempos realistas de generación y cuándo conviene alquilar en vez de comprar.
Por P.I. Panda
2026-10-06
Errores y soluciones
CUDA sin memoria: cuánto VRAM necesita cada modelo de IA y cómo ajustarlo
Una tabla de VRAM para SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 y HunyuanVideo, y las técnicas que hacen que un modelo quepa: cuantización fp8 y GGUF, descarga a CPU, VAE en mosaicos, límites de resolución y de fotogramas, y cuándo dejar de pelear y usarlo en la nube.
Por Captain
2026-05-18
Errores y soluciones
Guía de GPU y VRAM para imágenes y videos AI: qué necesita cada modelo y qué comprar (o no)
Cuánta memoria gráfica necesita realmente cada familia de modelos a una velocidad usable (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), qué te aporta la cuantización fp8 y GGUF, por qué la RAM del sistema y el disco también importan, una lista de tarjetas de 8 a 32 GB, notas sobre Mac y AMD, y el punto en que alquilar es más barato que comprar.
Por Quartermaster
2026-01-07
Modelos
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: qué familia de modelos usar en 2026
Una comparación práctica de las familias de modelos de imagen abiertos: seguimiento del prompt, realismo, anime e ilustración, renderizado de texto, velocidad, VRAM, ecosistema LoRA y licencia, con una recomendación para cada tipo de trabajo y hardware.
Por Captain
2026-05-22
Errores y soluciones
Errores de ComfyUI y cómo solucionarlos: nodos rojos, modelos faltantes, falta de memoria CUDA
Los mensajes de error de ComfyUI que la gente encuentra primero, qué significa cada uno y la solución que funciona: nodos personalizados faltantes (cajas rojas), "Prompt outputs failed validation", falta de memoria CUDA, tipo de modelo incorrecto en un cargador, errores de forma mat1 y mat2, deserialización de encabezado, incompatibilidades entre torch y xformers.
Por Captain
2026-05-12
Servicios en la nube
PirateDiffusion: ejecuta cualquier modelo desde Telegram, no se necesita GPU
Los comandos importantes en el bot de Telegram PirateDiffusion: /render con palabras clave de modelo, ponderación con (( )) y [[ ]], #recipes, /adetailer, escalado con /highdef y /facelift, /remix, /inpaint, flujos de trabajo ComfyUI con /wf /run:, y las nuevas habilidades // que eligen el modelo por ti.
Por Captain
2026-10-03
Aplicaciones
BitVector: Vector para Discord, Spyglass en la web y chat Prism
Cómo ejecutar modelos alojados y flujos de trabajo ComfyUI desde Discord con el bot Vector, desde cualquier navegador con Spyglass, y chateando con Prism: vinculación de cuenta, /ai render y /ai workflow, medios iniciales para imagen a imagen y imagen a video, habilidades y las soluciones para los errores más comunes.
Por Captain
2026-10-03
Más guías
Modelos
FLUX.1 Dev: cómo usar prompts, mejores ajustes e ideas creativas
Una guía práctica de FLUX.1 Dev de Black Forest Labs: cómo usar prompts en lenguaje natural, ajustes de guía y pasos, apilamiento de LoRA, renderizado de texto e ideas para aprovechar sus puntos fuertes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configuraciones y en qué sigue destacando
Cómo sacar el máximo provecho del modelo base oficial SDXL 1.0: resoluciones nativas, configuraciones de CFG y sampler, el refinador, prompts negativos e ideas para estilos donde SDXL todavía brilla.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: el modelo clásico, usado correctamente
Stable Diffusion 1.5 sigue siendo importante: la resolución adecuada, CFG y sampler, cómo usar su enorme biblioteca de LoRAs y embeddings, y ideas creativas para prompts adaptadas a un modelo de 512 píxeles.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: cómo usar el modelo más nuevo de Black Forest Labs
FLUX.2 Dev trae prompts más largos, mejor texto, realismo más fuerte y edición con múltiples referencias. Esta guía cubre el flujo turbo, ajustes de guía y resolución, estructura del prompt e ideas que aprovechan sus nuevas fortalezas.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts largos, texto perfecto y carteles bilingües
Qwen-Image es el modelo al que acudir cuando las palabras en la imagen importan. Aprende a escribir sus prompts largos y descriptivos, a renderizar texto en inglés y chino con precisión, a configurar CFG y pasos, y a explorar ideas creativas con mucho diseño.
Por Captain
2026-09-29
Modelos
SDXL-Lightning: generación en cuatro pasos en cualquier checkpoint SDXL
El LoRA SDXL-Lightning de ByteDance convierte un render SDXL de 30 pasos en uno de 4 pasos. Aprende cuántos pasos usar, el CFG que necesitas, el sampler y cómo combinarlo con tus checkpoints y LoRAs de estilo favoritos.
Por Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Todos los derechos reservados