Wan 2.2 video: configuración, ajustes y LoRAs para texto a video y imagen a video
Tema: Modelos de vídeo
Por Captain
Publicado el 2026-05-24
Primeros resultados con Wan 2.2: qué tamaño de modelo elegir (5B o 14B), el par de expertos de alto ruido / bajo ruido, resoluciones y cantidad de cuadros que funcionan, los LoRAs lightning que reducen renders a cuatro pasos, estructura del prompt para movimiento y cómo usarlo en hosting cuando la tarjeta es pequeña.
Resumen
Wan 2.2
es la familia de video abierta de Alibaba y el modelo de video más descargado en este sitio. Viene como un modelo híbrido de texto e imagen a video de 5B diseñado para tarjetas de consumidor (720p en 8 a 12 GB), y como modelos de texto a video e imagen a video de 14B que usan dos expertos: un modelo de alto ruido que define el movimiento y la composición en los primeros pasos y un modelo de bajo ruido que añade detalle en los últimos pasos. El par de 14B produce los resultados cinematográficos que la gente comparte; el modelo de 5B es el ideal para aprender.
La comunidad ha entrenado cientos de
LoRAs
para
Wan
: movimientos de cámara (órbita, dolly, zoom rápido), estilos de movimiento, personajes, efectos y los LoRAs lightning / de destilación que reducen renders de 30 pasos a 4 a 8 pasos con poca pérdida. La página de la familia Wan los ordena por popularidad; los LoRAs lightning casi siempre están arriba.
Las opciones en hosting son ideales para video porque los renders son largos y consumen mucha
VRAM
:
PirateDiffusion
ejecuta flujos de trabajo Wan desde Telegram con /wf /run, y
BitVector
mantiene los gráficos Wan preinstalados con los LoRAs listos. Ambos están enlazados en el recuadro de ejecución de cada página de modelo Wan.
Referencia
Nombre | Tipo | Qué es |
|---|---|---|
Wan2.2-TI2V-5B | model | Un modelo para texto e imagen a video, 720p a 24 fps, máximo 121 cuadros. fp16 10 GB, fp8 5 GB. Tarjetas de 8 a 12 GB. |
Wan2.2-T2V-A14B / I2V-A14B | model pair | Expertos de alto ruido y bajo ruido, 14B cada uno (27B total, 14B activos). 480p y 720p. fp8 unos 14 GB cada uno; GGUF Q4 unos 8 GB cada uno. |
umt5-xxl text encoder | file | fp8 escalado (6 GB) o fp16 (11 GB). Compartido por todos los modelos Wan. |
Wan 2.1 / 2.2 VAE | file | El modelo 5B usa el VAE 2.2; los modelos 14B usan el VAE 2.1. Mezclarlos da basura. |
Resolution | setting | 480x832 o 832x480 para pruebas rápidas; 720x1280 / 1280x720 para finales. Múltiplos de 16. |
Frames | setting | 4n+1: 33, 49, 65, 81. 81 cuadros a 16 fps son cinco segundos. |
Steps / shift / CFG | setting | 20 a 30 pasos, shift 5 a 8, CFG 3.5 a 5 sin lightning. Con LoRAs lightning: 4 a 8 pasos, CFG 1, shift 5. |
Lightning / distill LoRA | LoRA | LoRAs separados para los expertos de alto ruido y bajo ruido; cargar cada uno en su modelo. Peso 1.0. |
Prompt | text | Sujeto, acción, cámara, iluminación, estilo, en ese orden. Describe los verbos de movimiento explícitamente. Wan usa prompt negativo (a diferencia de Flux ). |
AD

Sin instalación: ejecuta modelos de IA en la nube
BitVector Prism es la forma más fácil de empezar: elige un modelo, escribe un prompt y genera en una aplicación web limpia, sin configurar nada. BitVector también está disponible en Discord y en la web (SpyGlass).
Paso a paso
- Instala los cargadores:ComfyUIcore soporta Wan 2.2; añade ComfyUI-GGUF para archivos cuantizados. Actualiza ComfyUI primero.
- Descarga según tu tarjeta: 5B fp8 más el VAE 2.2 y umt5 fp8 en 8 a 12 GB; el par 14B fp8 más el VAE 2.1 en 24 GB; el par 14B GGUF Q4 en 12 a 16 GB.
- Carga la plantilla oficial (Workflow > Browse Templates > Video > Wan 2.2) y reemplaza los cargadores con tus archivos. Para GGUF cambia Load Diffusion Model por Unet Loader (GGUF).
- Para 14B: dos nodos KSampler Advanced. El primero ejecuta el modelo de alto ruido de pasos 0 a N/2 (devuelve con ruido sobrante), el segundo ejecuta el modelo de bajo ruido de N/2 a N. La plantilla ya conecta esto.
- Primer render: 480x832, 33 cuadros, 20 pasos, CFG 4, shift 8, prompt "a corgi runs along a beach at sunset, camera tracks alongside, golden light, shallow depth of field". Espera de 2 a 6 minutos.
- Añade los LoRAs lightning desde la página de la familia Wan (uno para cada experto), pon pasos a 6 (3 + 3), CFG 1. Los renders bajan a menos de un minuto a 480p.
- Imagen a video: carga el par I2V, alimenta la imagen en WanImageToVideo, mantén el prompt sobre movimiento y cámara en vez de describir la imagen.
- Finales: 720p, 81 cuadros, interpola a 32 fps con RIFE o FILM, mejora con un escalador de video de la familiaUpscalerssi hace falta.
- Muy lento o muy grande: ejecuta el mismo flujo en BitVector, o en PirateDiffusion con /workflow /show:wan para ver los campos y /wf /run:wan tu prompt.
Ejemplos
Prompt de texto a video
A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image
Prompt de imagen a video (solo movimiento)
The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight
PirateDiffusion
/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in
Consejos
- Describe el movimiento con verbos y la cámara con términos de cine (dolly lento hacia adentro, cámara en mano, plano amplio estático). Wan sigue el lenguaje de cámara muy bien.
- Mantén el prompt negativo: el oficial lista sobreexposición, estático, detalles borrosos, subtítulos, peor calidad, dedos extra, y ayuda bastante.
- La cantidad de cuadros cuesta más que la resolución: 81 cuadros a 480p es más barato que 49 cuadros a 720p.
- Los LoRAs de movimiento para Wan están etiquetados según el experto al que apuntan; un LoRA solo de bajo ruido añade detalle, un LoRA de alto ruido cambia el movimiento.
- La semilla importa mucho en video; mantenla fija mientras ajustas el prompt, luego cámbiala para diferentes tomas.
- Guarda el flujo de trabajo con tu conjunto de LoRAs como plantilla; los gráficos Wan son largos y fáciles de romper.
Solución de problemas
Falta de memoria en el primer sampler
Por qué ocurre
Pesos fp16 14B en una tarjeta de 24 GB o menos.
Cómo arreglarlo
Par fp8 o GGUF Q4, menos cuadros, 480p, --lowvram; o el modelo 5B.
Video borroso o con ruido de color
Por qué ocurre
VAE incorrecto (2.2 VAE con 14B o 2.1 VAE con 5B), o LoRA lightning sin CFG 1.
Cómo arreglarlo
Usa el VAE que corresponde al modelo; con LoRAs lightning pon CFG 1 y 4 a 8 pasos.
Casi sin movimiento
Por qué ocurre
El prompt describe una escena, no una acción; o pocos pasos en el experto de alto ruido.
Cómo arreglarlo
Añade verbos de movimiento y movimientos de cámara; da la mitad de pasos al experto de alto ruido.
El sujeto cambia a mitad del video
Por qué ocurre
Demasiados cuadros para la resolución, o dos LoRAs en conflicto.
Cómo arreglarlo
Reduce a 49 cuadros, usa un LoRA de movimiento a la vez, sube pasos en el experto de bajo ruido.
Falla la decodificación tras muestrear con éxito
Por qué ocurre
La decodificación del VAE es el pico de memoria para video.
Cómo arreglarlo
Decodifica el VAE Wan en mosaicos (opción tiled en el nodo decode), o usa menos cuadros.
Advertencias de clave LoRA no cargada
Por qué ocurre
Un LoRA 2.1 en 2.2, o un LoRA 14B en el modelo 5B.
Cómo arreglarlo
Coincide versión y tamaño; la página del modelo los nombra.
AD

Sin instalación: ejecuta modelos de IA en la nube
PirateDiffusion es solo para Telegram y está pensado para profesionales: miles de modelos, LoRAs y workflows mediante comandos de chat, con generación ilimitada a precio fijo.
Preguntas
¿5B o 14B?
5B para aprender y para tarjetas de 8 a 12 GB; 14B para calidad si tienes 24 GB o usas hosting. Ambos usan los mismos prompts.
¿Cuánto dura un clip?
Hasta 81 cuadros (5 s a 16 fps) para 14B y 121 cuadros (5 s a 24 fps) para 5B por render; videos más largos se unen con continuaciones del último cuadro.
¿Wan genera audio?
Wan 2.2 S2V
anima
un hablante desde audio pero no genera sonido;
LTX-2
y
MiniMax H3
generan audio con el video (sus guías están en este sitio).
¿De dónde salen los LoRAs lightning?
Lanzamientos de destilación por Lightx2v y otros; la página de la familia Wan los lista con puntuaciones de popularidad y el experto al que apuntan.
¿Puedo usar Wan sin GPU?
Sí: PirateDiffusion desde Telegram, BitVector en el navegador. Ambos mantienen los flujos y LoRAs instalados.
Enlaces y fuentes
- Wan 2.2 on GitHub
- Wan 2.2 weights on Hugging Face
- ComfyUI Wan 2.2 examples
- Wan family page
- Hosted Wan workflows on PirateDiffusion
- BitVector
Modelos de esta guía
Escrito por
Captain
Guías relacionadas
Errores y soluciones
CUDA sin memoria: cuánto VRAM necesita cada modelo de IA y cómo ajustarlo
Una tabla de VRAM para SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 y HunyuanVideo, y las técnicas que hacen que un modelo quepa: cuantización fp8 y GGUF, descarga a CPU, VAE en mosaicos, límites de resolución y de fotogramas, y cuándo dejar de pelear y usarlo en la nube.
Por Captain
2026-05-18
Errores y soluciones
Errores de ComfyUI y cómo solucionarlos: nodos rojos, modelos faltantes, falta de memoria CUDA
Los mensajes de error de ComfyUI que la gente encuentra primero, qué significa cada uno y la solución que funciona: nodos personalizados faltantes (cajas rojas), "Prompt outputs failed validation", falta de memoria CUDA, tipo de modelo incorrecto en un cargador, errores de forma mat1 y mat2, deserialización de encabezado, incompatibilidades entre torch y xformers.
Por Captain
2026-05-12
Modelos de vídeo
Prompts de video MiniMax H3: la estructura oficial
Cómo MiniMax quiere que se escriba un prompt H3: la línea de alineación para videos anclados a imágenes, los tres campos principales, planos y cortes, movimientos de cámara, IDs de hablantes y etiquetas de diálogo, el paisaje sonoro y la música. Resumido de la guía oficial para escribir prompts.
Por Captain
2026-09-14
Modelos
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: qué familia de modelos usar en 2026
Una comparación práctica de las familias de modelos de imagen abiertos: seguimiento del prompt, realismo, anime e ilustración, renderizado de texto, velocidad, VRAM, ecosistema LoRA y licencia, con una recomendación para cada tipo de trabajo y hardware.
Por Captain
2026-05-22
Más guías
Modelos
FLUX.1 Dev: cómo usar prompts, mejores ajustes e ideas creativas
Una guía práctica de FLUX.1 Dev de Black Forest Labs: cómo usar prompts en lenguaje natural, ajustes de guía y pasos, apilamiento de LoRA, renderizado de texto e ideas para aprovechar sus puntos fuertes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configuraciones y en qué sigue destacando
Cómo sacar el máximo provecho del modelo base oficial SDXL 1.0: resoluciones nativas, configuraciones de CFG y sampler, el refinador, prompts negativos e ideas para estilos donde SDXL todavía brilla.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: el modelo clásico, usado correctamente
Stable Diffusion 1.5 sigue siendo importante: la resolución adecuada, CFG y sampler, cómo usar su enorme biblioteca de LoRAs y embeddings, y ideas creativas para prompts adaptadas a un modelo de 512 píxeles.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: cómo usar el modelo más nuevo de Black Forest Labs
FLUX.2 Dev trae prompts más largos, mejor texto, realismo más fuerte y edición con múltiples referencias. Esta guía cubre el flujo turbo, ajustes de guía y resolución, estructura del prompt e ideas que aprovechan sus nuevas fortalezas.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts largos, texto perfecto y carteles bilingües
Qwen-Image es el modelo al que acudir cuando las palabras en la imagen importan. Aprende a escribir sus prompts largos y descriptivos, a renderizar texto en inglés y chino con precisión, a configurar CFG y pasos, y a explorar ideas creativas con mucho diseño.
Por Captain
2026-09-29
Modelos
SDXL-Lightning: generación en cuatro pasos en cualquier checkpoint SDXL
El LoRA SDXL-Lightning de ByteDance convierte un render SDXL de 30 pasos en uno de 4 pasos. Aprende cuántos pasos usar, el CFG que necesitas, el sampler y cómo combinarlo con tus checkpoints y LoRAs de estilo favoritos.
Por Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Hecho en Japón
|
© 2026