Generación de video con IA para principiantes: de imagen a video, de texto a video y el primer clip con Wan, LTX-2 y H3
Tema: Modelos de vídeo
Por Lookout
Publicado el 2026-04-29
La primera semana con modelos de video abiertos: la diferencia entre texto a video y imagen a video y por qué empezar con este último, las tres familias de modelos que vale la pena aprender (Wan 2.2, LTX-2, MiniMax H3), conteos de cuadros y resoluciones que funcionan, cómo escribir un prompt de movimiento, qué esperar de una tarjeta de 16 o 24 GB frente a la nube, y cómo convertir clips de cinco segundos en algo más largo.
Resumen
Los modelos de video son modelos de imagen con un eje temporal: el mismo ciclo de denoising se aplica a un bloque de cuadros a la vez, así que todo lo que sabes sobre prompts, semillas y denoise se aplica igual, y también los costos, multiplicados por la cantidad de cuadros. Las consecuencias prácticas para un principiante son tres. Empieza con imagen a video (I2V), porque una buena imagen fija de un modelo de imagen fija la composición y el estilo, y deja que el modelo de video solo invente el movimiento. Mantén los clips cortos (unos cinco segundos), porque eso es para lo que entrenaron los modelos. Y espera usar los modelos grandes en la nube a menos que tengas una tarjeta de 24 GB.
Tres familias abiertas cubren la mayoría de las necesidades en 2026.
Wan 2.2
(Alibaba) es el todoterreno: un modelo de 5B que corre en 12-16 GB y un modelo de dos expertos de 14B con la mejor calidad abierta, además de un enorme ecosistema de
LoRA
para movimiento y estilo.
LTX-2
(Lightricks) es rápido y genera audio sincronizado pero necesita 24-32 GB.
MiniMax H3
es el modelo audio-video con diálogo y efectos de sonido, usado mayormente a través de flujos de trabajo alojados; las guías de prompting H3 de Mark White en este sitio profundizan en ello.
Hunyuan
Video 1.5 es una alternativa más ligera a
Wan
14B.
El catálogo lista cada modelo de video y sus LoRAs con la base y tamaño a los que apuntan (5B o 14B, experto de alto o bajo ruido), y las páginas de modelos muestran clips de ejemplo con sus prompts. El botón Run abre el modelo en
PirateDiffusion
, donde un comando de workflow produce el clip a partir de una respuesta a tu imagen, o en
BitVector
.
Referencia
Nombre | Tipo | Qué es |
|---|---|---|
I2V (image to video) | mode | Animar una imagen fija. Mejor modo para empezar: la composición ya está bien; el prompt describe solo el movimiento. |
T2V (text to video) | mode | Solo a partir de un prompt. Más variedad, menos control; úsalo para ideas y B-roll. |
FLF2V / first-last frame | mode | Dos fotogramas clave; el modelo llena el movimiento entre ellos. Transiciones controladas. |
Frames and fps | setting | Wan: 81 cuadros a 16 fps (5 s); LTX-2: 97-121 cuadros a 24-25 fps; H3: 145 cuadros a ~24 fps. La memoria escala con los cuadros. |
Resolution | setting | Wan 2.2: 832x480 o 480x832 (rápido), 1280x720 (24 GB+); LTX-2 hasta 1080p+ con 32 GB. Retrato para personas, paisaje para escenas. |
Motion prompt | prompt | Un movimiento del sujeto más uno de cámara: "ella se gira hacia la ventana y sonríe; acercamiento lento". Evita listar detalles de la escena que ya están en la imagen. |
Steps / CFG / shift | setting | Wan 2.2 14B: 20 pasos divididos 10/10 entre expertos, CFG 3.5, shift 5; 5B: 20-30 pasos, CFG 5; LTX-2: 25-30 pasos con su propio calendario; LoRAs destiladas (lightx2v) llevan a Wan a 4-8 pasos con CFG 1. |
Motion LoRAs | file | Movimientos de cámara, bailes, gestos, física; adaptados a 5B/14B y al experto. Las páginas aquí nombran el objetivo. |
Interpolation and upscale | post | RIFE o FILM a 32-60 fps; ESRGAN cuadro a cuadro o SeedVR para resolución. |
AD

Tu primer clip sin GPU
BitVector Prism anima una imagen fija con los modelos Wan de esta guía en el navegador: sube la imagen, escribe la frase de movimiento, descarga el clip. Nada que instalar, funciona desde una laptop.
Paso a paso
- Haz o elige una imagen fija: un render 1024x1024 o 832x1216 con un sujeto claro y fondo simple. Las caras más grandes que una décima parte del cuadro animan mejor.
- Abre una página del modelo Wan 2.2 I2V en este sitio, copia el patrón de prompt de movimiento de ejemplo y presiona el botón Run (PirateDiffusion: responde a tu imagen con el comando /workflow; BitVector: sube y elige el modelo).
- Escribe un prompt de movimiento con una frase para el sujeto y una para la cámara. Nada sobre ropa, colores o iluminación; la imagen ya tiene eso.
- Genera a 832x480 (paisaje) o 480x832 (retrato), 81 cuadros, pasos por defecto. Mira todo el clip; juzga el movimiento, no la nitidez.
- Itera solo en el prompt de movimiento: verbos más lentos ("lentamente", "suavemente") reducen movimientos bruscos; una sola instrucción de cámara evita saltos.
- Localmente, con una tarjeta de 16 GB: Wan 2.2 5B fp8 o GGUF, 832x480, 49-81 cuadros, codificador de texto en CPU. Con 24 GB: 14B fp8 a 480p, 720p con el codificador descargado. Mira la guía deVRAMpara video AI.
- Piezas más largas: toma el último cuadro del clip uno como imagen inicial del clip dos con un prompt de movimiento continuo; une en un editor; interpola a 30 fps y escala al final.
- Agrega sonido: LTX-2 y H3 generan audio con el clip; para Wan, añade música o efectos en el editor.
Ejemplos
Prompt de movimiento para I2V
Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text
Comando workflow de PirateDiffusion
/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)
ComfyUI Wan 2.2 5B en 16 GB
UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)
Consejos
- Los verbos de movimiento importan más que los adjetivos: "gira, camina, levanta, vierte, saluda" producen movimientos distintos y confiables; "hermoso cinematográfico" no produce nada.
- Un movimiento de cámara por clip: acercamiento, alejamiento, paneo a la izquierda, órbita. Dos movimientos causan un temblor.
- Las imágenes en retrato animan mejor las caras; las en paisaje animan mejor los ambientes.
- Las LoRAs Wan para el experto de alto ruido moldean el movimiento; las de bajo ruido moldean el detalle. Muchos paquetes traen ambos; carga cada una en su experto.
- Las LoRAs destiladas (lightx2v, FastWan) reducen Wan de 20 pasos a 4-6 con CFG 1 sin mucha pérdida de calidad; las páginas de modelos las listan.
- Espera 3-10 minutos por clip en una 4090 para Wan 14B y unos 90 segundos para LTX-2; la nube devuelve la mayoría de clips en uno o dos minutos.
Solución de problemas
El clip es una imagen fija con un ligero parpadeo
Por qué ocurre
No hay verbo de movimiento en el prompt, o el peso de un LoRA está muy alto y es estático.
Cómo arreglarlo
Agrega un movimiento del sujeto y uno de cámara; baja los LoRAs a 0.7.
La cara se derrite o cambia de identidad
Por qué ocurre
Cara demasiado pequeña, demasiados cuadros, o 480p en una cara detallada.
Cómo arreglarlo
Recorta más cerca, 49-61 cuadros, o 720p en la nube; un pase de detalle facial por cuadro es último recurso.
Saltos de cámara o cortes en la escena
Por qué ocurre
Dos instrucciones de cámara, o palabras "cut to" en el prompt.
Cómo arreglarlo
Un movimiento de cámara; pon "jump cut" en lo negativo.
Falta de memoria a 720p
Por qué ocurre
Cuadros por resolución exceden la VRAM.
Cómo arreglarlo
Baja a 480p o menos cuadros, descarga el codificador de texto; mira la guía de VRAM para video AI.
La LoRA de movimiento no hace nada
Por qué ocurre
Cargado en el experto equivocado o tamaño de modelo incorrecto.
Cómo arreglarlo
Revisa la página del modelo para 5B/14B y alto/bajo ruido; carga según su palabra clave.
AD

Wan 2.2 14B, LTX-2 y H3 desde Telegram
PirateDiffusion ejecuta los modelos grandes de video en GPUs de servidor: responde a cualquier imagen con un comando workflow y el clip vuelve en el chat. Generación ilimitada a precio fijo, no necesitas tarjeta de 24 GB.
Preguntas
¿Qué modelo de video usar primero?
Wan 2.2 I2V: perdona errores, bien documentado, con más LoRAs. La guía de inicio de Wan tiene toda la configuración.
¿Puedo hacerlo con una tarjeta de 8 GB?
Clips cortos 480p con
Wan 2.1
1.3B o Wan 2.2 5B GGUF, despacio. Realísticamente, empieza en la nube.
¿Cómo consigo sonido?
LTX-2 y MiniMax H3 generan audio sincronizado; las guías de prompting H3 de Mark White explican prompts para diálogo y efectos.
¿Cuánto puede durar un clip?
Unos cinco segundos nativamente. Piezas más largas son clips encadenados; la calidad baja después de seis a ocho segundos en una sola pasada.
¿Los modelos comerciales más nuevos (Veo, Kling, Wan 3.0) están disponibles localmente?
No; son solo por API. Todo en esta guía es de peso abierto y corre localmente o en socios en la nube.
Enlaces y fuentes
- Wan 2.2 repository
- LTX-2 (Lightricks)
- Wan family page
- LTX-2 family page
- MiniMax H3 family page
- PirateDiffusion
- BitVector web app
Modelos de esta guía
Escrito por
Lookout
Guías relacionadas
Modelos de vídeo
Wan 2.2 video: configuración, ajustes y LoRAs para texto a video y imagen a video
Primeros resultados con Wan 2.2: qué tamaño de modelo elegir (5B o 14B), el par de expertos de alto ruido / bajo ruido, resoluciones y cantidad de cuadros que funcionan, los LoRAs lightning que reducen renders a cuatro pasos, estructura del prompt para movimiento y cómo usarlo en hosting cuando la tarjeta es pequeña.
Por Captain
2026-05-24

Modelos de vídeo
¿Cuánta VRAM necesitas para video AI? Wan 2.2, HunyuanVideo 1.5 y LTX-2 según tamaño de GPU (2026)
VRAM necesaria para ejecutar Wan 2.2, HunyuanVideo 1.5 y LTX-2 localmente, según tamaño de GPU, resolución y duración del clip: qué pueden hacer tarjetas de 8, 12-16, 24, 32 y 48+ GB, por qué el video cuesta cien veces más que una imagen, los trucos de descarga que permiten usar modelos 14B en 24 GB, tiempos realistas de generación y cuándo conviene alquilar en vez de comprar.
Por P.I. Panda
2026-10-06
Prompting
MiniMax H3 para prompts: texto a video, imagen a video, video de referencia y audio
Cómo dirigir MiniMax H3 desde un comando de chat: la receta QUIÉN + DÓNDE + ACCIÓN + CÁMARA + SONIDO para texto a video, animar una imagen fija con imagen a video, darle a cada foto de referencia un papel en modo referencia y obtener diálogos claros en vez de murmullos. Con prompts para copiar y probar y el PDF del autor.
Por Mark White
2026-09-20
Modelos de vídeo
Prompts de video MiniMax H3: la estructura oficial
Cómo MiniMax quiere que se escriba un prompt H3: la línea de alineación para videos anclados a imágenes, los tres campos principales, planos y cortes, movimientos de cámara, IDs de hablantes y etiquetas de diálogo, el paisaje sonoro y la música. Resumido de la guía oficial para escribir prompts.
Por Captain
2026-09-14
Modelos
LTX 2.3 Crisp Enhance: detalle de video más nítido y cinematográfico
El LoRA Crisp Enhance de vrgamedevgirl para LTX 2.3 aumenta la nitidez, el microdetalle y el contraste en videos generados. Aprende a equilibrarlo con su contraparte Soft Enhance, los pesos y algunas ideas para prompts.
Por Captain
2026-10-03
Errores y soluciones
Guía de GPU y VRAM para imágenes y videos AI: qué necesita cada modelo y qué comprar (o no)
Cuánta memoria gráfica necesita realmente cada familia de modelos a una velocidad usable (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), qué te aporta la cuantización fp8 y GGUF, por qué la RAM del sistema y el disco también importan, una lista de tarjetas de 8 a 32 GB, notas sobre Mac y AMD, y el punto en que alquilar es más barato que comprar.
Por Quartermaster
2026-01-07
Más guías
Modelos
FLUX.1 Dev: cómo usar prompts, mejores ajustes e ideas creativas
Una guía práctica de FLUX.1 Dev de Black Forest Labs: cómo usar prompts en lenguaje natural, ajustes de guía y pasos, apilamiento de LoRA, renderizado de texto e ideas para aprovechar sus puntos fuertes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configuraciones y en qué sigue destacando
Cómo sacar el máximo provecho del modelo base oficial SDXL 1.0: resoluciones nativas, configuraciones de CFG y sampler, el refinador, prompts negativos e ideas para estilos donde SDXL todavía brilla.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: el modelo clásico, usado correctamente
Stable Diffusion 1.5 sigue siendo importante: la resolución adecuada, CFG y sampler, cómo usar su enorme biblioteca de LoRAs y embeddings, y ideas creativas para prompts adaptadas a un modelo de 512 píxeles.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: cómo usar el modelo más nuevo de Black Forest Labs
FLUX.2 Dev trae prompts más largos, mejor texto, realismo más fuerte y edición con múltiples referencias. Esta guía cubre el flujo turbo, ajustes de guía y resolución, estructura del prompt e ideas que aprovechan sus nuevas fortalezas.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts largos, texto perfecto y carteles bilingües
Qwen-Image es el modelo al que acudir cuando las palabras en la imagen importan. Aprende a escribir sus prompts largos y descriptivos, a renderizar texto en inglés y chino con precisión, a configurar CFG y pasos, y a explorar ideas creativas con mucho diseño.
Por Captain
2026-09-29
Modelos
SDXL-Lightning: generación en cuatro pasos en cualquier checkpoint SDXL
El LoRA SDXL-Lightning de ByteDance convierte un render SDXL de 30 pasos en uno de 4 pasos. Aprende cuántos pasos usar, el CFG que necesitas, el sampler y cómo combinarlo con tus checkpoints y LoRAs de estilo favoritos.
Por Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Hecho en Japón
|
© 2026