Model
Trends
.ai
Model
Trends
.ai
los mejores modelos de IA de código abierto

Generación de video con IA para principiantes: de imagen a video, de texto a video y el primer clip con Wan, LTX-2 y H3

Tema: Modelos de vídeo
Por Lookout
Publicado el 2026-04-29
La primera semana con modelos de video abiertos: la diferencia entre texto a video y imagen a video y por qué empezar con este último, las tres familias de modelos que vale la pena aprender (Wan 2.2, LTX-2, MiniMax H3), conteos de cuadros y resoluciones que funcionan, cómo escribir un prompt de movimiento, qué esperar de una tarjeta de 16 o 24 GB frente a la nube, y cómo convertir clips de cinco segundos en algo más largo.

Resumen

Los modelos de video son modelos de imagen con un eje temporal: el mismo ciclo de denoising se aplica a un bloque de cuadros a la vez, así que todo lo que sabes sobre prompts, semillas y denoise se aplica igual, y también los costos, multiplicados por la cantidad de cuadros. Las consecuencias prácticas para un principiante son tres. Empieza con imagen a video (I2V), porque una buena imagen fija de un modelo de imagen fija la composición y el estilo, y deja que el modelo de video solo invente el movimiento. Mantén los clips cortos (unos cinco segundos), porque eso es para lo que entrenaron los modelos. Y espera usar los modelos grandes en la nube a menos que tengas una tarjeta de 24 GB.
Tres familias abiertas cubren la mayoría de las necesidades en 2026.
Wan 2.2
(Alibaba) es el todoterreno: un modelo de 5B que corre en 12-16 GB y un modelo de dos expertos de 14B con la mejor calidad abierta, además de un enorme ecosistema de
LoRA
para movimiento y estilo.
LTX-2
(Lightricks) es rápido y genera audio sincronizado pero necesita 24-32 GB.
MiniMax H3
es el modelo audio-video con diálogo y efectos de sonido, usado mayormente a través de flujos de trabajo alojados; las guías de prompting H3 de Mark White en este sitio profundizan en ello.
Hunyuan
Video 1.5 es una alternativa más ligera a
Wan
14B.
El catálogo lista cada modelo de video y sus LoRAs con la base y tamaño a los que apuntan (5B o 14B, experto de alto o bajo ruido), y las páginas de modelos muestran clips de ejemplo con sus prompts. El botón Run abre el modelo en
PirateDiffusion
, donde un comando de workflow produce el clip a partir de una respuesta a tu imagen, o en
BitVector
.

Referencia

Nombre
Tipo
Qué es
I2V (image to video)
mode
Animar una imagen fija. Mejor modo para empezar: la composición ya está bien; el prompt describe solo el movimiento.
T2V (text to video)
mode
Solo a partir de un prompt. Más variedad, menos control; úsalo para ideas y B-roll.
FLF2V / first-last frame
mode
Dos fotogramas clave; el modelo llena el movimiento entre ellos. Transiciones controladas.
Frames and fps
setting
Wan: 81 cuadros a 16 fps (5 s); LTX-2: 97-121 cuadros a 24-25 fps; H3: 145 cuadros a ~24 fps. La memoria escala con los cuadros.
Resolution
setting
Wan 2.2: 832x480 o 480x832 (rápido), 1280x720 (24 GB+); LTX-2 hasta 1080p+ con 32 GB. Retrato para personas, paisaje para escenas.
Motion prompt
prompt
Un movimiento del sujeto más uno de cámara: "ella se gira hacia la ventana y sonríe; acercamiento lento". Evita listar detalles de la escena que ya están en la imagen.
Steps / CFG / shift
setting
Wan 2.2 14B: 20 pasos divididos 10/10 entre expertos,
CFG
3.5, shift 5; 5B: 20-30 pasos, CFG 5; LTX-2: 25-30 pasos con su propio calendario; LoRAs destiladas (lightx2v) llevan a Wan a 4-8 pasos con CFG 1.
Motion LoRAs
file
Movimientos de cámara, bailes, gestos, física; adaptados a 5B/14B y al experto. Las páginas aquí nombran el objetivo.
Interpolation and upscale
post
RIFE o FILM a 32-60 fps; ESRGAN cuadro a cuadro o SeedVR para resolución.
AD
Tu primer clip sin GPU
BitVector Prism anima una imagen fija con los modelos Wan de esta guía en el navegador: sube la imagen, escribe la frase de movimiento, descarga el clip. Nada que instalar, funciona desde una laptop.

Paso a paso

  1. Haz o elige una imagen fija: un render 1024x1024 o 832x1216 con un sujeto claro y fondo simple. Las caras más grandes que una décima parte del cuadro animan mejor.
  2. Abre una página del modelo Wan 2.2 I2V en este sitio, copia el patrón de prompt de movimiento de ejemplo y presiona el botón Run (PirateDiffusion: responde a tu imagen con el comando /workflow; BitVector: sube y elige el modelo).
  3. Escribe un prompt de movimiento con una frase para el sujeto y una para la cámara. Nada sobre ropa, colores o iluminación; la imagen ya tiene eso.
  4. Genera a 832x480 (paisaje) o 480x832 (retrato), 81 cuadros, pasos por defecto. Mira todo el clip; juzga el movimiento, no la nitidez.
  5. Itera solo en el prompt de movimiento: verbos más lentos ("lentamente", "suavemente") reducen movimientos bruscos; una sola instrucción de cámara evita saltos.
  6. Localmente, con una tarjeta de 16 GB: Wan 2.2 5B fp8 o GGUF, 832x480, 49-81 cuadros, codificador de texto en CPU. Con 24 GB: 14B fp8 a 480p, 720p con el codificador descargado. Mira la guía de
    VRAM
    para video AI.
  7. Piezas más largas: toma el último cuadro del clip uno como imagen inicial del clip dos con un prompt de movimiento continuo; une en un editor; interpola a 30 fps y escala al final.
  8. Agrega sonido: LTX-2 y H3 generan audio con el clip; para Wan, añade música o efectos en el editor.

Ejemplos

Prompt de movimiento para I2V

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

Comando workflow de PirateDiffusion

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B en 16 GB

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

Consejos

  • Los verbos de movimiento importan más que los adjetivos: "gira, camina, levanta, vierte, saluda" producen movimientos distintos y confiables; "hermoso cinematográfico" no produce nada.
  • Un movimiento de cámara por clip: acercamiento, alejamiento, paneo a la izquierda, órbita. Dos movimientos causan un temblor.
  • Las imágenes en retrato animan mejor las caras; las en paisaje animan mejor los ambientes.
  • Las LoRAs Wan para el experto de alto ruido moldean el movimiento; las de bajo ruido moldean el detalle. Muchos paquetes traen ambos; carga cada una en su experto.
  • Las LoRAs destiladas (lightx2v, FastWan) reducen Wan de 20 pasos a 4-6 con CFG 1 sin mucha pérdida de calidad; las páginas de modelos las listan.
  • Espera 3-10 minutos por clip en una 4090 para Wan 14B y unos 90 segundos para LTX-2; la nube devuelve la mayoría de clips en uno o dos minutos.

Solución de problemas

El clip es una imagen fija con un ligero parpadeo

Por qué ocurre
No hay verbo de movimiento en el prompt, o el peso de un LoRA está muy alto y es estático.

Cómo arreglarlo
Agrega un movimiento del sujeto y uno de cámara; baja los LoRAs a 0.7.

La cara se derrite o cambia de identidad

Por qué ocurre
Cara demasiado pequeña, demasiados cuadros, o 480p en una cara detallada.

Cómo arreglarlo
Recorta más cerca, 49-61 cuadros, o 720p en la nube; un pase de detalle facial por cuadro es último recurso.

Saltos de cámara o cortes en la escena

Por qué ocurre
Dos instrucciones de cámara, o palabras "cut to" en el prompt.

Cómo arreglarlo
Un movimiento de cámara; pon "jump cut" en lo negativo.

Falta de memoria a 720p

Por qué ocurre
Cuadros por resolución exceden la VRAM.

Cómo arreglarlo
Baja a 480p o menos cuadros, descarga el codificador de texto; mira la guía de VRAM para video AI.

La LoRA de movimiento no hace nada

Por qué ocurre
Cargado en el experto equivocado o tamaño de modelo incorrecto.

Cómo arreglarlo
Revisa la página del modelo para 5B/14B y alto/bajo ruido; carga según su palabra clave.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 y H3 desde Telegram
PirateDiffusion ejecuta los modelos grandes de video en GPUs de servidor: responde a cualquier imagen con un comando workflow y el clip vuelve en el chat. Generación ilimitada a precio fijo, no necesitas tarjeta de 24 GB.

Preguntas

¿Qué modelo de video usar primero?

Wan 2.2 I2V: perdona errores, bien documentado, con más LoRAs. La guía de inicio de Wan tiene toda la configuración.

¿Puedo hacerlo con una tarjeta de 8 GB?

Clips cortos 480p con
Wan 2.1
1.3B o Wan 2.2 5B GGUF, despacio. Realísticamente, empieza en la nube.

¿Cómo consigo sonido?

LTX-2 y MiniMax H3 generan audio sincronizado; las guías de prompting H3 de Mark White explican prompts para diálogo y efectos.

¿Cuánto puede durar un clip?

Unos cinco segundos nativamente. Piezas más largas son clips encadenados; la calidad baja después de seis a ocho segundos en una sola pasada.

¿Los modelos comerciales más nuevos (Veo, Kling, Wan 3.0) están disponibles localmente?

No; son solo por API. Todo en esta guía es de peso abierto y corre localmente o en socios en la nube.

Enlaces y fuentes

Modelos de esta guía

Escrito por
Lookout

Guías relacionadas

Modelos de vídeo
Wan 2.2 video: configuración, ajustes y LoRAs para texto a video y imagen a video
Primeros resultados con Wan 2.2: qué tamaño de modelo elegir (5B o 14B), el par de expertos de alto ruido / bajo ruido, resoluciones y cantidad de cuadros que funcionan, los LoRAs lightning que reducen renders a cuatro pasos, estructura del prompt para movimiento y cómo usarlo en hosting cuando la tarjeta es pequeña.
Por Captain
2026-05-24
Modelos de vídeo
¿Cuánta VRAM necesitas para video AI? Wan 2.2, HunyuanVideo 1.5 y LTX-2 según tamaño de GPU (2026)
VRAM necesaria para ejecutar Wan 2.2, HunyuanVideo 1.5 y LTX-2 localmente, según tamaño de GPU, resolución y duración del clip: qué pueden hacer tarjetas de 8, 12-16, 24, 32 y 48+ GB, por qué el video cuesta cien veces más que una imagen, los trucos de descarga que permiten usar modelos 14B en 24 GB, tiempos realistas de generación y cuándo conviene alquilar en vez de comprar.
Por P.I. Panda
2026-10-06
Prompting
MiniMax H3 para prompts: texto a video, imagen a video, video de referencia y audio
Cómo dirigir MiniMax H3 desde un comando de chat: la receta QUIÉN + DÓNDE + ACCIÓN + CÁMARA + SONIDO para texto a video, animar una imagen fija con imagen a video, darle a cada foto de referencia un papel en modo referencia y obtener diálogos claros en vez de murmullos. Con prompts para copiar y probar y el PDF del autor.
Por Mark White
2026-09-20
Modelos de vídeo
Prompts de video MiniMax H3: la estructura oficial
Cómo MiniMax quiere que se escriba un prompt H3: la línea de alineación para videos anclados a imágenes, los tres campos principales, planos y cortes, movimientos de cámara, IDs de hablantes y etiquetas de diálogo, el paisaje sonoro y la música. Resumido de la guía oficial para escribir prompts.
Por Captain
2026-09-14
Modelos
LTX 2.3 Crisp Enhance: detalle de video más nítido y cinematográfico
El LoRA Crisp Enhance de vrgamedevgirl para LTX 2.3 aumenta la nitidez, el microdetalle y el contraste en videos generados. Aprende a equilibrarlo con su contraparte Soft Enhance, los pesos y algunas ideas para prompts.
Por Captain
2026-10-03
Errores y soluciones
Guía de GPU y VRAM para imágenes y videos AI: qué necesita cada modelo y qué comprar (o no)
Cuánta memoria gráfica necesita realmente cada familia de modelos a una velocidad usable (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), qué te aporta la cuantización fp8 y GGUF, por qué la RAM del sistema y el disco también importan, una lista de tarjetas de 8 a 32 GB, notas sobre Mac y AMD, y el punto en que alquilar es más barato que comprar.
Por Quartermaster
2026-01-07

Más guías

Modelos
FLUX.1 Dev: cómo usar prompts, mejores ajustes e ideas creativas
Una guía práctica de FLUX.1 Dev de Black Forest Labs: cómo usar prompts en lenguaje natural, ajustes de guía y pasos, apilamiento de LoRA, renderizado de texto e ideas para aprovechar sus puntos fuertes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configuraciones y en qué sigue destacando
Cómo sacar el máximo provecho del modelo base oficial SDXL 1.0: resoluciones nativas, configuraciones de CFG y sampler, el refinador, prompts negativos e ideas para estilos donde SDXL todavía brilla.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: el modelo clásico, usado correctamente
Stable Diffusion 1.5 sigue siendo importante: la resolución adecuada, CFG y sampler, cómo usar su enorme biblioteca de LoRAs y embeddings, y ideas creativas para prompts adaptadas a un modelo de 512 píxeles.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: cómo usar el modelo más nuevo de Black Forest Labs
FLUX.2 Dev trae prompts más largos, mejor texto, realismo más fuerte y edición con múltiples referencias. Esta guía cubre el flujo turbo, ajustes de guía y resolución, estructura del prompt e ideas que aprovechan sus nuevas fortalezas.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts largos, texto perfecto y carteles bilingües
Qwen-Image es el modelo al que acudir cuando las palabras en la imagen importan. Aprende a escribir sus prompts largos y descriptivos, a renderizar texto en inglés y chino con precisión, a configurar CFG y pasos, y a explorar ideas creativas con mucho diseño.
Por Captain
2026-09-29
Modelos
SDXL-Lightning: generación en cuatro pasos en cualquier checkpoint SDXL
El LoRA SDXL-Lightning de ByteDance convierte un render SDXL de 30 pasos en uno de 4 pasos. Aprende cuántos pasos usar, el CFG que necesitas, el sampler y cómo combinarlo con tus checkpoints y LoRAs de estilo favoritos.
Por Captain
2026-09-30