Model
Trends
.ai
Model
Trends
.ai
os melhores modelos de IA de código aberto

Geração de vídeo por IA para iniciantes: imagem para vídeo, texto para vídeo e o primeiro clipe com Wan, LTX-2 e H3

Tema: Modelos de vídeo
Por Lookout
Publicado em 2026-04-29
Share

Visão geral

Modelos de vídeo são modelos de imagem com um eixo de tempo: o mesmo loop de remoção de ruído roda em um bloco de quadros de uma vez, então tudo que você sabe sobre prompts, sementes e remoção de ruído se aplica, assim como os custos, multiplicados pelo número de quadros. As consequências práticas para um iniciante são três. Comece com imagem para vídeo (I2V), porque uma boa imagem fixa de um modelo de imagem já define a composição e o estilo, deixando para o modelo de vídeo só a parte do movimento para inventar. Mantenha os clipes curtos (cerca de cinco segundos), porque é nisso que os modelos foram treinados. E espere rodar os modelos grandes na nuvem, a menos que tenha uma placa de 24 GB.
Três famílias abertas cobrem a maioria das necessidades em 2026.
Wan 2.2
(Alibaba) é o modelo para tudo: um modelo 5B que roda em 12-16 GB e um modelo 14B com dois especialistas com a melhor qualidade aberta, além de um enorme ecossistema de
LoRAs
para movimento e estilo.
LTX-2
(Lightricks) é rápido e gera áudio sincronizado, mas precisa de 24-32 GB.
MiniMax H3
é o modelo áudio-vídeo com diálogo e efeitos sonoros, usado principalmente por fluxos de trabalho hospedados; os guias de prompt para H3 neste site pelo Mark White são bem detalhados.
Hunyuan
Video 1.5 é uma alternativa mais leve ao
Wan
14B.
O catálogo lista cada modelo de vídeo e seus LoRAs com a base e tamanho que eles usam (5B ou 14B, especialista de alto ou baixo ruído), e as páginas dos modelos mostram clipes de exemplo com seus prompts. O botão Run abre o modelo no
PirateDiffusion
, onde um comando de fluxo de trabalho produz o clipe a partir de uma resposta à sua imagem, ou no
BitVector
.

Referência

Nome
Tipo
O que é
I2V (image to video)
mode
Anime uma imagem fixa. Melhor modo para começar: a composição já está certa; o prompt descreve só o movimento.
T2V (text to video)
mode
Só com um prompt. Mais variedade, menos controle; use para ideias e cenas de apoio.
FLF2V / first-last frame
mode
Dois quadros-chave; o modelo preenche o movimento entre eles. Transições controladas.
Frames and fps
setting
Wan: 81 quadros a 16 fps (5 s); LTX-2: 97-121 quadros a 24-25 fps; H3: 145 quadros a ~24 fps. Memória cresce com os quadros.
Resolution
setting
Wan 2.2: 832x480 ou 480x832 (rápido), 1280x720 (24 GB+); LTX-2 até 1080p+ com 32 GB. Retrato para pessoas, paisagem para cenas.
Motion prompt
prompt
Um movimento do sujeito mais um movimento da câmera: "ela se vira para a janela e sorri; aproximação lenta". Evite listar detalhes da cena que já estão na imagem.
Steps /
CFG
/ shift
setting
Wan 2.2 14B: 20 passos divididos 10/10 entre especialistas,
CFG
3.5, shift 5; 5B: 20-30 passos, CFG 5; LTX-2: 25-30 passos com seu próprio cronograma; LoRAs destilados (lightx2v) reduzem Wan para 4-8 passos com CFG 1.
Motion
LoRAs
file
Movimentos de câmera, danças, gestos, física; combinados para 5B/14B e para o especialista. As páginas aqui indicam o alvo.
Interpolation and upscale
post
RIFE ou FILM para 32-60 fps; ESRGAN quadro a quadro ou SeedVR para resolução.
AD
Seu primeiro clipe sem GPU
BitVector Prism anima uma imagem fixa com os modelos Wan deste guia no navegador: envie a imagem, escreva a frase de movimento, baixe o clipe. Nada para instalar, funciona num laptop.

Passo a passo

  1. Faça ou escolha uma imagem fixa: um render 1024x1024 ou 832x1216 com um sujeito claro e fundo simples. Rostos maiores que um décimo do quadro animam melhor.
  2. Abra uma página do modelo Wan 2.2 I2V neste site, copie o padrão de prompt de movimento do exemplo e aperte o botão Run (PirateDiffusion: responda sua imagem com o comando /workflow; BitVector: envie e escolha o modelo).
  3. Escreva um prompt de movimento com uma frase para o sujeito e uma para a câmera. Nada sobre roupas, cores ou iluminação; a imagem já tem isso.
  4. Gere em 832x480 (paisagem) ou 480x832 (retrato), 81 quadros, passos padrão. Assista o clipe inteiro; julgue o movimento, não a nitidez.
  5. Itere só no prompt de movimento: verbos mais lentos ("lentamente", "suavemente") reduzem movimentos exagerados; uma instrução única para a câmera evita pulos.
  6. Localmente, com uma placa de 16 GB:
    Wan 2.2 5B
    fp8 ou GGUF, 832x480, 49-81 quadros, codificador de texto na CPU. Com 24 GB: 14B fp8 a 480p, 720p com o codificador descarregado. Veja o guia
    VRAM
    para vídeo IA.
  7. Peças mais longas: pegue o último quadro do clipe um como imagem inicial do clipe dois com um prompt de movimento contínuo; junte no editor; interpole para 30 fps e aumente a resolução no final.
  8. Adicione som: LTX-2 e H3 geram áudio com o clipe; para Wan, adicione música ou efeitos no editor.

Exemplos

Prompt de movimento para I2V

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

Comando de fluxo de trabalho PirateDiffusion

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B em 16 GB

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

Dicas

  • Verbos de movimento importam mais que adjetivos: "vira, anda, levanta, derrama, acena" produzem movimentos distintos e confiáveis; "bonito cinematográfico" não produz nada.
  • Um movimento de câmera por clipe: aproximação, afastamento, panorâmica para esquerda, órbita. Dois movimentos causam tremores.
  • Imagens em retrato animam rostos melhor; em paisagem animam ambientes melhor.
  • LoRAs Wan para o especialista de alto ruído moldam o movimento; os de baixo ruído moldam detalhes. Muitos pacotes têm os dois; carregue cada um no seu especialista.
  • LoRAs destilados (lightx2v, FastWan) cortam Wan de 20 passos para 4-6 com CFG 1 sem perder muita qualidade; as páginas dos modelos listam eles.
  • Espere 3-10 minutos por clipe numa 4090 para Wan 14B e cerca de 90 segundos para LTX-2; a nuvem devolve a maioria dos clipes em um ou dois minutos.

Solução de problemas

O clipe é uma imagem fixa com um leve brilho

Por que acontece
Sem verbo de movimento no prompt, ou peso estático de LoRA muito alto.

Como corrigir
Adicione um movimento do sujeito e um da câmera; abaixe os LoRAs para 0.7.

Rosto derrete ou muda de identidade

Por que acontece
Rosto muito pequeno, muitos quadros, ou 480p num rosto detalhado.

Como corrigir
Corte mais perto, 49-61 quadros, ou 720p na nuvem; um passe de detalhamento de rosto por quadro é último recurso.

Câmera pula ou a cena corta

Por que acontece
Duas instruções de câmera, ou palavras "corte para" no prompt.

Como corrigir
Um movimento de câmera; coloque "jump cut" no negativo.

Falta de memória em 720p

Por que acontece
Número de quadros vezes resolução ultrapassa VRAM.

Como corrigir
Reduza para 480p ou menos quadros, descarregue o codificador de texto; veja o guia VRAM para vídeo IA.

LoRA de movimento não faz nada

Por que acontece
Carregado no especialista errado ou tamanho de modelo errado.

Como corrigir
Cheque a página do modelo para 5B/14B e alto/baixo ruído; carregue conforme a palavra-chave.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 e H3 pelo Telegram
PirateDiffusion roda os grandes modelos de vídeo em GPUs de servidor: responda qualquer imagem com um comando de fluxo de trabalho e o clipe volta no chat. Geração ilimitada por preço fixo, sem precisar de placa 24 GB.

Perguntas

Qual modelo de vídeo usar primeiro?

Wan 2.2 I2V: fácil, bem documentado, com mais LoRAs. O guia de início do Wan tem a configuração completa.

Posso fazer isso numa placa de 8 GB?

Clipes curtos 480p com
Wan 2.1
1.3B ou Wan 2.2 5B GGUF, devagar. Na prática, comece na nuvem.

Como consigo som?

LTX-2 e MiniMax H3 geram áudio sincronizado; os guias de prompt para H3 do Mark White explicam diálogo e efeitos.

Quanto tempo pode ter um clipe?

Cerca de cinco segundos nativamente. Peças mais longas são clipes encadeados; a qualidade cai depois de seis a oito segundos num único passe.

Os modelos comerciais mais novos (Veo, Kling, Wan 3.0) estão disponíveis localmente?

Não; são só via API. Tudo neste guia é peso aberto e roda localmente ou nos parceiros de nuvem.

Links e fontes

Modelos deste guia

Escrito por
Lookout

Guias relacionados

Modelos de vídeo
Wan 2.2 vídeo: configuração, ajustes e LoRAs para texto-para-vídeo e imagem-para-vídeo
Conseguindo os primeiros resultados com Wan 2.2: qual tamanho de modelo escolher (5B ou 14B), o par de especialistas ruído-alto / ruído-baixo, resoluções e contagem de quadros que funcionam, os LoRAs lightning que reduzem renderizações para quatro passos, estrutura do prompt para movimento e como rodar hospedado quando a placa é pequena demais.
Por Captain
2026-05-24
Modelos de vídeo
Quanto VRAM você precisa para vídeo com IA? Wan 2.2, HunyuanVideo 1.5 e LTX-2 por tamanho de GPU (2026)
VRAM necessária para rodar Wan 2.2, HunyuanVideo 1.5 e LTX-2 localmente, por tamanho de GPU, resolução e duração do clipe: o que placas de 8, 12-16, 24, 32 e 48+ GB conseguem, por que vídeo custa cem vezes mais que imagem, os truques de offloading que fazem modelos 14B caberem em 24 GB, tempos realistas de geração e quando alugar é melhor que comprar.
Por P.I. Panda
2026-10-06
Prompting
Prompting MiniMax H3: texto para vídeo, imagem para vídeo, vídeo de referência e áudio
Como direcionar o MiniMax H3 a partir de um comando de chat: a receita WHO + WHERE + ACTION + CAMERA + SOUND para texto para vídeo, animando uma imagem parada com imagem para vídeo, dando uma função para cada foto de referência no modo referência, e obtendo diálogo claro em vez de murmúrios. Com prompts para copiar e testar e o PDF do autor.
Por Mark White
2026-09-20
Modelos de vídeo
MiniMax H3 prompts de vídeo: a estrutura oficial
Como o MiniMax quer que um prompt H3 seja escrito: a linha de alinhamento para vídeos ancorados em imagem, os três campos principais, cenas e cortes, movimentos de câmera, IDs dos falantes e tags de diálogo, o cenário sonoro e a música. Resumido do guia oficial de escrita de prompts.
Por Captain
2026-09-14
Modelos
LTX 2.3 Crisp Enhance: detalhes de vídeo mais nítidos e cinematográficos
O Crisp Enhance LoRA da vrgamedevgirl para LTX 2.3 aumenta a nitidez, microdetalhes e contraste no vídeo gerado. Saiba como equilibrar com o Soft Enhance, pesos e ideias de prompt.
Por Captain
2026-10-03
Erros e soluções
Guia de GPU e VRAM para IA de imagem e vídeo: o que cada modelo precisa e o que comprar (ou não)
Quanto de memória gráfica cada família de modelo realmente precisa para rodar numa velocidade útil (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), o que a quantização fp8 e GGUF trazem, por que a RAM do sistema e o disco também importam, uma lista de placas de 8 a 32 GB, notas para Mac e AMD, e o ponto em que alugar sai mais barato que comprar.
Por Quartermaster
2026-01-07

Mais guias

Serviços na nuvem
Taxa fixa vs tokens: por que planos ilimitados como Graydient.ai são o melhor custo-benefício para criadores de IA em 2026
Uma comparação de custos ranqueada, com preços verificados em 8 de outubro de 2026, entre planos ilimitados com taxa fixa como Graydient.ai e preços por token e crédito do Midjourney, Leonardo, fal.ai, Replicate, Runway e Kling: quanto realmente custam 1.000 imagens e 1.000 vídeos por mês em cada um, e por que uma taxa fixa para imagens, vídeos, áudio, chat Grok LLM e apps web ilimitados é o melhor custo-benefício para criadores que fazem várias versões.
Por Captain
2026-10-08
Modelos
FLUX.1 Dev: como criar prompts, melhores configurações e ideias criativas
Um guia prático para FLUX.1 Dev da Black Forest Labs: como criar prompts em linguagem natural, configurações de orientação e passos, empilhamento de LoRA, renderização de texto e ideias de prompt que aproveitam seus pontos fortes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configurações e no que ele ainda é melhor
Como tirar o máximo proveito do modelo base oficial SDXL 1.0: resoluções nativas, configurações de CFG e sampler, o refinador, prompts negativos e ideias de estilos onde o SDXL ainda se destaca.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: o modelo clássico, usado do jeito certo
Stable Diffusion 1.5 ainda vale a pena conhecer: a resolução certa, CFG e sampler, como usar sua enorme biblioteca de LoRAs e embeddings, e ideias criativas de prompt para um modelo de 512 pixels.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: criando prompts para o modelo mais novo da Black Forest Labs
FLUX.2 Dev traz prompts maiores, texto melhor, realismo mais forte e edição com múltiplas referências. Este guia cobre o fluxo turbo, configurações de orientação e resolução, estrutura do prompt e ideias que aproveitam suas novas forças.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts longos, texto perfeito e pôsteres bilíngues
Qwen-Image é o modelo ideal quando as palavras na imagem importam. Aprenda a escrever seus prompts longos e descritivos, renderizar texto em inglês e chinês com precisão, ajustar CFG e passos, e explorar ideias criativas com muitos elementos no layout.
Por Captain
2026-09-29