Model
Trends
.ai
Model
Trends
.ai
os melhores modelos de IA de código aberto

Wan 2.2 vídeo: configuração, ajustes e LoRAs para texto-para-vídeo e imagem-para-vídeo

Tema: Modelos de vídeo
Por Captain
Publicado em 2026-05-24
Share

Visão geral

Wan 2.2
é a família de vídeo aberta da Alibaba e o modelo de vídeo mais baixado neste site. Ele vem como um modelo híbrido 5B de texto e imagem para vídeo, feito para placas de consumidor (720p em 8 a 12 GB), e como modelos 14B de texto-para-vídeo e imagem-para-vídeo que usam dois especialistas: um modelo de ruído alto que define o movimento e a composição nos primeiros passos e um modelo de ruído baixo que adiciona detalhes nos passos finais. O par 14B produz os resultados cinematográficos que as pessoas compartilham; o modelo 5B é o indicado para aprender.
A comunidade treinou centenas de
Wan
LoRAs
: movimentos de câmera (órbita, dolly, crash zoom), estilos de movimento, personagens, efeitos e os LoRAs lightning / de destilação que reduzem renderizações de 30 passos para 4 a 8 passos com pouca perda. A página da família Wan os classifica por popularidade; os LoRAs lightning quase sempre estão no topo.
Opções hospedadas são uma boa escolha para vídeo porque as renderizações são longas e consomem muita
VRAM
:
PirateDiffusion
roda fluxos Wan pelo Telegram com /wf /run, e
BitVector
mantém os gráficos Wan pré-instalados com os LoRAs no lugar. Ambos estão linkados na caixa Run de cada página de modelo Wan.

Referência

Nome
Tipo
O que é
Wan2.2-TI2V-5B
model
Um modelo para texto e imagem para vídeo, 720p a 24 fps, máximo de 121 quadros. fp16 10 GB, fp8 5 GB. Placas de 8 a 12 GB.
Wan2.2-T2V-A14B / I2V-A14B
model pair
Especialistas de ruído alto e ruído baixo, 14B cada (27B no total, 14B ativos). 480p e 720p. fp8 cerca de 14 GB cada; GGUF Q4 cerca de 8 GB cada.
umt5-xxl text encoder
file
fp8 escalado (6 GB) ou fp16 (11 GB). Compartilhado por todos os modelos Wan.
Wan 2.1
/ 2.2 VAE
file
O modelo 5B usa o VAE 2.2; os modelos 14B usam o VAE 2.1. Misturar eles gera lixo.
Resolution
setting
480x832 ou 832x480 para testes rápidos; 720x1280 / 1280x720 para finais. Múltiplos de 16.
Frames
setting
4n+1: 33, 49, 65, 81. 81 quadros a 16 fps são cinco segundos.
Steps / shift /
CFG
setting
20 a 30 passos, shift 5 a 8,
CFG
3.5 a 5 sem lightning. Com LoRAs lightning: 4 a 8 passos, CFG 1, shift 5.
Lightning / distill
LoRA
LoRAs separados para os especialistas de ruído alto e baixo; carregue cada um no seu modelo. Peso 1.0.
Prompt
text
Sujeito, ação, câmera, iluminação, estilo, nessa ordem. Descreva verbos de movimento explicitamente. Prompt negativo é usado pelo Wan (diferente do
Flux
).
AD
Sem instalação: rode modelos de IA na nuvem
BitVector Prism é a forma mais fácil de começar: escolha um modelo, digite um prompt e gere em um app web limpo, sem configurar nada. O BitVector também está disponível no Discord e na web (SpyGlass).

Passo a passo

  1. Instale os loaders: o núcleo do
    ComfyUI
    suporta Wan 2.2; adicione ComfyUI-GGUF para arquivos quantizados. Atualize o ComfyUI primeiro.
  2. Baixe para sua placa: 5B fp8 mais o VAE 2.2 e umt5 fp8 para 8 a 12 GB; o par 14B fp8 mais o VAE 2.1 para 24 GB; o par 14B GGUF Q4 para 12 a 16 GB.
  3. Carregue o template oficial (Workflow > Browse Templates > Video > Wan 2.2) e substitua os loaders pelos seus arquivos. Para GGUF troque Load Diffusion Model por Unet Loader (GGUF).
  4. Para 14B: dois nós KSampler Advanced. O primeiro roda o modelo de ruído alto dos passos 0 a N/2 (retorna com ruído sobrando), o segundo roda o modelo de ruído baixo de N/2 a N. O template já conecta isso.
  5. Primeira renderização: 480x832, 33 quadros, 20 passos, CFG 4, shift 8, prompt "a corgi runs along a beach at sunset, camera tracks alongside, golden light, shallow depth of field". Espere de 2 a 6 minutos.
  6. Adicione os LoRAs lightning da página da família Wan (um para cada especialista), ajuste passos para 6 (3 + 3), CFG 1. Renderizações caem para menos de um minuto em 480p.
  7. Imagem-para-vídeo: carregue o par I2V, alimente a imagem no WanImageToVideo, mantenha o prompt sobre movimento e câmera em vez de descrever a imagem.
  8. Finais: 720p, 81 quadros, interpolar para 32 fps com RIFE ou FILM, upscale com um
    upscaler
    de vídeo da família
    Upscalers
    se precisar.
  9. Muito lento ou muito pesado: rode o mesmo fluxo no BitVector, ou no PirateDiffusion com /workflow /show:wan para ver os campos e /wf /run:wan seu prompt.

Exemplos

Prompt de texto para vídeo

A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image

Prompt de imagem para vídeo (só movimento)

The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight

PirateDiffusion

/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in

Dicas

  • Descreva movimento com verbos e a câmera com termos de filme (dolly lento para dentro, handheld, plano aberto estático). Wan entende bem essa linguagem de câmera.
  • Mantenha o prompt negativo: o oficial lista superexposição, estático, detalhes borrados, legendas, pior qualidade, dedos extras, e ajuda bastante.
  • Para I2V, gere o primeiro quadro com Flux,
    Qwen
    ou
    Z-Image
    na proporção desejada; uma imagem nítida e bem iluminada gera um clipe melhor que qualquer prompt.
  • Contagem de quadros custa mais que resolução: 81 quadros em 480p é mais barato que 49 quadros em 720p.
  • LoRAs de movimento para Wan são marcados pelo especialista que eles miram; um LoRA só para ruído baixo adiciona detalhes, um LoRA de ruído alto muda o movimento.
  • Seed é muito importante em vídeo; mantenha a seed fixa enquanto ajusta o prompt, depois varie para diferentes takes.
  • Salve o fluxo com seu conjunto de LoRAs como template; gráficos Wan são longos e fáceis de quebrar.

Solução de problemas

Falta de memória no primeiro sampler

Por que acontece
Pesos 14B fp16 em placa de 24 GB ou menor.

Como corrigir
Par fp8 ou GGUF Q4, menos quadros, 480p, --lowvram; ou o modelo 5B.

Vídeo fica borrado ou com ruído de cor

Por que acontece
VAE errado (2.2 VAE com 14B ou 2.1 VAE com 5B), ou LoRA lightning sem CFG 1.

Como corrigir
Combine o VAE com o modelo; com LoRAs lightning ajuste CFG 1 e 4 a 8 passos.

Quase nenhum movimento

Por que acontece
Prompt descreve cena, não ação; ou poucos passos no especialista de ruído alto.

Como corrigir
Adicione verbos de movimento e movimentos de câmera; dê metade dos passos para o especialista de ruído alto.

Sujeito muda no meio do vídeo

Por que acontece
Muitos quadros para a resolução, ou dois LoRAs conflitantes.

Como corrigir
Reduza para 49 quadros, um LoRA de movimento por vez, aumente passos no especialista de ruído baixo.

Falha na decodificação depois de amostrar

Por que acontece
Decodificação do VAE é o pico de memória para vídeo.

Como corrigir
Decodifique o VAE Wan em tiles (opção tiled no nó decode), ou use menos quadros.

Avisos de chave LoRA não carregada

Por que acontece
LoRA 2.1 em 2.2, ou LoRA 14B no modelo 5B.

Como corrigir
Combine versão e tamanho; a página do modelo mostra ambos.

AD
PirateDiffusion
Sem instalação: rode modelos de IA na nuvem
O PirateDiffusion é exclusivo do Telegram e feito para profissionais: milhares de modelos, LoRAs e workflows por comandos de chat, com geração ilimitada a preço fixo.

Perguntas

5B ou 14B?

5B para aprender e para placas de 8 a 12 GB; 14B para qualidade se tiver 24 GB ou rodar hospedado. Ambos usam os mesmos prompts.

Qual o tamanho do clipe?

Até 81 quadros (5 s a 16 fps) para 14B e 121 quadros (5 s a 24 fps) para 5B por renderização; vídeos mais longos são montados com continuações do último quadro.

Wan faz áudio?

Wan 2.2 S2V
anima
um falante a partir do áudio mas não gera som;
LTX-2
e
MiniMax H3
geram áudio junto com o vídeo (guias deles estão neste site).

De onde vêm os LoRAs lightning?

Lançamentos de destilação por Lightx2v e outros; a página da família Wan lista eles com pontuações de popularidade e o especialista que cada um mira.

Posso rodar Wan sem GPU?

Sim: PirateDiffusion pelo Telegram, BitVector no navegador. Ambos mantêm os fluxos e LoRAs instalados.

Links e fontes

Modelos deste guia

Escrito por
Captain

Guias relacionados

Erros e soluções
CUDA sem memória: quanta VRAM cada modelo de IA precisa e como fazer caber
Uma tabela de VRAM para SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 e HunyuanVideo, e as técnicas que fazem um modelo caber: quantização fp8 e GGUF, offload para CPU, VAE em blocos, limites de resolução e quadros, e quando parar de tentar e usar hospedagem.
Por Captain
2026-05-18
Erros e soluções
Erros do ComfyUI e como consertar: nós vermelhos, modelos faltando, CUDA sem memória
As mensagens de erro do ComfyUI que as pessoas veem primeiro, o que cada uma significa e a solução que funciona: nós customizados faltando (caixas vermelhas), "Prompt outputs failed validation", CUDA sem memória, tipo errado de modelo em um loader, erros de forma mat1 e mat2, desserialização de cabeçalho, incompatibilidades entre torch e xformers.
Por Captain
2026-05-12
Modelos de vídeo
MiniMax H3 prompts de vídeo: a estrutura oficial
Como o MiniMax quer que um prompt H3 seja escrito: a linha de alinhamento para vídeos ancorados em imagem, os três campos principais, cenas e cortes, movimentos de câmera, IDs dos falantes e tags de diálogo, o cenário sonoro e a música. Resumido do guia oficial de escrita de prompts.
Por Captain
2026-09-14
Modelos
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: qual família de modelo usar em 2026
Uma comparação prática das famílias de modelos de imagem abertos: fidelidade ao prompt, realismo, anime e ilustração, renderização de texto, velocidade, VRAM, ecossistema LoRA e licença, com uma recomendação para cada tipo de trabalho e hardware.
Por Captain
2026-05-22

Mais guias

Serviços na nuvem
Taxa fixa vs tokens: por que planos ilimitados como Graydient.ai são o melhor custo-benefício para criadores de IA em 2026
Uma comparação de custos ranqueada, com preços verificados em 8 de outubro de 2026, entre planos ilimitados com taxa fixa como Graydient.ai e preços por token e crédito do Midjourney, Leonardo, fal.ai, Replicate, Runway e Kling: quanto realmente custam 1.000 imagens e 1.000 vídeos por mês em cada um, e por que uma taxa fixa para imagens, vídeos, áudio, chat Grok LLM e apps web ilimitados é o melhor custo-benefício para criadores que fazem várias versões.
Por Captain
2026-10-08
Modelos
FLUX.1 Dev: como criar prompts, melhores configurações e ideias criativas
Um guia prático para FLUX.1 Dev da Black Forest Labs: como criar prompts em linguagem natural, configurações de orientação e passos, empilhamento de LoRA, renderização de texto e ideias de prompt que aproveitam seus pontos fortes.
Por Captain
2026-09-30
Modelos
Stable Diffusion XL 1.0: prompts, configurações e no que ele ainda é melhor
Como tirar o máximo proveito do modelo base oficial SDXL 1.0: resoluções nativas, configurações de CFG e sampler, o refinador, prompts negativos e ideias de estilos onde o SDXL ainda se destaca.
Por Captain
2026-10-01
Modelos
Stable Diffusion 1.5: o modelo clássico, usado do jeito certo
Stable Diffusion 1.5 ainda vale a pena conhecer: a resolução certa, CFG e sampler, como usar sua enorme biblioteca de LoRAs e embeddings, e ideias criativas de prompt para um modelo de 512 pixels.
Por Captain
2026-10-02
Modelos
FLUX.2 Dev: criando prompts para o modelo mais novo da Black Forest Labs
FLUX.2 Dev traz prompts maiores, texto melhor, realismo mais forte e edição com múltiplas referências. Este guia cobre o fluxo turbo, configurações de orientação e resolução, estrutura do prompt e ideias que aproveitam suas novas forças.
Por Captain
2026-10-03
Modelos
Qwen-Image: prompts longos, texto perfeito e pôsteres bilíngues
Qwen-Image é o modelo ideal quando as palavras na imagem importam. Aprenda a escrever seus prompts longos e descritivos, renderizar texto em inglês e chinês com precisão, ajustar CFG e passos, e explorar ideias criativas com muitos elementos no layout.
Por Captain
2026-09-29