Wan 2.2 video: setup, settings at LoRAs para sa text-to-video at image-to-video
Paksa: Mga video model
Ni Captain
Inilathala 2026-05-24
Paano makakuha ng unang resulta mula sa Wan 2.2: anong laki ng modelo ang pipiliin (5B o 14B), ang pares ng high-noise / low-noise expert, mga resolution at bilang ng frame na gumagana, ang lightning LoRAs na nagpapabilis ng render sa apat na hakbang, istruktura ng prompt para sa galaw, at paano patakbuhin ito sa host kapag maliit ang card.
Pangkalahatang-ideya
Ang
Wan 2.2
ay open video family ng Alibaba at ang pinaka-download na video model dito sa site. Meron itong 5B hybrid text-and-image-to-video model na ginawa para sa consumer cards (720p sa 8 hanggang 12 GB), at 14B text-to-video at image-to-video models na gumagamit ng dalawang eksperto: isang high-noise model na naglalatag ng galaw at komposisyon sa unang mga hakbang at isang low-noise model na nagdadagdag ng detalye sa huling mga hakbang. Ang pares na 14B ang gumagawa ng cinematic na resulta na pinapamahagi ng mga tao; ang 5B model ang para pag-aralan.
Maraming
Wan
LoRAs
ang na-train ng komunidad: mga galaw ng camera (orbit, dolly, crash zoom), mga estilo ng galaw, mga karakter, mga epekto, at ang lightning / distillation LoRAs na nagpapababa ng 30-step na render sa 4 hanggang 8 hakbang na halos walang pagkawala. Niraranggo sila sa Wan family page ayon sa kasikatan; halos palaging nasa taas ang lightning LoRAs.
Magandang opsyon ang hosted para sa video dahil mahaba at kumakain ng
VRAM
ang mga render: pinapatakbo ng
PirateDiffusion
ang Wan workflows mula sa Telegram gamit ang /wf /run, at pinananatili ng
BitVector
ang Wan graphs na naka-preinstall kasama ang mga LoRAs. Nakalink ang pareho sa Run box ng bawat Wan model page.
Sanggunian
Pangalan | Uri | Ano ito |
|---|---|---|
Wan2.2-TI2V-5B | model | Isang modelo para sa text- at image-to-video, 720p sa 24 fps, maximum na 121 frames. fp16 10 GB, fp8 5 GB. Para sa 8 hanggang 12 GB cards. |
Wan2.2-T2V-A14B / I2V-A14B | model pair | Mga high-noise at low-noise experts, 14B bawat isa (27B total, 14B active). 480p at 720p. fp8 mga 14 GB bawat isa; GGUF Q4 mga 8 GB bawat isa. |
umt5-xxl text encoder | file | fp8 scaled (6 GB) o fp16 (11 GB). Ginagamit ng lahat ng Wan models. |
Wan 2.1 / 2.2 VAE | file | Gumagamit ang 5B model ng 2.2 VAE; ang 14B models ay gumagamit ng 2.1 VAE. Kapag pinaghalo, nagiging basura ang output. |
Resolution | setting | 480x832 o 832x480 para sa mabilisang tests; 720x1280 / 1280x720 para sa final. Multiples ng 16. |
Frames | setting | 4n+1: 33, 49, 65, 81. Ang 81 frames sa 16 fps ay limang segundo. |
Steps / shift / CFG | setting | 20 hanggang 30 steps, shift 5 hanggang 8, CFG 3.5 hanggang 5 kung walang lightning. Kapag may lightning LoRAs: 4 hanggang 8 steps, CFG 1, shift 5. |
Lightning / distill LoRA | LoRA | Hiwalay na LoRAs para sa high-noise at low-noise experts; i-load ang bawat isa sa sariling modelo. Timbang 1.0. |
Prompt | text | Paksa, aksyon, camera, ilaw, estilo, sa ganitong ayos. Ilarawan nang malinaw ang mga pandiwang galaw. Ginagamit ng Wan ang negative prompt (hindi tulad ng Flux ). |
AD

Walang kailangang i-install - patakbuhin ang mga AI model sa cloud
Ang BitVector Prism ang pinakamadaling paraan para magsimula: pumili ng model, mag-type ng prompt at gumawa sa isang malinis na web app, nang walang kailangang i-configure. Available din ang BitVector sa Discord at sa web (SpyGlass).
Hakbang-hakbang
- I-install ang mga loaders: sinusuportahan ngComfyUIcore ang Wan 2.2; idagdag ang ComfyUI-GGUF para sa mga quantised files. I-update muna ang ComfyUI.
- I-download ayon sa iyong card: 5B fp8 kasama ang 2.2 VAE at umt5 fp8 para sa 8 hanggang 12 GB; ang 14B fp8 pair kasama ang 2.1 VAE para sa 24 GB; ang 14B GGUF Q4 pair para sa 12 hanggang 16 GB.
- I-load ang official template (Workflow > Browse Templates > Video > Wan 2.2) at palitan ang loaders ng iyong mga file. Para sa GGUF, palitan ang Load Diffusion Model ng Unet Loader (GGUF).
- Para sa 14B: dalawang KSampler Advanced nodes. Ang una ay nagpapatakbo ng high-noise model mula hakbang 0 hanggang N/2 (ibinabalik ang natitirang ingay), ang pangalawa ay nagpapatakbo ng low-noise model mula N/2 hanggang N. Nakawiring na ito sa template.
- Unang render: 480x832, 33 frames, 20 steps, CFG 4, shift 8, prompt "a corgi runs along a beach at sunset, camera tracks alongside, golden light, shallow depth of field". Asahan ang 2 hanggang 6 na minuto.
- Idagdag ang lightning LoRAs mula sa Wan family page (isa para sa bawat expert), itakda ang steps sa 6 (3 + 3), CFG 1. Bumaba ang oras ng render sa ilalim ng isang minuto sa 480p.
- Image-to-video: i-load ang I2V pair, ipasok ang larawan sa WanImageToVideo, panatilihin ang prompt tungkol sa galaw at camera sa halip na ilarawan ang larawan.
- Masyadong mabagal o malaki: patakbuhin ang parehong workflow sa BitVector, o sa PirateDiffusion gamit ang /workflow /show:wan para basahin ang mga field at /wf /run:wan ang iyong prompt.
Mga halimbawa
Prompt para sa text-to-video
A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image
Prompt para sa image-to-video (galaw lang)
The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight
PirateDiffusion
/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in
Mga tip
- Ilarawan ang galaw gamit ang mga pandiwa at ang camera gamit ang mga salita sa pelikula (slow dolly in, handheld, static wide shot). Napakagaling ng Wan sa pagsunod sa lengguwahe ng camera.
- Panatilihin ang negative prompt: ang official ay naglalaman ng overexposure, static, malabong detalye, subtitles, worst quality, extra fingers, at nakakatulong ito.
- Mas mahal ang bilang ng frame kaysa resolution: 81 frames sa 480p ay mas mura kaysa 49 frames sa 720p.
- Ang Motion LoRAs para sa Wan ay tinataga ayon sa expert na tinatarget nila; ang low-noise-only LoRA ay nagdadagdag ng detalye, ang high-noise LoRA ay nagbabago ng galaw.
- Mahalaga ang seed sa video; panatilihing pareho ang seed habang inaayos ang prompt, tapos palitan ito para sa iba't ibang take.
- I-save ang workflow kasama ang iyong LoRA set bilang template; mahaba ang Wan graphs at madaling masira.
Pag-aayos ng problema
Kulang sa memorya sa unang sampler
Bakit ito nangyayari
fp16 14B weights sa 24 GB o mas maliit na card.
Paano ayusin
Gamitin ang fp8 o GGUF Q4 pair, bawasan ang frames, 480p, --lowvram; o gamitin ang 5B model.
Malabong smear o kulay na ingay ang video
Bakit ito nangyayari
Maling VAE (2.2 VAE sa 14B o 2.1 VAE sa 5B), o lightning LoRA na walang CFG 1.
Paano ayusin
Itugma ang VAE sa modelo; kapag may lightning LoRAs, itakda ang CFG 1 at 4 hanggang 8 steps.
Halos walang galaw
Bakit ito nangyayari
Ang prompt ay naglalarawan ng eksena, hindi aksyon; o kulang ang steps sa high-noise expert.
Paano ayusin
Magdagdag ng mga pandiwang galaw at galaw ng camera; bigyan ang high-noise expert ng kalahati ng steps.
Nagbabago ang paksa sa kalagitnaan
Bakit ito nangyayari
Sobrang dami ng frames para sa resolution, o dalawang magkasalungat na LoRAs.
Paano ayusin
Paiksiin sa 49 frames, isa lang ang motion LoRA sa isang pagkakataon, taasan ang steps sa low-noise expert.
Nabibigo ang decode pagkatapos ng sampling
Bakit ito nangyayari
Ang VAE decode ang pinakamataas na memory usage para sa video.
Paano ayusin
Gamitin ang Wan VAE decode sa tiles (ang tiled option sa decode node), o bawasan ang frames.
Mga babala na hindi na-load ang LoRA key
Bakit ito nangyayari
2.1 LoRA sa 2.2, o 14B LoRA sa 5B model.
Paano ayusin
Itugma ang bersyon at laki; nakalista ito sa model page.
AD

Walang kailangang i-install - patakbuhin ang mga AI model sa cloud
Ang PirateDiffusion ay Telegram lamang at ginawa para sa mga pro: libo-libong model, LoRA at workflow na pinapatakbo ng mga chat command, na may walang limitasyong paggawa sa isang fixed-price plan.
Mga tanong
5B o 14B?
5B para pag-aralan at para sa 8 hanggang 12 GB cards; 14B para sa kalidad kapag may 24 GB o kapag naka-host. Pareho ang prompts na ginagamit.
Gaano kahaba ang clip?
Hanggang 81 frames (5 s sa 16 fps) para sa 14B at 121 frames (5 s sa 24 fps) para sa 5B bawat render; ang mas mahahabang video ay pinagdugtong mula sa mga huling frame na pagpapatuloy.
Gumagawa ba ng audio ang Wan?
Ang Wan 2.2 S2V ay nag-a-animate ng speaker mula sa audio pero hindi gumagawa ng tunog; ang
LTX-2
at
MiniMax H3
ay gumagawa ng audio kasama ng video (nandito ang mga gabay nila sa site).
Saan nanggagaling ang lightning LoRAs?
Mga distillation release mula kay Lightx2v at iba pa; nakalista ang mga ito sa Wan family page kasama ang heat scores at ang expert na tinatarget ng bawat isa.
Pwede ba patakbuhin ang Wan nang walang GPU?
Oo: PirateDiffusion mula sa Telegram, BitVector sa browser. Pareho nilang pinananatili ang workflows at LoRAs na naka-install.
Mga link at pinagmulan
- Wan 2.2 on GitHub
- Wan 2.2 weights on Hugging Face
- ComfyUI Wan 2.2 examples
- Wan family page
- Hosted Wan workflows on PirateDiffusion
- BitVector
Mga model sa gabay na ito
Isinulat ni
Captain
Mga kaugnay na gabay
Mga error at solusyon
CUDA out of memory: gaano karaming VRAM ang kailangan ng bawat AI model at paano ito mapasya
Isang VRAM na talaan para sa SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 at HunyuanVideo, at mga teknik na nagpapasya sa isang modelo: fp8 at GGUF quantisation, CPU offload, tiled VAE, limitasyon sa resolusyon at frame, at kung kailan itigil na ang pakikipaglaban at gamitin na lang ang hosted.
Ni Captain
2026-05-18
Mga error at solusyon
Mga error sa ComfyUI at paano ayusin: pulang nodes, nawawalang mga modelo, CUDA out of memory
Ang mga unang error message sa ComfyUI na madalas maranasan, kung ano ang ibig sabihin ng bawat isa at ang tamang solusyon: nawawalang custom nodes (pulang kahon), "Prompt outputs failed validation", CUDA out of memory, maling uri ng modelo sa loader, mat1 at mat2 shape errors, header deserialization, torch at xformers na hindi tugma.
Ni Captain
2026-05-12
Mga video model
MiniMax H3 video prompts: ang opisyal na istruktura
Paano gustong isulat ng MiniMax ang H3 prompt: ang linya ng pag-align para sa mga video na naka-angkla sa imahe, ang tatlong pangunahing bahagi, mga shot at cut, galaw ng kamera, mga ID ng tagapagsalita at mga tag ng diyalogo, ang tunog at musika. Pinagsiksik mula sa opisyal na gabay sa pagsulat ng prompt.
Ni Captain
2026-09-14
Mga model
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: aling pamilya ng modelo ang gagamitin sa 2026
Isang praktikal na paghahambing ng mga open image model na pamilya: pagsunod sa prompt, realism, anime at ilustrasyon, pag-render ng teksto, bilis, VRAM, ecosystem ng LoRA at lisensya, kasama ang rekomendasyon para sa bawat uri ng trabaho at hardware.
Ni Captain
2026-05-22
Higit pang gabay
Mga model
FLUX.1 Dev: paano ito i-prompt, pinakamahusay na mga setting at mga ideya sa paglikha
Isang praktikal na gabay sa FLUX.1 Dev mula sa Black Forest Labs: natural-language prompting, mga setting ng guidance at steps, LoRA stacking, text rendering at mga ideya sa prompt na nagpapalakas sa mga kakayahan nito.
Ni Captain
2026-09-30
Mga model
Stable Diffusion XL 1.0: mga prompt, settings at kung ano pa rin ang pinakamagaling nito
Paano masulit ang official SDXL 1.0 base model: native na resolusyon, CFG at sampler settings, ang refiner, negative prompts at mga ideya para sa mga estilo kung saan pa rin namumukod-tangi ang SDXL.
Ni Captain
2026-10-01
Mga model
Stable Diffusion 1.5: ang klasikong modelo, tamang paggamit ng prompt
Worth pa rin malaman ang Stable Diffusion 1.5: tamang resolution, CFG at sampler, paano gamitin ang malaking library ng LoRAs at embeddings nito, at mga creative na ideya sa prompt na bagay sa 512-pixel na modelo.
Ni Captain
2026-10-02
Mga model
FLUX.2 Dev: paggamit ng pinakabagong modelo ng Black Forest Labs
Ang FLUX.2 Dev ay may mas mahahabang prompt, mas magandang teksto, mas matibay na realism, at multi-reference editing. Saklaw ng gabay na ito ang turbo workflow, guidance at resolution settings, istruktura ng prompt, at mga ideya na gumagamit ng mga bagong lakas nito.
Ni Captain
2026-10-03
Mga model
Qwen-Image: mahahabang prompt, perpektong teksto at bilingual na poster
Ang Qwen-Image ang modelong dapat gamitin kapag mahalaga ang mga salita sa larawan. Alamin kung paano gumawa ng mahahabang deskriptibong prompt, mag-render ng English at Chinese na teksto nang tama, mag-set ng CFG at steps, at tuklasin ang mga ideya na maraming layout.
Ni Captain
2026-09-29
Mga model
SDXL-Lightning: apat na hakbang na pagbuo sa kahit anong SDXL checkpoint
Pinapabilis ng ByteDance na SDXL-Lightning LoRA ang 30-hakbang na SDXL render sa 4 na hakbang lang. Alamin ang bilang ng hakbang, ang CFG na dapat gamitin, ang sampler, at kung paano ito pagsamahin sa paborito mong checkpoints at style LoRAs.
Ni Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Gawa sa Japan
|
© 2026