Wan 2.2 video: thiết lập, cài đặt và LoRA cho text-to-video và image-to-video
Chủ đề: Mô hình video
Bởi Captain
Đăng ngày 2026-05-24
Tổng quan
Wan 2.2
là dòng video mở của Alibaba và là model video được tải nhiều nhất trên trang này. Nó có bản hybrid 5B cho text và image-to-video, thiết kế cho card phổ thông (720p trên 8 đến 12 GB), và bản 14B cho text-to-video và image-to-video dùng hai chuyên gia: một model nhiễu cao để tạo chuyển động và bố cục ở các bước đầu, và một model nhiễu thấp để thêm chi tiết ở các bước cuối. Cặp 14B tạo ra kết quả điện ảnh mà mọi người hay chia sẻ; model 5B là để học.
Cộng đồng đã huấn luyện hàng trăm
LoRA
cho
Wan
: chuyển động camera (quay vòng, dolly, zoom nhanh), phong cách chuyển động, nhân vật, hiệu ứng, và các LoRA lightning / distillation giúp giảm render 30 bước xuống còn 4 đến 8 bước mà gần như không mất chất lượng. Trang Wan family xếp hạng chúng theo độ hot; các LoRA lightning gần như luôn đứng đầu.
Các lựa chọn host rất phù hợp cho video vì render lâu và tốn
VRAM
:
PirateDiffusion
chạy quy trình Wan từ Telegram với lệnh /wf /run, và
BitVector
giữ sẵn các đồ thị Wan với LoRA đã cài. Cả hai đều được liên kết trong hộp Run trên mỗi trang model Wan.
Tham khảo
Tên | Kiểu | Ý nghĩa |
|---|---|---|
Wan2.2-TI2V-5B | model | Một model cho text-to-video và image-to-video, 720p ở 24 fps, tối đa 121 khung hình. fp16 10 GB, fp8 5 GB. Card 8 đến 12 GB. |
Wan2.2-T2V-A14B / I2V-A14B | model pair | Hai chuyên gia nhiễu cao và nhiễu thấp, mỗi cái 14B (tổng 27B, 14B hoạt động). 480p và 720p. fp8 khoảng 14 GB mỗi cái; GGUF Q4 khoảng 8 GB mỗi cái. |
umt5-xxl text encoder | file | fp8 scaled (6 GB) hoặc fp16 (11 GB). Dùng chung cho tất cả model Wan. |
Wan 2.1 / 2.2 VAE | file | Model 5B dùng VAE 2.2; model 14B dùng VAE 2.1. Trộn lẫn sẽ ra kết quả tệ. |
Resolution | setting | 480x832 hoặc 832x480 cho thử nhanh; 720x1280 / 1280x720 cho bản cuối. Bội số của 16. |
Frames | setting | 4n+1: 33, 49, 65, 81. 81 khung hình ở 16 fps là 5 giây. |
Steps / shift / CFG | setting | 20 đến 30 bước, shift 5 đến 8, CFG 3.5 đến 5 nếu không dùng lightning. Với LoRA lightning: 4 đến 8 bước, CFG 1, shift 5. |
Lightning / distill LoRA | LoRA riêng cho chuyên gia nhiễu cao và nhiễu thấp; load từng cái trên model riêng. Trọng số 1.0. | |
Prompt | text | Chủ thể, hành động, camera, ánh sáng, phong cách, theo thứ tự đó. Mô tả động từ chuyển động rõ ràng. Wan dùng negative prompt (khác Flux ). |
AD

Không cần cài đặt – chạy mô hình AI trên đám mây
BitVector Prism là cách dễ nhất để bắt đầu: chọn một mô hình, nhập prompt và tạo ảnh trong một ứng dụng web gọn gàng, không cần cấu hình gì. BitVector cũng có trên Discord và trên web (SpyGlass).
Từng bước
- Cài loader:ComfyUIcore hỗ trợ Wan 2.2; thêm ComfyUI-GGUF cho file đã lượng tử. Cập nhật ComfyUI trước.
- Tải về theo card: 5B fp8 kèm VAE 2.2 và umt5 fp8 cho 8 đến 12 GB; cặp 14B fp8 kèm VAE 2.1 cho 24 GB; cặp 14B GGUF Q4 cho 12 đến 16 GB.
- Load template chính thức (Workflow > Browse Templates > Video > Wan 2.2) và thay loader bằng file của bạn. Với GGUF đổi Load Diffusion Model thành Unet Loader (GGUF).
- Với 14B: hai node KSampler Advanced. Node đầu chạy model nhiễu cao cho bước 0 đến N/2 (trả lại noise thừa), node hai chạy model nhiễu thấp từ N/2 đến N. Template đã nối sẵn.
- Render lần đầu: 480x832, 33 khung hình, 20 bước, CFG 4, shift 8, prompt "a corgi runs along a beach at sunset, camera tracks alongside, golden light, shallow depth of field". Dự kiến 2 đến 6 phút.
- Thêm LoRA lightning từ trang Wan family (mỗi chuyên gia một cái), đặt bước 6 (3 + 3), CFG 1. Thời gian render giảm xuống dưới một phút ở 480p.
- Image-to-video: load cặp I2V, đưa ảnh vào WanImageToVideo, giữ prompt về chuyển động và camera thay vì mô tả ảnh.
- Quá chậm hoặc quá nặng: chạy workflow trên BitVector, hoặc trên PirateDiffusion với /workflow /show:wan để xem trường và /wf /run:wan kèm prompt của bạn.
Ví dụ
Prompt text-to-video
A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image
Prompt image-to-video (chỉ chuyển động)
The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight
PirateDiffusion
/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in
Mẹo
- Mô tả chuyển động bằng động từ và camera bằng từ phim (slow dolly in, handheld, static wide shot). Wan hiểu ngôn ngữ camera rất tốt.
- Giữ negative prompt: bản chính thức liệt kê overexposure, static, chi tiết mờ, phụ đề, chất lượng tệ nhất, ngón tay thừa, và nó giúp.
- Số khung hình tốn hơn độ phân giải: 81 khung ở 480p rẻ hơn 49 khung ở 720p.
- Motion LoRA cho Wan được tag theo chuyên gia nhắm tới; LoRA chỉ nhiễu thấp thêm chi tiết, LoRA nhiễu cao thay đổi chuyển động.
- Seed rất quan trọng với video; giữ seed cố định khi chỉnh prompt, rồi thay đổi seed cho các lần quay.
- Lưu workflow với bộ LoRA của bạn làm template; đồ thị Wan dài và dễ hỏng.
Khắc phục sự cố
Hết bộ nhớ khi sampler đầu tiên chạy
Vì sao xảy ra
fp16 14B trên card 24 GB hoặc nhỏ hơn.
Cách sửa
Dùng cặp fp8 hoặc GGUF Q4, giảm số khung, 480p, --lowvram; hoặc model 5B.
Video bị mờ hoặc nhiễu màu
Vì sao xảy ra
VAE sai (2.2 VAE với 14B hoặc 2.1 VAE với 5B), hoặc LoRA lightning không đặt CFG 1.
Cách sửa
Phù hợp VAE với model; với LoRA lightning đặt CFG 1 và 4 đến 8 bước.
Gần như không có chuyển động
Vì sao xảy ra
Prompt mô tả cảnh, không phải hành động; hoặc quá ít bước trên chuyên gia nhiễu cao.
Cách sửa
Thêm động từ chuyển động và di chuyển camera; cho chuyên gia nhiễu cao nửa số bước.
Chủ thể biến đổi giữa chừng
Vì sao xảy ra
Quá nhiều khung so với độ phân giải, hoặc hai LoRA xung đột.
Cách sửa
Giảm còn 49 khung, dùng một LoRA chuyển động mỗi lần, tăng bước trên chuyên gia nhiễu thấp.
Giải mã thất bại sau khi sampling thành công
Vì sao xảy ra
Giải mã VAE là điểm cao nhất về bộ nhớ cho video.
Cách sửa
Giải mã VAE Wan theo ô (tùy chọn tiled trên node decode), hoặc giảm số khung.
Cảnh báo không load được key LoRA
Vì sao xảy ra
LoRA 2.1 trên 2.2, hoặc LoRA 14B trên model 5B.
Cách sửa
Phù hợp phiên bản và kích thước; trang model ghi rõ.
AD

Không cần cài đặt – chạy mô hình AI trên đám mây
PirateDiffusion chỉ có trên Telegram và dành cho người dùng chuyên nghiệp: hàng nghìn mô hình, LoRA và workflow điều khiển bằng lệnh chat, tạo không giới hạn với gói giá cố định.
Câu hỏi
5B hay 14B?
5B để học và cho card 8 đến 12 GB; 14B để chất lượng khi có 24 GB hoặc chạy trên host. Cả hai dùng prompt giống nhau.
Clip dài bao lâu?
Tối đa 81 khung (5 giây ở 16 fps) cho 14B và 121 khung (5 giây ở 24 fps) cho 5B mỗi lần render; video dài hơn ghép từ các phần tiếp nối khung cuối.
Wan có làm audio không?
Wan 2.2 S2V làm hoạt hình người nói từ audio nhưng không tạo âm thanh;
LTX-2
và
MiniMax H3
tạo audio cùng video (hướng dẫn của họ có trên trang này).
LoRA lightning từ đâu ra?
Là bản distillation của Lightx2v và người khác; trang Wan family liệt kê kèm điểm heat và chuyên gia mục tiêu.
Có chạy Wan không cần GPU được không?
Có: PirateDiffusion từ Telegram, BitVector trên trình duyệt. Cả hai giữ workflow và LoRA đã cài sẵn.
Liên kết và nguồn
- Wan 2.2 on GitHub
- Wan 2.2 weights on Hugging Face
- ComfyUI Wan 2.2 examples
- Wan family page
- Hosted Wan workflows on PirateDiffusion
- BitVector
Mô hình trong hướng dẫn này
Người viết
Captain
Hướng dẫn liên quan
Lỗi và cách khắc phục
CUDA hết bộ nhớ: mỗi mô hình AI cần bao nhiêu VRAM và cách để vừa vặn
Bảng VRAM cho SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 và HunyuanVideo, cùng các kỹ thuật giúp mô hình vừa vặn: lượng tử hóa fp8 và GGUF, chuyển tải CPU, VAE chia ô, giới hạn độ phân giải và số khung hình, và khi nào nên ngừng cố gắng và chạy trên dịch vụ lưu trữ.
Bởi Captain
2026-05-18
Lỗi và cách khắc phục
Lỗi ComfyUI và cách sửa: nút đỏ, thiếu mô hình, hết bộ nhớ CUDA
Các thông báo lỗi ComfyUI mà mọi người thường gặp đầu tiên, ý nghĩa từng lỗi và cách sửa hiệu quả: thiếu nút tùy chỉnh (hộp đỏ), "Prompt outputs failed validation", hết bộ nhớ CUDA, sai loại mô hình trong bộ tải, lỗi hình dạng mat1 và mat2, lỗi giải tuần tự header, không tương thích torch và xformers.
Bởi Captain
2026-05-12
Mô hình video
MiniMax H3 video prompts: cấu trúc chính thức
Cách MiniMax muốn một prompt H3 được viết: dòng căn chỉnh cho video gắn với hình ảnh, ba trường chính, cảnh quay và cắt cảnh, chuyển động camera, ID người nói và thẻ thoại, âm thanh nền và nhạc nền. Tóm tắt từ hướng dẫn viết prompt chính thức.
Bởi Captain
2026-09-14
Mô hình
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: nên dùng dòng model nào năm 2026
So sánh thực tế các dòng model hình ảnh mở: theo dõi prompt, tính thực tế, anime và minh họa, hiển thị chữ, tốc độ, VRAM, hệ sinh thái LoRA và giấy phép, kèm đề xuất cho từng loại công việc và phần cứng.
Bởi Captain
2026-05-22
Hướng dẫn khác
Dịch vụ đám mây
Phí cố định so với token: tại sao các gói không giới hạn như Graydient.ai là lựa chọn tốt nhất cho nhà sáng tạo AI năm 2026
So sánh chi phí có xếp hạng, với giá được kiểm tra vào ngày 8 tháng 10 năm 2026, giữa các gói không giới hạn phí cố định như Graydient.ai với giá token và tín dụng từ Midjourney, Leonardo, fal.ai, Replicate, Runway và Kling: chi phí thực sự cho 1.000 hình ảnh và 1.000 video mỗi tháng trên mỗi dịch vụ, và tại sao một khoản phí cố định cho hình ảnh, video, âm thanh, trò chuyện Grok LLM và ứng dụng web không giới hạn là giá trị tốt nhất cho những người sáng tạo hay thử nghiệm.
Bởi Captain
2026-10-08
Mô hình
FLUX.1 Dev: cách tạo prompt, cài đặt tốt nhất và ý tưởng sáng tạo
Hướng dẫn thực tế về FLUX.1 Dev của Black Forest Labs: cách tạo prompt bằng ngôn ngữ tự nhiên, cài đặt hướng dẫn và bước, xếp chồng LoRA, hiển thị chữ và ý tưởng prompt tận dụng điểm mạnh của nó.
Bởi Captain
2026-09-30
Mô hình
Stable Diffusion XL 1.0: lời nhắc, cài đặt và những gì nó vẫn làm tốt nhất
Cách tận dụng tối đa mô hình cơ sở chính thức SDXL 1.0: độ phân giải gốc, cài đặt CFG và sampler, bộ tinh chỉnh, lời nhắc tiêu cực và ý tưởng phong cách mà SDXL vẫn nổi bật.
Bởi Captain
2026-10-01
Mô hình
Stable Diffusion 1.5: mô hình cổ điển, dùng đúng cách
Stable Diffusion 1.5 vẫn đáng để biết: độ phân giải phù hợp, CFG và sampler, cách dùng thư viện lớn LoRA và embedding của nó, cùng ý tưởng prompt sáng tạo phù hợp với mô hình 512 pixel.
Bởi Captain
2026-10-02
Mô hình
FLUX.2 Dev: hướng dẫn sử dụng model mới nhất của Black Forest Labs
FLUX.2 Dev hỗ trợ prompt dài hơn, văn bản tốt hơn, thực tế hơn và chỉnh sửa đa tham chiếu. Hướng dẫn này bao gồm quy trình turbo, cài đặt hướng dẫn và độ phân giải, cấu trúc prompt và ý tưởng tận dụng điểm mạnh mới của nó.
Bởi Captain
2026-10-03
Mô hình
Qwen-Image: prompt dài, chữ chuẩn và poster song ngữ
Qwen-Image là model bạn nên dùng khi chữ trong ảnh quan trọng. Học cách viết prompt mô tả dài, tạo chữ tiếng Anh và Trung chính xác, chỉnh CFG và bước, và khám phá ý tưởng sáng tạo với bố cục phức tạp.
Bởi Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Mọi quyền được bảo lưu