Model
Trends
.ai
Model
Trends
.ai
en iyi açık kaynak yapay zeka modelleri

Yeni başlayanlar için AI video üretimi: görüntüden videoya, metinden videoya ve Wan, LTX-2 ile H3 ile ilk klip

Konu: Video modelleri
Lookout tarafından
2026-04-29 tarihinde yayımlandı
Açık video modelleriyle ilk hafta: metinden videoya ile görüntüden videoya arasındaki fark ve neden ikincisiyle başlamalı, öğrenmeye değer üç model ailesi (Wan 2.2, LTX-2, MiniMax H3), işe yarayan kare sayıları ve çözünürlükler, hareket komutu nasıl yazılır, 16 veya 24 GB kart ile bulut arasındaki farklar ve beş saniyelik klipleri nasıl daha uzun hale getireceğin.

Genel bakış

Video modelleri, zaman ekseni eklenmiş görüntü modelleridir: aynı gürültü giderme döngüsü bir kerede bir kare bloğunda çalışır, yani promptlar, tohumlar ve gürültü giderme hakkında bildiklerin geçerlidir, maliyetler ise kare sayısıyla çarpılır. Yeni başlayanlar için pratik sonuçlar üçtür. Görüntüden videoya (I2V) ile başla, çünkü görüntü modelinden iyi bir durağan kare kompozisyonu ve stili sabitler, video modeline sadece hareket kalır.
Klipleri kısa tut (yaklaşık beş saniye), çünkü modeller bu uzunlukta eğitildi.
Ve büyük modelleri çalıştırmak için 24 GB kartın yoksa bulutu kullanmayı bekle.

Başvuru

Ad
Tür
Ne olduğu
I2V (image to video)
mode
Durağan bir görüntüyü canlandır. En iyi ilk mod: kompozisyon zaten doğru; prompt sadece hareketi anlatır.
T2V (text to video)
mode
Sadece prompt ile. Daha fazla çeşit, daha az kontrol; fikirler ve B-roll için kullan.
FLF2V / first-last frame
mode
İki ana kare; model aradaki hareketi doldurur. Kontrollü geçişler.
Frames and fps
setting
Wan
: 16 fps’de 81 kare (5 s);
LTX-2
: 24-25 fps’de 97-121 kare; H3: ~24 fps’de 145 kare. Bellek kare sayısıyla artar.
Resolution
setting
Wan 2.2
: 832x480 veya 480x832 (hızlı), 1280x720 (24 GB+); LTX-2 32 GB ile 1080p+ kadar. İnsanlar için portre, sahneler için manzara.
Motion prompt
prompt
Bir konu hareketi ve bir kamera hareketi: "pencereye döner ve gülümser; yavaş yakınlaşma". Görüntüde zaten olan sahne detaylarını listelemekten kaçın.
Steps / CFG / shift
setting
Wan 2.2 14B: 20 adım, uzmanlar arasında 10/10 bölünmüş,
CFG
3.5, shift 5; 5B: 20-30 adım, CFG 5; LTX-2: kendi programıyla 25-30 adım; damıtılmış
LoRA
’lar (lightx2v) Wan’ı CFG 1’de 4-8 adıma indirir.
Motion LoRAs
file
Kamera hareketleri, danslar, jestler, fizik; 5B/14B ve uzmana göre eşleştirilmiş. Sayfalarda hedef belirtilir.
Interpolation and upscale
post
RIFE veya FILM ile 32-60 fps; çözünürlük için kare bazlı ESRGAN veya SeedVR.
AD
GPU olmadan ilk klibin
BitVector Prism, bu rehberdeki Wan modelleriyle durağan görüntüyü tarayıcıda canlandırır: görüntüyü yükle, hareket cümlesini yaz, klibi indir. Kurulum yok, dizüstü bilgisayardan çalışır.

Adım adım

  1. Bir durağan kare yap veya seç: 1024x1024 veya 832x1216 çözünürlükte, net bir konu ve basit arka plan. Yüzler, karenin onda birinden büyükse daha iyi animasyon olur.
  2. Bu sitede Wan 2.2 I2V model sayfasını aç, örnek hareket promptu kalıbını kopyala ve Çalıştır düğmesine bas (
    PirateDiffusion
    : görüntüne /workflow komutuyla yanıt ver;
    BitVector
    : yükle ve modeli seç).
  3. Konu için bir cümle, kamera için bir cümle hareket promptu yaz. Kıyafet, renk veya ışık hakkında bir şey yazma; görüntüde zaten var.
  4. 832x480 (manzara) veya 480x832 (portre), 81 kare, varsayılan adımlarla üret. Tüm klibi izle; keskinlik değil hareketi değerlendir.
  5. Sadece hareket promptunda değişiklik yap: daha yavaş fiiller ("yavaşça", "nazikçe") sallanmayı azaltır; tek bir kamera talimatı sıçramaları önler.
  6. Yerelde, 16 GB kartla: Wan 2.2 5B fp8 veya GGUF, 832x480, 49-81 kare, metin kodlayıcı CPU’da. 24 GB ile: 14B fp8 480p’de, kodlayıcı devre dışı iken 720p’de.
    VRAM for AI video
    rehberine bak.
  7. Daha uzun parçalar: birinci klibin son karesini ikinci klibin başlangıç görüntüsü yap, hareket promptunu devam ettir; bir editörde birleştir; sonunda 30 fps’ye ara kare ekle ve çözünürlüğü yükselt.
  8. Ses ekle: LTX-2 ve H3 kliple senkronize ses üretir; Wan için müzik veya efektleri editörde ekle.

Örnekler

I2V için hareket promptu

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

PirateDiffusion iş akışı komutu

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B 16 GB’de

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

İpuçları

  • Hareket fiilleri sıfatlardan daha önemli: "döner, yürür, kaldırır, döker, el sallar" her biri farklı ve güvenilir hareket üretir; "güzel sinematik" hiçbir şey üretmez.
  • Klip başına bir kamera hareketi: yakınlaşma, uzaklaşma, sola pan, yörünge. İki hareket titremeye yol açar.
  • Portre durağanlar yüzleri daha iyi canlandırır; manzara durağanlar ortamları daha iyi canlandırır.
  • Wan yüksek-gürültülü uzman LoRA’ları hareketi şekillendirir; düşük-gürültülüler detayı. Birçok paket ikisini de içerir; her birini kendi uzmanına yükle.
  • Damıtılmış LoRA’lar (lightx2v, FastWan) Wan’ı 20 adımdan 4-6’ya indirir, CFG 1’de kalite kaybı azdır; model sayfalarında listelenir.
  • 4090’da Wan 14B için klip başına 3-10 dakika, LTX-2 için yaklaşık 90 saniye bekle; bulut çoğu klibi bir-iki dakikada döndürür.

Sorun giderme

Klip hafif titreyen durağan kare

Neden olur
Promptta hareket fiili yok veya statik LoRA ağırlığı çok yüksek.

Nasıl düzeltilir
Bir konu hareketi ve bir kamera hareketi ekle; LoRA’ları 0.7’ye düşür.

Yüz eriyor veya kimlik değiştiriyor

Neden olur
Yüz çok küçük, kare sayısı çok fazla veya detaylı yüzde 480p.

Nasıl düzeltilir
Daha yakın kırp, 49-61 kare kullan veya bulutta 720p; kare başına yüz detaylandırıcı son çare.

Kamera sıçraması veya sahne kesmesi

Neden olur
İki kamera talimatı veya promptta "cut to" kelimeleri.

Nasıl düzeltilir
Tek kamera hareketi; "jump cut" ifadesini negatif prompta koy.

720p’de bellek yetersizliği

Neden olur
Kare sayısı çarpı çözünürlük
VRAM
’i aşıyor.

Nasıl düzeltilir
480p’ye veya daha az kareye düş, metin kodlayıcıyı devre dışı bırak; VRAM for AI video rehberine bak.

Hareket LoRA’sı işe yaramıyor

Neden olur
Yanlış uzmana veya model boyutuna yüklendi.

Nasıl düzeltilir
Model sayfasından 5B/14B ve yüksek/düşük gürültüyü kontrol et; tetik kelimesiyle doğru şekilde yükle.

AD
PirateDiffusion
Telegram’dan Wan 2.2 14B, LTX-2 ve H3
PirateDiffusion büyük video modellerini sunucu GPU’larında çalıştırır: herhangi bir görüntüye iş akışı komutuyla yanıt ver, klip sohbette gelir. Sabit fiyatla sınırsız üretim, 24 GB karta gerek yok.

Sorular

Hangi video modeliyle başlamalıyım?

Wan 2.2 I2V: affedici, iyi belgelenmiş, en çok LoRA’ya sahip. Wan başlangıç rehberi tam kurulumu içerir.

8 GB kartla yapabilir miyim?

Kısa 480p klipler
Wan 2.1
1.3B veya Wan 2.2 5B GGUF ile, yavaşça. Gerçekçi olarak bulutta başla.

Ses nasıl elde edilir?

LTX-2 ve
MiniMax H3
senkronize ses üretir; Mark White’ın H3 komut rehberleri diyalog ve efektleri açıklar.

Klip ne kadar uzun olabilir?

Yaklaşık beş saniye doğal uzunluk. Daha uzun parçalar zincirlenmiş kliplerdir; tek geçişte altı-sekiz saniyeden sonra kalite düşer.

En yeni ticari modeller (Veo, Kling, Wan 3.0) yerelde var mı?

Hayır; sadece API üzerinden. Bu rehberdeki her şey açık ağırlıklı ve yerelde veya bulut ortaklarında çalışır.

Bağlantılar ve kaynaklar

Bu rehberdeki modeller

Yazan
Lookout

İlgili rehberler

Video modelleri
Wan 2.2 video: metinden videoya ve görüntüden videoya kurulum, ayarlar ve LoRA'lar
Wan 2.2'den ilk sonuçları almak: hangi model boyutu seçilmeli (5B mi yoksa 14B mi), yüksek-gürültülü / düşük-gürültülü uzman çifti, işe yarayan çözünürlük ve kare sayıları, renderları dört adıma indiren lightning LoRA'lar, hareket için prompt yapısı ve kart küçükse nasıl barındırılan şekilde çalıştırılır.
Captain tarafından
2026-05-24
Video modelleri
AI video için ne kadar VRAM gerekir? Wan 2.2, HunyuanVideo 1.5 ve LTX-2 GPU boyutuna göre (2026)
Wan 2.2, HunyuanVideo 1.5 ve LTX-2'yi yerel olarak çalıştırmak için gereken VRAM, GPU boyutu, çözünürlük ve klip uzunluğuna göre: 8, 12-16, 24, 32 ve 48+ GB kartların yapabilecekleri, neden video görüntüden yüz kat daha pahalı, 24 GB'de 14B modelleri sığdıran offloading hileleri, gerçekçi üretim süreleri ve kiralamanın satın almaya ne zaman üstün geldiği.
P.I. Panda tarafından
2026-10-06
Prompt yazımı
MiniMax H3 Yönlendirme: metinden videoya, resimden videoya, referans video ve ses
MiniMax H3'ü sohbet komutuyla nasıl yönlendirirsin: metinden videoya için KİM + NEREDE + EYLEM + KAMERA + SES formülü, resimden videoya ile hareketsiz bir görüntüyü canlandırma, referans modunda her referans resme bir görev verme ve mırıldanma yerine temiz diyalog alma. Kopyala ve dene promptlar ve yazarın PDF'si ile.
Mark White tarafından
2026-09-20
Video modelleri
MiniMax H3 video istemleri: resmi yapı
MiniMax’in H3 isteminin nasıl yazılmasını istediği: görüntüye bağlı videolar için hizalama satırı, üç temel alan, çekimler ve kesmeler, kamera hareketleri, konuşmacı kimlikleri ve diyalog etiketleri, ses ortamı ve müzik. Resmi istem yazma rehberinden özetlenmiştir.
Captain tarafından
2026-09-14
Modeller
LTX 2.3 Crisp Enhance: daha keskin, daha sinematik video detayı
vrgamedevgirl'in LTX 2.3 için Crisp Enhance LoRA'sı, oluşturulan videoda keskinliği, mikro detayı ve kontrastı artırıyor. Bunu Soft Enhance kardeşiyle, ağırlıklarla ve prompt fikirleriyle nasıl dengeleyeceğini öğren.
Captain tarafından
2026-10-03
Hatalar ve çözümler
AI görüntü ve video için GPU ve VRAM rehberi: her modelin ihtiyacı ve ne alınmalı (veya alınmamalı)
Her model ailesinin kullanılabilir hızda gerçekten ne kadar grafik belleğe ihtiyacı var (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), fp8 ve GGUF kuantizasyonun ne sağladığı, neden sistem RAM ve disk de önemli, 8 ila 32 GB arasında kartların sıralaması, Mac ve AMD notları ve kiralamanın satın almadan daha ucuz olduğu nokta.
Quartermaster tarafından
2026-01-07

Diğer rehberler

Modeller
FLUX.1 Dev: nasıl prompt verilir, en iyi ayarlar ve yaratıcı fikirler
Black Forest Labs tarafından geliştirilen FLUX.1 Dev için pratik bir rehber: doğal dilde prompt verme, rehberlik ve adım ayarları, LoRA yığma, metin işleme ve modelin güçlü yanlarını kullanan prompt fikirleri.
Captain tarafından
2026-09-30
Modeller
Stable Diffusion XL 1.0: istemler, ayarlar ve hala en iyi yaptığı şeyler
Resmi SDXL 1.0 temel modelinden en iyi şekilde nasıl yararlanılır: yerel çözünürlükler, CFG ve örnekleyici ayarları, rafine edici, negatif istemler ve SDXL'nin hala parladığı stil fikirleri.
Captain tarafından
2026-10-01
Modeller
Stable Diffusion 1.5: klasik model, doğru şekilde yönlendirilmiş
Stable Diffusion 1.5 hâlâ bilinmeye değer: doğru çözünürlük, CFG ve sampler, devasa LoRA ve embedding kütüphanesini nasıl kullanacağın ve 512 piksellik modele uygun yaratıcı prompt fikirleri.
Captain tarafından
2026-10-02
Modeller
FLUX.2 Dev: Black Forest Labs'in en yeni modelini yönlendirme
FLUX.2 Dev, daha uzun promptlar, daha iyi metin, daha güçlü gerçekçilik ve çoklu referans düzenleme sunuyor. Bu rehber, turbo iş akışını, rehberlik ve çözünürlük ayarlarını, prompt yapısını ve yeni özelliklerini kullanma fikirlerini kapsıyor.
Captain tarafından
2026-10-03
Modeller
Qwen-Image: uzun promptlar, mükemmel metin ve iki dilli posterler
Qwen-Image, resimdeki kelimelerin önemli olduğu durumlarda kullanacağın model. Uzun ve detaylı promptlar nasıl yazılır, İngilizce ve Çince metinler nasıl doğru şekilde oluşturulur, CFG ve adımlar nasıl ayarlanır, ayrıca yoğun düzen içeren yaratıcı fikirler nasıl keşfedilir öğren.
Captain tarafından
2026-09-29
Modeller
SDXL-Lightning: Herhangi bir SDXL kontrol noktasında dört adımlı üretim
ByteDance'in SDXL-Lightning LoRA'sı, 30 adımlı bir SDXL renderını 4 adıma indiriyor. Adım sayılarını, kullanman gereken CFG'yi, örnekleyiciyi ve bunu favori kontrol noktaların ve stil LoRA'larınla nasıl birleştireceğini öğren.
Captain tarafından
2026-09-30