Model
Trends
.ai
Model
Trends
.ai
en iyi açık kaynak yapay zeka modelleri

Üretken AI görüntü modelleri nasıl çalışır: difüzyon, latentler ve metin kodlayıcıları basitçe açıklandı

Konu: Modeller
Quartermaster tarafından
2025-08-28 tarihinde yayımlandı
Share

Genel bakış

Şu anda kullanılan her görüntü modeli bir gürültü gidericidir. Eğitim sırasında, her görüntüye artan miktarda rastgele gürültü eklenmiş milyonlarca resim ve her resmin başlığı gösterilir ve model eklenen gürültüyü tahmin etmeyi öğrenir. Üretim sırasında süreç tersine işler: tamamen gürültüden başlanır, modele prompt verilir ve içindeki gürültünün ne olduğu sorulur, biraz gürültü çıkarılır, yirmi ya da otuz kez tekrarlanır ve başlığa uyan bir görüntü ortaya çıkar. İşte tüm hile bu; "difüzyon" bu yavaş yavaş gürültü ekleyip çıkarma sürecinin adıdır.
Tam boyutlu pikseller üzerinde çalışmak çok yavaş olurdu, bu yüzden Stable Diffusion 1.x'ten beri gürültü giderme sıkıştırılmış bir alan olan latentte yapılır. Ayrı küçük bir ağ olan VAE, 1024x1024 görüntüyü 128x128 sayı ızgarasına sıkıştırır ve sonunda tekrar açar. Gürültü giderici (
SD 1.5
ve
SDXL
'de U-Net;
Flux
,
Qwen
,
Z-Image
ve video modellerinde bir transformer) pikselleri hiç görmez. Bu yüzden görüntü boyutlarının 8 veya 16'nın katları olması gerekir ve VAE'nin sonundaki decode adımı kendi başına belleği tüketebilir.
Prompt metin kodlayıcıdan geçer, bu da kelimeleri gürültü gidericinin koşullandırabileceği sayı listesine dönüştürür. SD 1.5, 77 token sınırı olan tek bir CLIP kodlayıcı kullanır, SDXL iki tane kullanır, Flux büyük bir T5 dil modeli ekler ve 2025 ile 2026 modelleri (
Qwen Image
,
FLUX.2
, Z-Image,
Wan 2.2
) tam LLM'leri kodlayıcı olarak kullanır. Bu tek değişiklik, promptların nasıl yazıldığı farkının çoğunu açıklar: CLIP tabanlı modeller için etiket listeleri, LLM tabanlı modeller için doğal cümleler. Son olarak, bir
LoRA
, gürültü giderici ağırlıklarına (bazen kodlayıcıya da) yapılan küçük düzeltmeler setidir; yeni bilgi eklemez, temel modelin zaten öğrendiğini yeniden ağırlıklandırır.

Başvuru

Ad
Tür
Ne olduğu
Denoiser (U-Net / DiT)
component
Ana ağ. Prompt ve adıma göre latentteki gürültüyü tahmin eder. SD 1.5 ve SDXL'de U-Net; Flux, FLUX.2, Qwen, Z-Image,
Wan
,
LTX
, H3'te difüzyon transformer (DiT / MMDiT).
VAE
component
Görüntüleri latentlere sıkıştırır ve geri açar. Yanlış veya eksik VAE soluk ya da morumsu görüntüler verir. Flux ve yeni aileler kendi 16 kanallı VAE'lerini getirir.
Text encoder
component
CLIP-L, CLIP-G, T5-XXL veya bir LLM (Qwen2.5-VL, Mistral, Gemma). Promptun nasıl anlaşıldığını ve ne kadar uzun olabileceğini belirler.
Scheduler /
sampler
setting
Her adımda ne kadar gürültü çıkarılacağını ve kullanılan sayısal yöntemi belirler. Doku ve yakınsama hızını değiştirir, içeriği değil.
Steps
setting
Kaç tane gürültü giderme yinelemesi yapılacağı. Distile modeller (Turbo, Lightning, Schnell, Klein) 1 ila 8 adımda çalışacak şekilde eğitilir.
CFG
/ guidance
setting
Sınıflandırıcı-şartsız rehberlik: prompt koşullu tahminin koşulsuz olandan ne kadar uzaklaştırıldığı. Çok yüksek olursa renkler yanar; rehberlik-distile modeller (
Flux dev
) tek bir rehberlik değeri alır.
Latent size
setting
Görüntü boyutu 8'e (SD) veya 16'ya (Flux, Wan) bölünür. Modeller, eğitildikleri çözünürlüğe yakın boyutlarda en iyi sonucu verir.
Flow matching
training method
Klasik difüzyon gürültü programlarının 2024 sonrası yerine geçen yöntem (Flux, SD3, Wan, Z-Image). Aynı fikir, gürültüden görüntüye daha düz yol, daha az adım gerekir.
AD
Teoriyi pratikte gör, kurulum yok
BitVector Prism, SDXL, Flux ve Qwen modelleri arasında tek bir web uygulamasında geçiş yapmanı sağlar, böylece aynı promptu üç mimaride çalıştırıp burada anlatılan farkları bir dakikada görebilirsin.

Adım adım

  1. Gürültü girişi:
    sampler
    , seed'den rastgele sayılardan oluşan bir latent ızgarası oluşturur. Seed değişirse, sonraki her şey değişir.
  2. Prompt girişi: metin kodlayıcı kelimelerini gömülere dönüştürür. CLIP modellerde 77 token sonrası parçalanır ya da atılır; LLM tabanlı modellerde paragraf sorun olmaz.
  3. Her adım: SD ve SDXL'de gürültü giderici iki kez çalıştırılır (prompt ile ve promptsuz); fark CFG ile ölçeklenir ve latent prompta yönlendirilir. Flux dev tek seferde rehberlik değeriyle çalışır.
  4. Sampler, programına göre (Karras, üstel, basit, beta) tahmin edilen gürültüyü çıkarır. Son adımda latent temiz ve sıkıştırılmış bir görüntüdür.
  5. Decode: VAE latent'i piksellere açar. Tiled VAE decode, bu adımın büyük boyutlarda 8 GB kart belleğini aşabilmesi yüzündendir.
  6. İsteğe bağlı ikinci geçişler: hires-fix sonucu biraz yeniden gürültüler ve daha büyük boyutta gürültü giderir;
    img2img
    tamamen gürültü yerine var olan bir görüntüden başlar; inpainting değişikliği maske ile sınırlar.
  7. Video modeller latent'e zaman ekseni ekler (5 saniyelik klip tek bir 3D latent) ve diğerleriyle aynı döngüyü kullanır, bu yüzden on kat daha fazla belleğe ihtiyaç duyarlar.

Örnekler

Aynı prompt üç mimaride

SD 1.5 (CLIP, 77 tokens): "portrait of an old sailor, grey beard, wool cap, harbour background, film photo"
SDXL (two CLIPs): same words, 1024x1024, CFG 6, 28 steps
Flux dev (CLIP-L + T5): "A weathered old sailor with a grey beard and a navy wool cap stands at a harbour railing at dusk; shallow depth of field, Kodak Portra look." guidance 3.5, 24 steps

ComfyUI düğümleri bileşenlere eşlendi

Load Checkpoint -> MODEL (denoiser), CLIP (text encoder), VAE
CLIP Text Encode (prompt) -> KSampler (sampler, steps, CFG, seed) -> VAE Decode -> Save Image

İpuçları

  • Bir model eğitim verisinde olmayanı çizemaz. Bu yüzden anime fine-tunları binlerce karakteri bilir, fotoğraf modelleri bilmez ve hemen her boşluk için bir LoRA vardır.
  • Fine-tunlar (DreamShaper, Juggernaut,
    Illustrious
    , Pony) temel modelle aynı mimaridir, sadece ağırlıkları farklıdır; temel model için bir LoRA genellikle fine-tun üzerinde çalışır, çok farklı fine-tun (Pony) için çoğu zaman çalışmaz.
  • Distile modeller esnekliği hız için feda eder. SDXL Lightning 4 adımda taslaklar için iyidir; tam model 28 adımda final için daha iyidir.
  • Metin kodlayıcı genellikle en büyük dosyadır. T5-XXL fp16 ile Flux sadece kodlayıcı için 9 GB ister, bu yüzden fp8 ve GGUF sürümleri vardır.
  • Rehberlik distilasyonu (Flux dev) ve CFG aynı şey değildir. Flux dev'de 7 CFG kullanmak yanmış görüntüler verir; model sayfasındaki ayarları kullan.
  • Buradaki her şey bulut ortaklarında yereldeki gibi çalışır; fark sadece GPU sahibindedir.

Sorun giderme

Görüntüler gri, soluk veya morumsu çıkıyor

Neden olur
Eksik veya uyumsuz VAE ya da SDXL'de fp16 VAE taşması.

Nasıl düzeltilir
Aileye ait VAE'yi yükle; SDXL'de fp16-fix VAE kullan.

Uzun promptun bir kısmı göz ardı ediliyor

Neden olur
SD 1.5 ve SDXL'de CLIP token sınırı.

Nasıl düzeltilir
Önemli kelimeleri başa koy veya LLM kodlayıcılı Flux, Qwen ya da Z-Image modellerine geç.

Renkler yanıyor ve kontrast aşırı

Neden olur
Model için çok yüksek CFG veya rehberlik-distile modelde CFG kullanımı.

Nasıl düzeltilir
SDXL'de CFG'yi 5-7 arası düşür; Flux dev'de rehberliği 3-4, CFG'yi 1 yap.

Büyük boyutlarda döşeme veya çiftlenen nesneler

Neden olur
Latent eğitim çözünürlüğünden çok büyük; model kendini tekrar ediyor.

Nasıl düzeltilir
Yerel boyutta üret ve büyüt, ya da hires-fix ile 0.4 gürültü gider.

Sadece en sonda bellek tükeniyor

Neden olur
VAE decode adımı tam boyutta.

Nasıl düzeltilir
Tiled VAE decode kullan veya daha küçük çıktı boyutu ve ardından büyütücü kullan.

AD
PirateDiffusion
Tek GPU kümesinde tüm mimariler
PirateDiffusion, SD 1.5, SDXL, Flux, FLUX.2, Qwen, Z-Image ve video modellerini Telegram'da yan yana sunar, sabit fiyatla sınırsız üretim sağlar. VRAM hesapları veya VAE dosyaları aramana gerek yok.

Sorular

Model eğitim setindeki görüntüleri kopyalıyor mu?

Ağırlıkları saklar, görüntüleri değil ve eğitim resmi geri getiremez. Çok sık kullanılan eğitim görüntülerinin (ünlü tablolar, logolar) benzerleri çıkabilir, bu yüzden onları istememek iyi.

Fikir aynıysa neden yeni modeller daha fazla bellek istiyor?

Daha büyük gürültü gidericiler (Flux için 12 milyar parametre, SD 1.5 için 0.9), daha büyük metin kodlayıcılar ve daha büyük latentler. Nicelenmiş fp8 ve GGUF sürümleri bunları düşürür.

Checkpoint ile model arasındaki fark nedir?

Checkpoint
, modelin (gürültü giderici, genellikle kodlayıcı ve VAE ile birlikte) kaydedilmiş dosyasıdır. İnsanlar bu kelimeleri birbirinin yerine kullanır.

Aynı seed başka bilgisayarda neden farklı görüntü verir?

Farklı GPU, hassasiyet (fp16 vs bf16) veya sampler uygulaması; gürültü aynı ama hesaplama biraz farklı. Aynı makine, aynı ayarlar, aynı görüntü.

Daha fazla adım her zaman iyi midir?

Hayır. Çoğu sampler 25-30 adımda yakınsar; sonrası boşuna zaman harcamaktır. Distile modeller adım arttıkça kötüleşir.

Bağlantılar ve kaynaklar

Bu rehberdeki modeller

Yazan
Quartermaster

İlgili rehberler

Bulut hizmetleri
Yapay zeka ile görsel oluşturma: On dakikada ilk resmin
Tamamen yeni başlayanlar için sade bir başlangıç: model nedir, bir modeli çalıştırmanın üç yolu (web uygulaması, sohbet botu, kendi bilgisayarın), ilk prompt nasıl yazılır, ayarlar ne anlama gelir ve iyi sonucu şanslı olandan nasıl ayırırsın.
Captain tarafından
2025-08-14
Prompt yazımı
Adımlar, CFG, örnekleyiciler, zamanlayıcılar ve tohumlar: güvenli varsayılanlarla üretim ayarları açıklandı
Üretim panelindeki her ayarın neyi değiştirdiği, model ailesine göre işe yarayan değerler (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), bilinmesi gereken örnekleyiciler, neden distile modellerin sıradan kuralları bozduğu ve tohumların tek seferde bir şeyi değiştirmek için nasıl kullanıldığı.
Quartermaster tarafından
2025-11-19
Modeller
Checkpoint, LoRA, embedding ve ControlNet: hangi dosya ne işe yarar
Karşına çıkacak altı tür model dosyası, her birinin neyi değiştirdiği, ne kadar büyük olduğu, nereye konduğu ve ne zaman kullanıldığı: checkpointler ve fine-tunelar, LoRAlar ve onların LyCORIS kuzenleri, textual inversion embeddingleri, ControlNetler ve IP-Adapterlar, VAEler ve upscalerlar.
Quartermaster tarafından
2025-10-08
Modeller
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: 2026'da hangi model ailesi kullanılmalı
Açık görüntü model ailelerinin pratik karşılaştırması: prompt takibi, gerçekçilik, anime ve illüstrasyon, metin işleme, hız, VRAM, LoRA ekosistemi ve lisans, her iş ve donanım türü için önerilerle.
Captain tarafından
2026-05-22

Diğer rehberler

Bulut hizmetleri
Sabit ücret mi, token mı: Graydient.ai gibi sınırsız planlar 2026'da neden AI üreticileri için en iyi seçenek
8 Ekim 2026'da kontrol edilen fiyatlarla, Graydient.ai gibi sabit ücretli sınırsız planların, Midjourney, Leonardo, fal.ai, Replicate, Runway ve Kling'in token ve kredi fiyatlandırmasına karşı sıralı maliyet karşılaştırması: Her birinde ayda 1.000 görsel ve 1.000 video gerçekten neye mal oluyor ve neden sınırsız görsel, video, ses, Grok LLM sohbeti ve web uygulamaları için tek bir sabit ücret, sürekli üretenler için en iyi değer.
Captain tarafından
2026-10-08
Modeller
FLUX.1 Dev: nasıl prompt verilir, en iyi ayarlar ve yaratıcı fikirler
Black Forest Labs tarafından geliştirilen FLUX.1 Dev için pratik bir rehber: doğal dilde prompt verme, rehberlik ve adım ayarları, LoRA yığma, metin işleme ve modelin güçlü yanlarını kullanan prompt fikirleri.
Captain tarafından
2026-09-30
Modeller
Stable Diffusion XL 1.0: istemler, ayarlar ve hala en iyi yaptığı şeyler
Resmi SDXL 1.0 temel modelinden en iyi şekilde nasıl yararlanılır: yerel çözünürlükler, CFG ve örnekleyici ayarları, rafine edici, negatif istemler ve SDXL'nin hala parladığı stil fikirleri.
Captain tarafından
2026-10-01
Modeller
Stable Diffusion 1.5: klasik model, doğru şekilde yönlendirilmiş
Stable Diffusion 1.5 hâlâ bilinmeye değer: doğru çözünürlük, CFG ve sampler, devasa LoRA ve embedding kütüphanesini nasıl kullanacağın ve 512 piksellik modele uygun yaratıcı prompt fikirleri.
Captain tarafından
2026-10-02
Modeller
FLUX.2 Dev: Black Forest Labs'in en yeni modelini yönlendirme
FLUX.2 Dev, daha uzun promptlar, daha iyi metin, daha güçlü gerçekçilik ve çoklu referans düzenleme sunuyor. Bu rehber, turbo iş akışını, rehberlik ve çözünürlük ayarlarını, prompt yapısını ve yeni özelliklerini kullanma fikirlerini kapsıyor.
Captain tarafından
2026-10-03
Modeller
Qwen-Image: uzun promptlar, mükemmel metin ve iki dilli posterler
Qwen-Image, resimdeki kelimelerin önemli olduğu durumlarda kullanacağın model. Uzun ve detaylı promptlar nasıl yazılır, İngilizce ve Çince metinler nasıl doğru şekilde oluşturulur, CFG ve adımlar nasıl ayarlanır, ayrıca yoğun düzen içeren yaratıcı fikirler nasıl keşfedilir öğren.
Captain tarafından
2026-09-29