Cum funcționează modelele generative AI pentru imagini: difuzie, latente și encodere de text explicate simplu
Subiect: Modele
De Quartermaster
Publicat 2025-08-28
Prezentare generală
Orice model de imagine actual este un denoiser. În timpul antrenamentului i se arată milioane de imagini cu cantități crescânde de zgomot aleator adăugat, împreună cu descrierea fiecărei imagini, și învață să prezică ce zgomot a fost adăugat. La generare procesul merge invers: începi cu zgomot pur, întrebi modelul ce zgomot e acolo având promptul tău, elimini puțin din el, repeți de douăzeci sau treizeci de ori, și apare o imagine care se potrivește cu descrierea. Asta e tot trucul; „difuzia” e numele procesului gradual de adăugare și eliminare a zgomotului.
Lucrul pe pixeli la dimensiune completă ar fi prea lent, așa că de la Stable Diffusion 1.x denoising-ul se face într-un spațiu comprimat numit latent. O rețea mică separată, VAE, comprimă o imagine 1024x1024 într-o grilă 128x128 de numere și o extinde înapoi la final. Denoiser-ul (un U-Net în
SD 1.5
și
SDXL
, un transformer în
Flux
,
Qwen
,
Z-Image
și modelele video) nu vede niciodată pixelii. De aceea dimensiunile imaginilor trebuie să fie multipli de 8 sau 16 și de ce pasul de decodare VAE la final poate rămâne fără memorie singur.
Promptul intră printr-un encoder de text, care transformă cuvintele într-o listă de numere pe care denoiser-ul le poate folosi ca condiție. SD 1.5 folosește un encoder CLIP cu limită de 77 de tokeni, SDXL folosește două, Flux adaugă un model mare de limbaj T5, iar modelele din 2025 și 2026 (
Qwen Image
,
FLUX.2
, Z-Image,
Wan 2.2
) folosesc LLM-uri complete ca encodere. Acea schimbare singură explică majoritatea diferențelor în cum se scriu prompturile: liste de taguri pentru modelele bazate pe CLIP, propoziții naturale pentru cele bazate pe LLM. Un
LoRA
, în final, e un set mic de corecții pentru greutățile denoiser-ului (și uneori ale encoder-ului) care direcționează ce desenează; nu adaugă cunoștințe noi din nimic, doar reechilibrează ce a învățat modelul de bază.
Referință
Nume | Tip | Ce este |
|---|---|---|
Denoiser (U-Net / DiT) | component | |
VAE | component | Comprimă imaginile în latente și înapoi. Un VAE greșit sau lipsă dă imagini spălăcite sau cu tentă mov. Flux și familiile mai noi vin cu propriile VAE-uri cu 16 canale. |
Text encoder | component | CLIP-L, CLIP-G, T5-XXL sau un LLM (Qwen2.5-VL, Mistral, Gemma). Decide cum se înțelege promptul și cât de lung poate fi. |
Scheduler / sampler | setting | Programul care decide cât zgomot se elimină la fiecare pas și metoda numerică folosită. Schimbă textura și viteza de convergență, nu conținutul. |
Steps | setting | Câte iterații de denoising. Modelele distilate (Turbo, Lightning, Schnell, Klein) sunt antrenate să aibă nevoie de 1 până la 8. |
CFG / guidance | setting | Ghidare fără clasificator: cât de mult se împinge predicția condiționată de prompt față de cea necondiționată. Prea mare arde culorile; modelele distilate pentru ghidare ( Flux dev ) iau o singură valoare de ghidare. |
Latent size | setting | Dimensiunea imaginii împărțită la 8 (SD) sau 16 (Flux, Wan). Modelele desenează cel mai bine aproape de rezoluția la care au fost antrenate. |
Flow matching | training method | Înlocuitorul din 2024+ pentru programele clasice de zgomot în difuzie (Flux, SD3, Wan, Z-Image). Aceeași idee, drum mai drept de la zgomot la imagine, mai puțini pași necesari. |
AD

Vezi teoria în practică, fără configurări
BitVector Prism îți permite să schimbi între modelele SDXL, Flux și Qwen într-o singură aplicație web, ca să poți rula același prompt prin trei arhitecturi și să vezi diferențele descrise aici în câteva minute.
Pas cu pas
- Zgomot la intrare: sampler-ul creează o grilă latentă de numere aleatoare din seed. Schimbă seed-ul și totul după se schimbă.
- Prompt la intrare: encoderul de text transformă cuvintele tale în embedding-uri. La modelele CLIP orice peste 77 de tokeni e tăiat sau împărțit; la modelele bazate pe LLM un paragraf e ok.
- Fiecare pas: denoiser-ul rulează de două ori pe SD și SDXL (cu și fără prompt); diferența, scalată cuCFG, împinge latentul spre prompt. Flux dev rulează o dată cu o valoare de ghidare încorporată.
- Sampler-ul scade zgomotul prezis conform programului (Karras, exponențial, simplu, beta). După ultimul pas latentul e o imagine curată în formă comprimată.
- Decodare: VAE extinde latentul în pixeli. Există decodare VAE pe plăci pentru că acest pas singur poate depăși memoria unui card de 8 GB la dimensiuni mari.
- Treceri opționale a doua oară: hires-fix adaugă puțin zgomot și denoisează la o dimensiune mai mare;img2imgpornește de la o imagine existentă în loc de zgomot pur; inpainting limitează schimbarea la o mască.
- Modelele video adaugă o axă de timp latentului (un clip de 5 secunde e un latent 3D) și altfel e același ciclu, de aceea au nevoie de zece ori mai multă memorie.
Exemple
Același prompt prin trei arhitecturi diferite
SD 1.5 (CLIP, 77 tokens): "portrait of an old sailor, grey beard, wool cap, harbour background, film photo"
SDXL (two CLIPs): same words, 1024x1024, CFG 6, 28 steps
Flux dev (CLIP-L + T5): "A weathered old sailor with a grey beard and a navy wool cap stands at a harbour railing at dusk; shallow depth of field, Kodak Portra look." guidance 3.5, 24 steps
Nodurile ComfyUI mapate pe componente
Load Checkpoint -> MODEL (denoiser), CLIP (text encoder), VAE
CLIP Text Encode (prompt) -> KSampler (sampler, steps, CFG, seed) -> VAE Decode -> Save Image
Sfaturi
- Un model nu poate desena ce nu a fost în datele lui de antrenament. De aceea fine-tune-urile anime cunosc mii de personaje și modelele foto nu, și de aceea există un LoRA pentru aproape orice lipsă.
- Fine-tune-urile (DreamShaper, Juggernaut,Illustrious, Pony) au aceeași arhitectură ca baza lor, doar cu greutăți diferite; un LoRA pentru baza de obicei merge pe fine-tune, un LoRA pentru un fine-tune foarte diferit (Pony) deseori nu.
- Modelele distilate schimbă flexibilitatea pe viteză. SDXL Lightning la 4 pași e ok pentru schițe; modelul complet la 28 de pași e mai bun pentru finale.
- Encoderul de text e adesea cel mai mare fișier. Flux cu T5-XXL fp16 are nevoie de 9 GB doar pentru encoder, de aceea există versiuni fp8 și GGUF.
- Distilarea ghidării (Flux dev) și CFG nu sunt același lucru. Folosirea unui CFG de 7 pe Flux dev dă imagini arse; folosește setările de pe pagina modelului.
- Tot ce e aici rulează în cloud la fel ca local; diferența e doar cine deține GPU-ul.
Depanare
Imaginile ies gri, spălăcite sau cu tentă mov
De ce se întâmplă
VAE lipsă sau nepotrivit, sau un overflow fp16 la VAE pe SDXL.
Cum se repară
Încarcă VAE-ul care aparține familiei; pe SDXL folosește VAE-ul cu fix fp16.
Promptul lung e ignorat parțial
De ce se întâmplă
Limită de tokeni CLIP pe SD 1.5 și SDXL.
Cum se repară
Pune cuvintele importante primele sau treci la un model Flux, Qwen sau Z-Image cu encoder LLM.
Culorile sunt arse și contrastul e extrem
De ce se întâmplă
CFG prea mare pentru model sau CFG folosit pe un model distilat pentru ghidare.
Cum se repară
Scade CFG la 5-7 pe SDXL; folosește ghidare 3-4 și CFG 1 pe Flux dev.
Tiling sau subiecte duble la dimensiuni mari
De ce se întâmplă
Latent mult mai mare decât rezoluția de antrenament; modelul se repetă.
Cum se repară
Generează la dimensiunea nativă și mărește apoi, sau folosește hires-fix cu denoise 0.4.
Memorie insuficientă doar la final
De ce se întâmplă
Pasul de decodare VAE la dimensiune completă.
Cum se repară
AD

Toate arhitecturile pe un singur cluster GPU
PirateDiffusion găzduiește SD 1.5, SDXL, Flux, FLUX.2, Qwen, Z-Image și modelele video unul lângă altul pe Telegram, cu generare nelimitată la un preț fix. Fără calcule VRAM, fără fișiere VAE de căutat.
Întrebări
Modelul copiază imagini din setul lui de antrenament?
Stochează greutăți, nu imagini, și nu poate recupera o poză de antrenament. Pot apărea duplicate apropiate ale unor imagini foarte frecvente (tablouri celebre, logo-uri), motiv pentru care e bine să nu le ceri în prompt.
De ce modelele noi au nevoie de mai multă memorie dacă ideea e aceeași?
Denoiser-e mai mari (12 miliarde de parametri pentru Flux față de 0.9 pentru SD 1.5), encodere de text mai mari și latente mai mari. Versiunile cuantizate fp8 și GGUF le aduc înapoi jos.
Care e diferența între checkpoint și model?
Checkpoint-ul e fișierul salvat al unui model (denoiser, adesea cu encoder și VAE incluse). Oamenii folosesc cuvintele interschimbabil.
De ce același seed dă o imagine diferită pe alt PC?
GPU diferit, precizie (fp16 vs bf16) sau implementare sampler; zgomotul e același, dar calculele diferă puțin. Pe aceeași mașină, cu aceleași setări, iese aceeași imagine.
Mai mulți pași ajută mereu?
Nu. Majoritatea sampler-elor converg în 25-30 de pași; după aia pierzi vreme degeaba. Modelele distilate se strică cu mai mulți pași.
Linkuri și surse
- Denoising Diffusion Probabilistic Models (Ho et al., 2020)
- High-Resolution Image Synthesis with Latent Diffusion Models (Rombach et al., 2022)
- Flow Matching for Generative Modeling (Lipman et al., 2022)
- Flux family page
- SD 1.5 family page
- BitVector web app
Modele din acest ghid
Modele Stable Diffusion 1.5
Modele Stable Diffusion XL 1.0
Modele Flux
Modele Qwen
Modele Zimage
Modele Wan
Scris de
Quartermaster
Ghiduri conexe
Servicii cloud
Începutul generării de imagini AI: prima ta poză în zece minute
Un început simplu pentru începători: ce este un model, cele trei moduri de a-l folosi (aplicație web, chat bot, PC-ul tău), cum să scrii primul prompt, ce înseamnă setările și cum să recunoști un rezultat bun de unul norocos.
De Captain
2025-08-14
Prompting
Pași, CFG, samplere, programatori și semințe: setările de generare explicate cu valori implicite sigure
Ce schimbă fiecare setare din panoul de generare, valorile care funcționează pentru fiecare familie de modele (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), ce samplere merită să știi, de ce modelele distilate nu respectă regulile obișnuite și cum să folosești semințele ca să schimbi câte un singur lucru odată.
De Quartermaster
2025-11-19
Modele
Checkpoint vs LoRA vs embedding vs ControlNet: ce face fiecare fișier
Cele șase tipuri de fișiere de model pe care le vei întâlni, ce schimbă fiecare, cât de mare este, unde se pune și când să le folosești: checkpoint-uri și fine-tune-uri, LoRA-uri și rudele lor LyCORIS, embedding-uri de inversare textuală, ControlNet-uri și IP-Adaptere, VAE-uri și upscalere.
De Quartermaster
2025-10-08
Modele
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: ce familie de modele să folosești în 2026
O comparație practică a familiilor de modele de imagini open: urmărirea promptului, realism, anime și ilustrație, redare text, viteză, VRAM, ecosistem LoRA și licență, cu recomandări pentru fiecare tip de lucru și hardware.
De Captain
2026-05-22
Mai multe ghiduri
Servicii cloud
Taxă fixă vs tokeni: de ce planurile nelimitate ca Graydient.ai oferă cea mai bună valoare pentru creatorii AI în 2026
O comparație de costuri clasificate, cu prețuri verificate pe 8 octombrie 2026, între planurile nelimitate cu taxă fixă ca Graydient.ai și prețurile pe tokeni și credite de la Midjourney, Leonardo, fal.ai, Replicate, Runway și Kling: cât costă cu adevărat 1.000 de imagini și 1.000 de videoclipuri pe lună la fiecare, și de ce o taxă fixă pentru imagini, video, audio, chat Grok LLM și aplicații web nelimitate este cea mai bună alegere pentru creatorii care fac multe încercări.
De Captain
2026-10-08
Modele
FLUX.1 Dev: cum să-l folosești, cele mai bune setări și idei creative
Un ghid practic pentru FLUX.1 Dev de la Black Forest Labs: cum să dai comenzi în limbaj natural, setările pentru ghidare și pași, cum să combini LoRA-uri, redarea textului și idei de prompturi care îi pun în valoare punctele forte.
De Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompturi, setări și ce face încă cel mai bine
Cum să profiți la maximum de modelul oficial SDXL 1.0 de bază: rezoluții native, setări CFG și sampler, refinerul, prompturi negative și idei pentru stiluri unde SDXL încă strălucește.
De Captain
2026-10-01
Modele
Stable Diffusion 1.5: modelul clasic, folosit corect
Stable Diffusion 1.5 merită să fie cunoscut în continuare: rezoluția potrivită, CFG și sampler-ul, cum să folosești biblioteca uriașă de LoRA și embeddings, plus idei creative de prompturi potrivite pentru un model de 512 pixeli.
De Captain
2026-10-02
Modele
FLUX.2 Dev: cum să folosești cel mai nou model Black Forest Labs
FLUX.2 Dev aduce prompturi mai lungi, text mai bun, realism mai puternic și editare cu referințe multiple. Acest ghid acoperă fluxul turbo, setările de ghidare și rezoluție, structura promptului și idei care folosesc noile sale puncte forte.
De Captain
2026-10-03
Modele
Qwen-Image: prompturi lungi, text perfect și postere bilingve
Qwen-Image e modelul la care apelezi când contează cuvintele din imagine. Învață cum să scrii prompturi lungi și descriptive, să redai text în engleză și chineză corect, să setezi CFG și pașii, și să explorezi idei creative cu layout complex.
De Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Toate drepturile rezervate