Cerințe VRAM pentru fiecare model popular AI de imagine și video (2026): precizie completă, FP8 și GGUF
Subiect: Erori și soluții
De P.I. Panda
Publicat 2026-10-06
Cât VRAM ai nevoie pentru SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein și Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 și LTX-2, la precizie completă, FP8 și 4-bit GGUF, cu placa confortabilă și licența pentru fiecare, ce poate rula fiecare mărime de GPU de la 8 la 48 GB și ordinea soluțiilor când un model nu încape.
Prezentare generală
Răspuns scurt: 8 GB
VRAM
rulează
SDXL
și modelele mici și rapide precum
Z-Image Turbo
și
FLUX.2 Klein 4B
. 12 GB rulează
FLUX.1
și
Qwen-Image
odată ce sunt cuantificate. 24 GB rulează aproape orice model de imagine plus
Wan 2.2
video în FP8. Cele mai noi modele mari,
FLUX.2 Dev
și
LTX-2
la calitate completă, cer 32 GB sau mai mult.
Tabelul de mai jos listează fiecare model popular open cu memoria necesară la precizie completă, FP8 și ca fișier 4-bit GGUF, generând la aproximativ 1024x1024. Testeri diferiți calculează encoderul de text diferit, deci tratează fiecare număr ca un interval, nu ca o limită fixă. Trei lucruri pe care tabelul le ascunde: SDXL este încă cel mai ieftin model de rulat bine (baza încapă în 8 GB, dar LoRA-urile,
ControlNet
și upscaling-ul adaugă memorie, de aceea 12 GB e numărul confortabil); FLUX.2 Klein 4B e cea mai bună alegere pentru plăci mici acum (aproximativ 13 GB la precizie completă, cam jumătate în FP8, Apache 2.0); și FLUX.2 Dev nu e un model pentru acasă la precizie completă (un utilizator
ComfyUI
a rulat FP8 pe un RTX 3060 de 12 GB, folosind cam 70 GB RAM de sistem pentru asta).
Precizia schimbă totul. BF16/FP16 e calitate și mărime completă, cam 2 GB VRAM per miliard de parametri. FP8 taie asta la jumătate, cam 1 GB per miliard, și majoritatea nu pot spune diferența între FP8 și precizia completă. Fișierele GGUF (Q8, Q5, Q4 și mai mici) micșorează modelele și mai mult: Q8 e aproape de calitate completă, Q4 face un compromis de detalii pentru o amprentă mult mai mică, iar sub Q4 calitatea scade rapid. Modelul nu e singurul lucru în memorie: encoderii de text (T5 pentru FLUX.1, un model de limbaj pentru Qwen-Image și
FLUX.2
), VAE, LoRA-uri, ControlNet și imaginea în sine ocupă spațiu, iar ComfyUI mută automat unele dintre acestea în RAM de sistem, de aceea doi oameni cu aceeași placă pot raporta cifre diferite. Date verificate la 6 octombrie 2026, pe baza fișelor modelelor și testelor comunității; actualizat lunar.
Referință
Model
Full precision
FP8
4-bit / GGUF
Comfortable card
Stable Diffusion 1.5
0.9B
CreativeML OpenRAIL-M. Rulează pe aproape orice.
Full precision
4 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
6-8 GB
SDXL și fine-tune-uri: Pony, Illustrious, NoobAI
3.5B
OpenRAIL++ (fine-tune-urile variază). 12 GB lasă loc pentru LoRA-uri, ControlNet și upscaling într-un singur flux.
Full precision
6-8 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
12 GB
SD 3.5 Large
8.1B
Licență Stability Community.
Full precision
16-24 GB
FP8
mai mică
decât precizia completă
4-bit / GGUF
mai mică
decât FP8
Comfortable card
24 GB
Z-Image Turbo
6B
Apache 2.0. 8 pași; modelul rapid pentru plăci mici.
Full precision
~16 GB
FP8
~8 GB
4-bit / GGUF
~6 GB
Comfortable card
8-12 GB
FLUX.2 Klein 4B
4B
Apache 2.0, folosință comercială permisă. Cel mai potrivit pentru plăci de 8 GB în 2026.
Full precision
~13 GB
FP8
~8 GB
4-bit / GGUF
~4-5 GB
Comfortable card
8-12 GB
FLUX.2 Klein 9B
9B
Licență FLUX Non-Commercial (output-urile pot fi folosite comercial).
Full precision
~29 GB
FP8
~17 GB
4-bit / GGUF
~8-9 GB
Comfortable card
16-24 GB
FLUX.1 Schnell
12B
Apache 2.0. 4 pași.
Full precision
~24 GB
FP8
~12 GB
4-bit / GGUF
~6-8 GB
Comfortable card
12-16 GB
FLUX.1 Dev
12B
Licență non-comercială. Encoderul T5 fp8 economisește cam 4 GB singur.
Full precision
~24 GB
mai mult cu encoderul de text încărcat
FP8
~12-18 GB
4-bit / GGUF
~7 GB
Comfortable card
16-24 GB
Qwen-Image
20B
Apache 2.0. Randare text puternică; are nevoie de encoderul său Qwen2.5-VL în FP8 pe orice sub 32 GB.
Full precision
~41 GB
FP8
~20 GB
4-bit / GGUF
~12-13 GB
Comfortable card
24 GB
FLUX.2 Dev
32B
Licență non-comercială. Așteaptă generări lente fără o placă de 32 GB.
Full precision
~90 GB
cu encoderul de text
FP8
32 GB
încap pe o placă de 32 GB
4-bit / GGUF
12-16 GB
offloading greu
Comfortable card
32 GB+
HunyuanImage 3.0
80B MoE
Licență Tencent Community. Doar pentru datacenter; folosește-l printr-un serviciu găzduit.
Full precision
multi-GPU
la orice precizie
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
datacenter
Wan 2.1 T2V 1.3B
1.3B
Video 480p
Apache 2.0.
Full precision
8.19 GB
oficial
FP8
8 GB
în practică
4-bit / GGUF
n/a
Comfortable card
12 GB
Wan 2.2 TI2V 5B
5B
Video 720p
Apache 2.0.
Full precision
GPU consumer
oficial, testat pe un RTX 4090
FP8
n/a
4-bit / GGUF
8 GB
GGUF Q8
Comfortable card
24 GB
Wan 2.2 A14B T2V/I2V
2 x 14B
Video 720p
Apache 2.0. Doi experți de 14B, unul în VRAM la un moment dat, de aceea plăcile de 24 GB îl pot gestiona. Wan 2.5-3.0 sunt doar API.
Full precision
80 GB
oficial, GPU unic
FP8
~14 GB
per expert
4-bit / GGUF
12-16 GB
GGUF
Comfortable card
24-32 GB
HunyuanVideo 1.5
8.3B
Video 720p, 1080p cu upscaler-ul său
Licență Tencent Community.
Full precision
14 GB
oficial, cu offloading
FP8
14 GB
în practică
4-bit / GGUF
n/a
Comfortable card
24 GB+
80 GB pentru cea mai bună calitate
LTX-2 / LTX-2.3
19B / 22B
Video până la 4K
Licență LTX-2 Community. Audio sincronizat.
Full precision
32 GB+
oficial
FP8
n/a
4-bit / GGUF
24 GB
FP4
Comfortable card
32 GB
AD

Fiecare rând din acest tabel, fără VRAM necesar
BitVector Prism rulează SDXL, Z-Image, FLUX.1, FLUX.2 și Qwen-Image la precizie completă pe propriile GPU-uri. Alege un model de pe acest site, scrie un prompt, generează în browser. Nimic de descărcat.
Pas cu pas
- Găsește-ți VRAM-ul (Task Manager > Performance > GPU, sau nvidia-smi) și potrivește-l cu un nivel de mai jos; apoi alege modele a căror coloană "placă confortabilă" e la sau sub nivelul tău.
- 12 GB (RTX 3060 12GB, 4070, 5070): tot ce e mai sus, mai rapid, cu loc pentru ControlNet șiupscaling;FLUX.1 Devși Schnell în FP8 sau GGUF; Qwen-Image în GGUF Q4;FLUX.2 Klein 9Bîn GGUF; Wan 2.2 A14B în GGUF Q4 cu offloading la rezoluție mică și clipuri scurte.
- 16 GB (RTX 4060 Ti 16GB, 4070 Ti Super, 5070 Ti, 5080): FLUX.1 Dev în FP8 cu rezervă; Z-Image Turbo și Klein 4B la precizie completă; Qwen-Image în GGUF Q4-Q5;HunyuanVideo1.5 cu offloading; Wan 2.2 A14B în GGUF Q5 la 720p (rapoarte din comunitate).
- 24 GB (RTX 3090, 4090): aproape orice model de imagine în afară de FLUX.2 Dev la precizie completă; Qwen-Image în FP8 sau Q8; Wan 2.2 A14B în FP8 și Wan 2.2 5B la precizie completă; LTX-2 în FP4; majoritatea antrenamentelorLoRApentru SDXL și Flux.
- 32 GB (RTX 5090): FLUX.2 Dev în FP8; LTX-2 șiLTX-2.3în FP8; Wan 2.2 A14B la 720p fără să rămână fără memorie pe parcursul unui clip.
- 48 GB și mai mult (RTX 6000 Ada, A100, H100): Qwen-Image, LTX-2 și FLUX.2 Dev la precizie completă cu spațiu liber; video lung sau la rezoluție mare, generare în batch și antrenamente serioase.
- Descarcă precizia pentru nivelul tău de pe pagina modelului de pe acest site (listează fiecare variantă cu dimensiunea fișierului), încarcă encoderii de text în FP8 și păstrează 32 GB RAM de sistem (64 GB pentru cele mai mari modele) pentru offloading.
Exemple
FLUX.1 Dev pe o placă de 12 GB (ComfyUI)
Load Diffusion Model: flux1-dev-fp8-e4m3fn (11.9 GB) or UnetLoaderGGUF flux1-dev-Q6_K (9.8 GB) | DualCLIPLoader: clip_l + t5xxl_fp8_e4m3fn_scaled | Load VAE: ae
1024x1024, 20 steps, euler, simple, guidance 3.5 | VAE Decode (Tiled) if the last step fails
Qwen-Image pe 16 GB
UnetLoaderGGUF: qwen_image_Q4_K_M.gguf (~12.5 GB) | CLIPLoader: qwen_2.5_vl_7b_fp8_scaled, device cpu | Load VAE: qwen_image_vae
1328x1328 native; start at 1024x1024, 20 steps, cfg 2.5
Aceleași modele fără nicio placă
/render <flux-dev> a studio photo of a vintage camera on a walnut desk, soft window light /size:1024x1024 (PirateDiffusion, Telegram)
Sfaturi
- Când veziCUDA out of memory, fă asta în ordine: treci la o versiune FP8 sau GGUF a aceluiași model (cea mai mare economie); scade rezoluția sau lungimea clipului (memoria crește cu numărul de pixeli, de la 1536 la 1024 px scade mult); folosește decodare VAE pe plăci; încarcă encoderul de text în FP8 sau ține-l pe CPU; închide alte aplicații GPU (browserele și jocurile ocupă VRAM).
- Offloading-ul funcționează, dar plătești în viteză și RAM de sistem: un model poate rula pe o placă „prea mică” pentru el, de câteva ori mai lent, și poate ai nevoie de 32-64 GB sau mai mult RAM de sistem.
- Licențe pe scurt: Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image șiWan2.1/2.2 sunt Apache 2.0 (folosire comercială permisă); FLUX.1 Dev, FLUX.2 Dev și Klein 9B au licență non-comercială Black Forest Labs, care interzice folosirea modelului într-un produs sau serviciu comercial, dar poți folosi comercial imaginile generate. Licențele se schimbă; pagina modelului le leagă pe cele curente.
- Să cumperi o placă de 32 GB ca să rulezi FLUX.2 Dev sau LTX-2 pentru un proiect de weekend rar merită; dacă modelul pe care îl vrei e în rândurile de 24 GB+, închirierea pe oră sau un plan cloud cu tarif fix e de obicei mai ieftin și mai rapid decât offloading-ul pe o placă mică.
- Regula per miliard de parametri: 2 GB la BF16, 1 GB la FP8, cam 0.6 GB la Q4, plus 2-5 GB pentru encoder, VAE și latent.
- Pentru video, rezoluția și lungimea clipului contează la fel de mult ca modelul; ghidul companion despre VRAM pentru video AI explică asta.
Depanare
CUDA out of memory pe o placă pe care tabelul spune că merge bine
De ce se întâmplă
Encoder de text la precizie completă, un stack LoRA, ControlNet sau o rezoluție mare peste model.
Cum se repară
Encoder FP8, o singură LoRA, rezoluție nativă, VAE pe plăci; ghidul CUDA out of memory are versiunea detaliată.
Generarea e dureros de lentă deși nimic nu se blochează
De ce se întâmplă
Offloading automat în RAM de sistem.
Cum se repară
Coboară la următoarea precizie (FP8 la Q6, Q6 la Q4) până când memoria GPU partajată rămâne aproape zero.
FLUX.2 Dev „funcționează” pe 12 GB dar are nevoie de 70 GB RAM
De ce se întâmplă
Greutăți FP8 schimbate din memoria sistemului.
Cum se repară
Folosește Klein 4B/9B local și FLUX.2 Dev în cloud sau pe o placă de 32 GB.
Nu se simte diferența între FP8 și precizie completă, deci de ce Q4 arată neclar?
De ce se întâmplă
Q4 pierde mai multe detalii decât FP8; sub Q4 calitatea scade rapid.
Cum se repară
Folosește Q6 sau Q8 când încape; Q4 pentru schițe.
Confuzie legată de licență pe FLUX
De ce se întâmplă
Schnell și Klein 4B sunt Apache 2.0; Dev, FLUX.2 Dev și Klein 9B sunt non-comerciale.
Cum se repară
Verifică coloana de licență și fișa modelului înainte să folosești un model într-un produs.
AD

Rândurile de 24 GB+, direct de pe telefonul tău
PirateDiffusion găzduiește FLUX.2 Dev, Qwen-Image, Wan 2.2 14B și LTX-2 pe hardware de server și le rulează din comenzi Telegram. Generare nelimitată la un preț fix lunar; fără placă, fără offloading, fără 70 GB RAM.
Întrebări
Pot rula Flux pe 8 GB VRAM?
Da, cu un fișier cuantificat. FLUX.1 în GGUF Q4 are nevoie de cam 7 GB, iar FLUX.2 Klein 4B în FP8 cam 8 GB. Așteaptă-te la generări mai lente decât pe o placă de 12 sau 16 GB. FLUX.1 la precizie completă are nevoie de cam 24 GB.
Sunt 12 GB suficienți pentru SDXL?
Da. SDXL în sine încap în 8 GB; 12 GB îți lasă loc pentru LoRA-uri, ControlNet și upscaling în același flux de lucru.
Cât VRAM cere Wan 2.2?
Depinde de versiune. Modelul 5B rulează pe 8 GB ca fișier GGUF și confortabil pe 24 GB. Modelul A14B oficial cere 80 GB fără offloading, dar versiunea FP8 merge bine pe 24 GB, iar versiunile GGUF rulează pe 12-16 GB cu offloading.
Contează RAM-ul de sistem?
Da, odată ce începi offloading-ul. 32 GB e un minim rezonabil pentru Flux și Wan, iar cele mai mari modele (FLUX.2 Dev pe o placă de 12 GB, de exemplu) pot folosi 64 GB sau mai mult.
Ce modele pot folosi comercial?
Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image și Wan 2.1/2.2 (Apache 2.0). FLUX.1 Dev, FLUX.2 Dev și Klein 9B sunt non-comerciale pentru modelul în sine, dar imaginile generate pot fi folosite comercial. Verifică întotdeauna fișa modelului.
Există un Wan mai nou pe care îl pot rula acasă?
Nu. Wan 2.2 e cea mai nouă versiune Wan cu greutăți descărcabile; Wan 2.5, 2.6, 2.7 și 3.0 sunt doar API.
Linkuri și surse
- Wan 2.2 A14B model card
- FLUX.2 Klein 9B licence
- ComfyUI GGUF loaders
- Flux family page
- FLUX.2 family page
- Qwen Image family page
- Z-Image family page
- Wan family page
- PirateDiffusion
- BitVector web app
Modele din acest ghid
Modele Stable Diffusion 1.5
Modele Stable Diffusion XL 1.0
Modele Zimage
Modele Flux
Modele Flux 2 / Klein
Modele Qwen
Modele Wan
Modele Hunyuan
Modele Ltx2
Scris de
P.I. Panda
Ghiduri conexe

Modele video
Cât VRAM îți trebuie pentru video AI? Wan 2.2, HunyuanVideo 1.5 și LTX-2 după mărimea GPU-ului (2026)
VRAM necesar pentru a rula Wan 2.2, HunyuanVideo 1.5 și LTX-2 local, în funcție de mărimea GPU-ului, rezoluție și durata clipului: ce pot face plăcile de 8, 12-16, 24, 32 și 48+ GB, de ce video costă de o sută de ori mai mult decât o imagine, trucurile de offloading care permit modelelor de 14B să încapă pe 24 GB, timpi reali de generare și când e mai bine să închiriezi decât să cumperi.
De P.I. Panda
2026-10-06
Erori și soluții
CUDA out of memory: cât VRAM are nevoie fiecare model AI și cum să îl faci să încapă
Un tabel cu VRAM pentru SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 și HunyuanVideo, plus tehnicile care fac un model să încapă: cuantizarea fp8 și GGUF, offload pe CPU, VAE pe bucăți, limite de rezoluție și cadre, și când e mai bine să renunți și să-l folosești găzduit.
De Captain
2026-05-18
Erori și soluții
Ghid GPU și VRAM pentru AI imagine și video: ce are nevoie fiecare model și ce să cumperi (sau nu)
Câtă memorie grafică are nevoie fiecare familie de modele la o viteză utilizabilă (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), ce îți aduce cuantizarea fp8 și GGUF, de ce contează și RAM-ul sistemului și discul, o listă de plăci video de la 8 la 32 GB, note pentru Mac și AMD și punctul în care închirierea e mai ieftină decât cumpărarea.
De Quartermaster
2026-01-07
Modele
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: ce familie de modele să folosești în 2026
O comparație practică a familiilor de modele de imagini open: urmărirea promptului, realism, anime și ilustrație, redare text, viteză, VRAM, ecosistem LoRA și licență, cu recomandări pentru fiecare tip de lucru și hardware.
De Captain
2026-05-22
Erori și soluții
Erori ComfyUI și cum să le rezolvi: noduri roșii, modele lipsă, memorie CUDA insuficientă
Mesajele de eroare ComfyUI pe care le întâlnești prima dată, ce înseamnă fiecare și soluția care funcționează: noduri personalizate lipsă (cutii roșii), „Prompt outputs failed validation”, memorie CUDA insuficientă, tip greșit de model într-un loader, erori de formă mat1 și mat2, deserializare header, nepotriviri torch și xformers.
De Captain
2026-05-12
Servicii cloud
PirateDiffusion: folosește orice model din Telegram, fără GPU
Comenzile importante în botul PirateDiffusion de pe Telegram: /render cu cuvinte trigger pentru modele, ponderarea cu (( )) și [[ ]], #recipes, /adetailer, upscaling cu /highdef și /facelift, /remix, /inpaint, fluxuri ComfyUI cu /wf /run:, și noile comenzi // care aleg modelul pentru tine.
De Captain
2026-10-03
Aplicații
BitVector: Vector pentru Discord, Spyglass pe web și chat Prism
Cum să rulezi modele găzduite și fluxuri de lucru ComfyUI din Discord cu botul Vector, din orice browser cu Spyglass și prin chat cu Prism: conectarea contului, /ai render și /ai workflow, media inițială pentru imagine-în-imagine și imagine-în-video, abilități și soluțiile pentru erorile întâlnite de utilizatori.
De Captain
2026-10-03
Mai multe ghiduri
Modele
FLUX.1 Dev: cum să-l folosești, cele mai bune setări și idei creative
Un ghid practic pentru FLUX.1 Dev de la Black Forest Labs: cum să dai comenzi în limbaj natural, setările pentru ghidare și pași, cum să combini LoRA-uri, redarea textului și idei de prompturi care îi pun în valoare punctele forte.
De Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompturi, setări și ce face încă cel mai bine
Cum să profiți la maximum de modelul oficial SDXL 1.0 de bază: rezoluții native, setări CFG și sampler, refinerul, prompturi negative și idei pentru stiluri unde SDXL încă strălucește.
De Captain
2026-10-01
Modele
Stable Diffusion 1.5: modelul clasic, folosit corect
Stable Diffusion 1.5 merită să fie cunoscut în continuare: rezoluția potrivită, CFG și sampler-ul, cum să folosești biblioteca uriașă de LoRA și embeddings, plus idei creative de prompturi potrivite pentru un model de 512 pixeli.
De Captain
2026-10-02
Modele
FLUX.2 Dev: cum să folosești cel mai nou model Black Forest Labs
FLUX.2 Dev aduce prompturi mai lungi, text mai bun, realism mai puternic și editare cu referințe multiple. Acest ghid acoperă fluxul turbo, setările de ghidare și rezoluție, structura promptului și idei care folosesc noile sale puncte forte.
De Captain
2026-10-03
Modele
Qwen-Image: prompturi lungi, text perfect și postere bilingve
Qwen-Image e modelul la care apelezi când contează cuvintele din imagine. Învață cum să scrii prompturi lungi și descriptive, să redai text în engleză și chineză corect, să setezi CFG și pașii, și să explorezi idei creative cu layout complex.
De Captain
2026-09-29
Modele
SDXL-Lightning: generare în patru pași pe orice checkpoint SDXL
LoRA SDXL-Lightning de la ByteDance transformă o randare SDXL de 30 de pași într-una de 4 pași. Află câți pași trebuie să folosești, ce CFG să setezi, ce sampler să alegi și cum să îl combini cu checkpoint-urile și LoRA-urile tale preferate de stil.
De Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Realizat în Japonia
|
© 2026