CUDA memoria esaurita: quanta VRAM serve a ogni modello AI e come farlo entrare
Argomento: Errori e soluzioni
Di Captain
Pubblicato il 2026-05-18
Una tabella della VRAM per SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 e HunyuanVideo, e le tecniche per far entrare un modello: quantizzazione fp8 e GGUF, offload su CPU, VAE a tiles, limiti di risoluzione e frame, e quando smettere di lottare e usarlo in hosting.
Panoramica
CUDA memoria esaurita è l'errore più comune nella generazione locale di immagini e video AI, e non è un bug: il modello, gli encoder di testo, l'immagine latente e le attivazioni di attenzione devono stare tutti insieme nella memoria della scheda grafica.
Quanto serve dipende dalla famiglia, dalla precisione dei pesi, dalla risoluzione, dalla dimensione del batch e, per i video, dal numero di frame.
Questa guida dà i numeri misurati davvero, non quelli teorici. "Confortevole" significa che il flusso di lavoro di default alla risoluzione nativa della famiglia funziona senza offload; "minimo" significa che funziona con pesi quantizzati e trucchi di offload. Entrambi assumono una singola immagine o clip alla volta. Se un modello supera la tua scheda, l'hosting è più economico di una nuova GPU:
BitVector
fa girare queste famiglie su GPU cloud in un'app web e Discord, e
PirateDiffusion
le fa girare da Telegram con le parole trigger mostrate nella casella Run di questo sito. Molti usano una scheda locale per
SD 1.5
e
SDXL
e i servizi hosted per
Flux
,
Qwen
e video.
Riferimento
Nome | Tipo | Cos'è |
|---|---|---|
SD 1.5 | 4 GB min / 6 GB comfortable | 512x512 nativo. File da 2 GB (fp16). Funziona su quasi tutto; usa --lowvram con 4 GB. |
SDXL / Pony / Illustrious | 6 GB min / 8-12 GB comfortable | |
Flux dev | 8 GB min (GGUF Q5 / NF4) / 16 GB comfortable (fp8) / 24 GB full | 1024x1024. File da 23 GB fp16; 11 GB fp8; 6.8 GB NF4. L'encoder T5 aggiunge 5 GB fp16 o 2.5 GB fp8. |
FLUX.2 dev | 16 GB min (GGUF) / 24 GB comfortable (fp8) / 32 GB+ full | Fino a 4 MP. Encoder di testo più grande; fp8 è la scelta pratica su schede consumer. |
Qwen-Image / Qwen-Image-Edit | 12 GB min (GGUF Q4) / 24 GB comfortable (fp8) | |
Z-Image Turbo | 8 GB min / 16 GB comfortable | 6B parametri, 8 passi, 1024 nativo. Il modello moderno più amichevole per schede da 8-12 GB. |
Wan 2.2 5B (TI2V) | 8 GB min / 12 GB comfortable | 720p, 5 secondi. L'ibrido 5B è fatto per schede consumer. |
Wan 2.2 14B (T2V / I2V) | 12 GB min (GGUF Q4 + offload) / 24 GB comfortable (fp8) | 480p-720p, 81 frame. Due modelli esperti (rumore alto/basso) si caricano a turno. Le lightning LoRA rendono usabili 4 passi. |
HunyuanVideo | 12 GB min (GGUF + offload) / 24 GB comfortable | 13B, 544x960, 65-129 frame. Il numero di frame è la leva. |
LTX-2 | 12 GB min / 24 GB comfortable | Audio e video insieme; 4K serve 24 GB+. Veloce per frame. |
AD

Nessuna installazione: esegui i modelli IA nel cloud
BitVector Prism è il modo più semplice per iniziare: scegli un modello, scrivi un prompt e genera in una web app pulita, senza configurare nulla. BitVector è disponibile anche su Discord e sul web (SpyGlass).
Passo dopo passo
- Trova la famiglia e la dimensione del modello sulla sua pagina qui (famiglia in alto, dimensioni file sotto Files) e confronta con la tabella sopra e la tua scheda.
- Scegli la precisione che la scheda può tenere: fp16 solo se il file più 4 GB ci stanno; altrimenti fp8 (stessa qualità per immagini), poi GGUF Q8, Q6, Q5, Q4 in quest'ordine. ComfyUI-GGUF fornisce i loader per Unet e CLIP.
- Quantizza anche l'encoder di testo: il file T5-XXL fp8 è la metà della dimensione di fp16 senza cambi visibili per la maggior parte dei prompt.
- Mantieni la risoluzione alla dimensione nativa e fai l'upscale dopo: 512 per SD 1.5, 1024 per SDXL, Flux, Qwen eZ-Image. Raddoppiare il lato quadruplica la memoria delle attivazioni.
- Batch size 1. Genera più immagini in sequenza invece che in parallelo.
- Decodifica a tiles: VAE Decode (Tiled) in ComfyUI, Tiled VAE in A1111/Forge. Solo il passo di decodifica può fallire su un latente campionato che ci stava.
- Video: prima meno frame (33 o 49), poi lati più corti (480p), poi più passi. Le lightning / distillation LoRA sulle pagine Wan eHunyuanriducono i passi da 30 a 4-8.
- Se ancora corto: usalo in hosting. La casella Run su ogni pagina modello apre il modello su PirateDiffusion (Telegram) o BitVector (web, Discord) senza niente da installare.
Esempi
ComfyUI Flux dev su 8 GB
Unet Loader (GGUF): flux1-dev-Q5_K_M.gguf
DualCLIPLoader (GGUF): t5-v1_1-xxl-encoder-Q5_K_M.gguf + clip_l.safetensors
VAE: ae.safetensors | 1024x1024 | 20 steps | --lowvram
Wan 2.2 14B I2V su 12 GB
High noise: wan2.2_i2v_high_noise_14B_Q4_K_M.gguf | Low noise: wan2.2_i2v_low_noise_14B_Q4_K_M.gguf
umt5_xxl_fp8_e4m3fn_scaled.safetensors | 480x832 | 49 frames | lightning LoRA, 4 steps
Forge SDXL su 6 GB
UI: xl | GPU Weights: 4000 | Diffusion in Low Bits: Automatic | 1024x1024 | batch 1
Consigli
- La RAM di sistema conta quasi quanto la VRAM una volta che fai offload: 32 GB è il minimo confortevole per Flux e Wan, 64 GB perFLUX.2e Qwen fp16.
- Chiudi le schede del browser con accelerazione hardware e tutto ciò che usa la GPU (lanciatori di giochi, videochiamate): 1-2 GB di VRAM spariscono lì dentro.
- Windows riserva VRAM per il desktop; una seconda scheda economica per il display libera tutta la scheda principale per la generazione.
- GGUF Q8 è visivamente identico a fp16 per immagini; Q5_K_M è il punto giusto per schede da 8 GB; sotto Q4 i dettagli si perdono.
- fp8 su RTX serie 40 e più recenti è veloce; su RTX 30 e più vecchie funziona ma i pesi vengono upcastati al volo, quindi GGUF può essere più veloce lì.
- Tieni a portata di mano un prompt di test 512x512 o 1024x1024 e alza una variabile alla volta (risoluzione, poi LoRA, poi ControlNet) per trovare il limite della tua scheda.
- La classifica heat su questo sito mostra quali release quantizzate e distillate la community usa davvero; le lightning LoRA per Wan e Qwen sono di solito in cima.
Risoluzione dei problemi
Memoria esaurita prima del primo passo
Perché succede
Solo i pesi superano la VRAM.
Come risolverlo
Precisione più piccola (fp8, GGUF Q5) o offload. Controlla la dimensione del file rispetto alla VRAM meno 2 GB.
Memoria esaurita nel sampler ad alta risoluzione
Perché succede
Le attivazioni di attenzione crescono con i pixel.
Come risolverlo
Memoria esaurita solo alla decodifica VAE
Perché succede
La decodifica è il picco di memoria per immagini grandi e video.
Come risolverlo
Decodifica VAE a tiles; flag VAE fp16/bf16; per video decodifica a chunk temporali.
Funziona una volta, fallisce la seconda
Perché succede
Frammentazione e modelli in cache dalla corsa precedente.
Come risolverlo
Scarica i modelli (ComfyUI Manager ha un pulsante), o imposta PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True prima di partire.
Lento ma senza errore dopo aver aggiunto --lowvram
Perché succede
I pesi vengono caricati dalla RAM di sistema a ogni passo.
Come risolverlo
Normale. Riduci il modello (quantizza) così ne resta di più sulla GPU, o usa l'hosting per le famiglie grandi.
Sistema si blocca o si riavvia
Perché succede
RAM di sistema esaurita e file di paging troppo piccolo, o alimentatore al limite.
Come risolverlo
File di paging gestito dal sistema su SSD; un limite di potenza all'80-90% via driver costa poca velocità.
AD

Nessuna installazione: esegui i modelli IA nel cloud
PirateDiffusion è solo su Telegram ed è pensato per i professionisti: migliaia di modelli, LoRA e workflow tramite comandi in chat, con generazione illimitata a prezzo fisso.
Domande
8 GB bastano nel 2026?
Per SD 1.5, SDXL,
Z-Image Turbo
e
Flux dev
in GGUF, sì. Per FLUX.2,
Qwen-Image
e i modelli video 14B è il minimo con offload pesante, e la generazione è lenta; la maggior parte li usa in hosting.
fp8 abbassa la qualità?
Per i modelli immagine, non visibilmente. GGUF Q8 è equivalente; Q5 mostra piccole differenze su testi fini e texture; Q4 perde qualche dettaglio.
Perché un file SDXL da 6.5 GB serve 8 GB?
Encoder di testo, VAE, latente e attivazioni di attenzione si aggiungono ai pesi, e Windows tiene un po' di VRAM per il display.
E Apple Silicon o AMD?
La memoria unificata su
Apple Silicon
fa girare Flux fp8 su macchine da 32 GB, lentamente; AMD gira via ROCm su Linux o ZLUDA / DirectML su Windows, con meno margine. I servizi hosted aggirano entrambi.
Cosa conviene di più, una scheda da 24 GB o un piano hosted?
Un piano hosted per un anno costa meno di una 3090 usata e copre tutte le famiglie insieme; una scheda conviene se generi ore ogni giorno. Molti fanno entrambi.
Link e fonti
- ComfyUI-GGUF loaders
- PyTorch memory management notes
- Run the big models hosted on PirateDiffusion
- BitVector cloud GPUs
Modelli di questa guida
Modelli Stable Diffusion 1.5
Modelli Stable Diffusion XL 1.0
Modelli Flux
Modelli Flux 2 / Klein
Modelli Wan
Modelli Qwen
Modelli Hunyuan
Modelli Zimage
Scritto da
Captain
Guide correlate
Errori e soluzioni
Errori di ComfyUI e come risolverli: nodi rossi, modelli mancanti, CUDA out of memory
I messaggi di errore di ComfyUI che si incontrano per primi, cosa significa ognuno e la soluzione che funziona: nodi personalizzati mancanti (box rossi), "Prompt outputs failed validation", CUDA out of memory, tipo di modello sbagliato in un loader, errori di forma mat1 e mat2, deserializzazione header, incompatibilità tra torch e xformers.
Di Captain
2026-05-12
Errori e soluzioni
Errori e soluzioni di Stable Diffusion WebUI Forge (Flux, SDXL, poca VRAM)
Problemi specifici di Forge e come risolverli: Flux che non si carica o produce rumore, il cambio tipo UI (sd / xl / flux), il cursore "GPU Weights" e gli errori di memoria esaurita, mancanza di text encoder e VAE per Flux, rottura di ControlNet ed estensioni, e le differenze da Automatic1111 che confondono gli utenti.
Di Captain
2026-05-16
Errori e soluzioni
Errori e soluzioni di Automatic1111 (Stable Diffusion WebUI)
Soluzioni per gli errori di Stable Diffusion WebUI che bloccano la maggior parte delle installazioni: "Torch non riesce a usare la GPU", NansException, CUDA out of memory, "Couldn't install torch", xformers, "Stable diffusion model failed to load", estensioni rotte dopo un aggiornamento e problemi specifici di SDXL.
Di Captain
2026-05-14
Modelli video
Wan 2.2 video: configurazione, impostazioni e LoRA per text-to-video e image-to-video
Primi risultati con Wan 2.2: quale dimensione modello scegliere (5B o 14B), la coppia di esperti high-noise / low-noise, risoluzione e numero di frame che funzionano, le LoRA lightning che riducono i render a quattro step, struttura del prompt per il movimento e come usarlo in hosting quando la scheda è troppo piccola.
Di Captain
2026-05-24
Modelli
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: quale famiglia di modelli usare nel 2026
Un confronto pratico tra le famiglie di modelli open per immagini: capacità di seguire il prompt, realismo, anime e illustrazione, rendering del testo, velocità, VRAM, ecosistema LoRA e licenza, con una raccomandazione per ogni tipo di lavoro e hardware.
Di Captain
2026-05-22
Altre guide
Modelli
FLUX.1 Dev: come usarlo, impostazioni migliori e idee creative
Una guida pratica a FLUX.1 Dev di Black Forest Labs: come scrivere i prompt in linguaggio naturale, impostazioni di guida e passi, stacking di LoRA, rendering del testo e idee per prompt che sfruttano i suoi punti di forza.
Di Captain
2026-09-30
Modelli
Stable Diffusion XL 1.0: prompt, impostazioni e cosa fa ancora meglio
Come ottenere il massimo dal modello base ufficiale SDXL 1.0: risoluzioni native, impostazioni di CFG e sampler, il refiner, prompt negativi e idee per stili in cui SDXL brilla ancora.
Di Captain
2026-10-01
Modelli
Stable Diffusion 1.5: il modello classico, usato nel modo giusto
Stable Diffusion 1.5 vale ancora la pena conoscerlo: la risoluzione giusta, CFG e sampler, come usare la sua enorme libreria di LoRA e embedding, e idee creative per prompt adatte a un modello a 512 pixel.
Di Captain
2026-10-02
Modelli
FLUX.2 Dev: come usare il modello più recente di Black Forest Labs
FLUX.2 Dev supporta prompt più lunghi, testo migliore, realismo più forte e modifica con riferimenti multipli. Questa guida spiega il flusso turbo, le impostazioni di guida e risoluzione, la struttura del prompt e idee che sfruttano le sue nuove potenzialità.
Di Captain
2026-10-03
Modelli
Qwen-Image: prompt lunghi, testo perfetto e poster bilingue
Qwen-Image è il modello da usare quando le parole nell'immagine contano. Scopri come scrivere prompt descrittivi lunghi, riprodurre testo in inglese e cinese con precisione, impostare CFG e passi, e esplorare idee creative con layout complessi.
Di Captain
2026-09-29
Modelli
SDXL-Lightning: generazione in quattro passaggi su qualsiasi checkpoint SDXL
Lo LoRA SDXL-Lightning di ByteDance trasforma un rendering SDXL da 30 passaggi in uno da 4. Scopri il numero di passaggi, il CFG da usare, il sampler e come combinarlo con i tuoi checkpoint e LoRA di stile preferiti.
Di Captain
2026-09-30

Model
Trends
.ai
© ModelTrends.ai
|
Fatto in Giappone
|
© 2026