Model
Trends
.ai
Model
Trends
.ai
i migliori modelli di IA open source

CUDA memoria esaurita: quanta VRAM serve a ogni modello AI e come farlo entrare

Argomento: Errori e soluzioni
Di Captain
Pubblicato il 2026-05-18
Una tabella della VRAM per SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 e HunyuanVideo, e le tecniche per far entrare un modello: quantizzazione fp8 e GGUF, offload su CPU, VAE a tiles, limiti di risoluzione e frame, e quando smettere di lottare e usarlo in hosting.

Panoramica

CUDA memoria esaurita è l'errore più comune nella generazione locale di immagini e video AI, e non è un bug: il modello, gli encoder di testo, l'immagine latente e le attivazioni di attenzione devono stare tutti insieme nella memoria della scheda grafica.
Quanto serve dipende dalla famiglia, dalla precisione dei pesi, dalla risoluzione, dalla dimensione del batch e, per i video, dal numero di frame.
Questa guida dà i numeri misurati davvero, non quelli teorici. "Confortevole" significa che il flusso di lavoro di default alla risoluzione nativa della famiglia funziona senza offload; "minimo" significa che funziona con pesi quantizzati e trucchi di offload. Entrambi assumono una singola immagine o clip alla volta. Se un modello supera la tua scheda, l'hosting è più economico di una nuova GPU:
BitVector
fa girare queste famiglie su GPU cloud in un'app web e Discord, e
PirateDiffusion
le fa girare da Telegram con le parole trigger mostrate nella casella Run di questo sito. Molti usano una scheda locale per
SD 1.5
e
SDXL
e i servizi hosted per
Flux
,
Qwen
e video.

Riferimento

Nome
Tipo
Cos'è
SD 1.5
4 GB min / 6 GB comfortable
512x512 nativo. File da 2 GB (fp16). Funziona su quasi tutto; usa --lowvram con 4 GB.
SDXL / Pony / Illustrious
6 GB min / 8-12 GB comfortable
1024x1024 nativo. File da 6.5 GB (fp16). --medvram con 8 GB; hires fix e
ControlNet
vogliono 12 GB.
Flux dev
8 GB min (GGUF Q5 / NF4) / 16 GB comfortable (fp8) / 24 GB full
1024x1024. File da 23 GB fp16; 11 GB fp8; 6.8 GB NF4. L'encoder T5 aggiunge 5 GB fp16 o 2.5 GB fp8.
FLUX.2 dev
16 GB min (GGUF) / 24 GB comfortable (fp8) / 32 GB+ full
Fino a 4 MP. Encoder di testo più grande; fp8 è la scelta pratica su schede consumer.
Qwen-Image / Qwen-Image-Edit
12 GB min (GGUF Q4) / 24 GB comfortable (fp8)
20B parametri; file da 40 GB fp16, 20 GB fp8, 12 GB Q4. Le lightning
LoRA
riducono i passi a 4-8.
Z-Image Turbo
8 GB min / 16 GB comfortable
6B parametri, 8 passi, 1024 nativo. Il modello moderno più amichevole per schede da 8-12 GB.
Wan 2.2 5B (TI2V)
8 GB min / 12 GB comfortable
720p, 5 secondi. L'ibrido 5B è fatto per schede consumer.
Wan 2.2 14B (T2V / I2V)
12 GB min (GGUF Q4 + offload) / 24 GB comfortable (fp8)
480p-720p, 81 frame. Due modelli esperti (rumore alto/basso) si caricano a turno. Le lightning LoRA rendono usabili 4 passi.
HunyuanVideo
12 GB min (GGUF + offload) / 24 GB comfortable
13B, 544x960, 65-129 frame. Il numero di frame è la leva.
LTX-2
12 GB min / 24 GB comfortable
Audio e video insieme; 4K serve 24 GB+. Veloce per frame.
AD
Nessuna installazione: esegui i modelli IA nel cloud
BitVector Prism è il modo più semplice per iniziare: scegli un modello, scrivi un prompt e genera in una web app pulita, senza configurare nulla. BitVector è disponibile anche su Discord e sul web (SpyGlass).

Passo dopo passo

  1. Trova la famiglia e la dimensione del modello sulla sua pagina qui (famiglia in alto, dimensioni file sotto Files) e confronta con la tabella sopra e la tua scheda.
  2. Scegli la precisione che la scheda può tenere: fp16 solo se il file più 4 GB ci stanno; altrimenti fp8 (stessa qualità per immagini), poi GGUF Q8, Q6, Q5, Q4 in quest'ordine. ComfyUI-GGUF fornisce i loader per Unet e CLIP.
  3. Quantizza anche l'encoder di testo: il file T5-XXL fp8 è la metà della dimensione di fp16 senza cambi visibili per la maggior parte dei prompt.
  4. Mantieni la risoluzione alla dimensione nativa e fai l'upscale dopo: 512 per SD 1.5, 1024 per SDXL, Flux, Qwen e
    Z-Image
    . Raddoppiare il lato quadruplica la memoria delle attivazioni.
  5. Batch size 1. Genera più immagini in sequenza invece che in parallelo.
  6. Offload: --lowvram in
    ComfyUI
    , --medvram in A1111, il cursore GPU Weights in
    Forge
    . Questi spostano i pesi tra RAM e
    VRAM
    e servono 32 GB di RAM di sistema per stare comodi con Flux e
    Wan
    .
  7. Decodifica a tiles: VAE Decode (Tiled) in ComfyUI, Tiled VAE in A1111/Forge. Solo il passo di decodifica può fallire su un latente campionato che ci stava.
  8. Video: prima meno frame (33 o 49), poi lati più corti (480p), poi più passi. Le lightning / distillation LoRA sulle pagine Wan e
    Hunyuan
    riducono i passi da 30 a 4-8.
  9. Se ancora corto: usalo in hosting. La casella Run su ogni pagina modello apre il modello su PirateDiffusion (Telegram) o BitVector (web, Discord) senza niente da installare.

Esempi

ComfyUI Flux dev su 8 GB

Unet Loader (GGUF): flux1-dev-Q5_K_M.gguf
DualCLIPLoader (GGUF): t5-v1_1-xxl-encoder-Q5_K_M.gguf + clip_l.safetensors
VAE: ae.safetensors | 1024x1024 | 20 steps | --lowvram

Wan 2.2 14B I2V su 12 GB

High noise: wan2.2_i2v_high_noise_14B_Q4_K_M.gguf | Low noise: wan2.2_i2v_low_noise_14B_Q4_K_M.gguf
umt5_xxl_fp8_e4m3fn_scaled.safetensors | 480x832 | 49 frames | lightning LoRA, 4 steps

Forge SDXL su 6 GB

UI: xl | GPU Weights: 4000 | Diffusion in Low Bits: Automatic | 1024x1024 | batch 1

Consigli

  • La RAM di sistema conta quasi quanto la VRAM una volta che fai offload: 32 GB è il minimo confortevole per Flux e Wan, 64 GB per
    FLUX.2
    e Qwen fp16.
  • Chiudi le schede del browser con accelerazione hardware e tutto ciò che usa la GPU (lanciatori di giochi, videochiamate): 1-2 GB di VRAM spariscono lì dentro.
  • Windows riserva VRAM per il desktop; una seconda scheda economica per il display libera tutta la scheda principale per la generazione.
  • GGUF Q8 è visivamente identico a fp16 per immagini; Q5_K_M è il punto giusto per schede da 8 GB; sotto Q4 i dettagli si perdono.
  • fp8 su RTX serie 40 e più recenti è veloce; su RTX 30 e più vecchie funziona ma i pesi vengono upcastati al volo, quindi GGUF può essere più veloce lì.
  • Tieni a portata di mano un prompt di test 512x512 o 1024x1024 e alza una variabile alla volta (risoluzione, poi LoRA, poi ControlNet) per trovare il limite della tua scheda.
  • La classifica heat su questo sito mostra quali release quantizzate e distillate la community usa davvero; le lightning LoRA per Wan e Qwen sono di solito in cima.

Risoluzione dei problemi

Memoria esaurita prima del primo passo

Perché succede
Solo i pesi superano la VRAM.

Come risolverlo
Precisione più piccola (fp8, GGUF Q5) o offload. Controlla la dimensione del file rispetto alla VRAM meno 2 GB.

Memoria esaurita nel sampler ad alta risoluzione

Perché succede
Le attivazioni di attenzione crescono con i pixel.

Come risolverlo
Risoluzione nativa, poi upscale con un modello
upscaler
o un secondo passaggio a basso rumore.

Memoria esaurita solo alla decodifica VAE

Perché succede
La decodifica è il picco di memoria per immagini grandi e video.

Come risolverlo
Decodifica VAE a tiles; flag VAE fp16/bf16; per video decodifica a chunk temporali.

Funziona una volta, fallisce la seconda

Perché succede
Frammentazione e modelli in cache dalla corsa precedente.

Come risolverlo
Scarica i modelli (ComfyUI Manager ha un pulsante), o imposta PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True prima di partire.

Lento ma senza errore dopo aver aggiunto --lowvram

Perché succede
I pesi vengono caricati dalla RAM di sistema a ogni passo.

Come risolverlo
Normale. Riduci il modello (quantizza) così ne resta di più sulla GPU, o usa l'hosting per le famiglie grandi.

Sistema si blocca o si riavvia

Perché succede
RAM di sistema esaurita e file di paging troppo piccolo, o alimentatore al limite.

Come risolverlo
File di paging gestito dal sistema su SSD; un limite di potenza all'80-90% via driver costa poca velocità.

AD
PirateDiffusion
Nessuna installazione: esegui i modelli IA nel cloud
PirateDiffusion è solo su Telegram ed è pensato per i professionisti: migliaia di modelli, LoRA e workflow tramite comandi in chat, con generazione illimitata a prezzo fisso.

Domande

8 GB bastano nel 2026?

Per SD 1.5, SDXL,
Z-Image Turbo
e
Flux dev
in GGUF, sì. Per FLUX.2,
Qwen-Image
e i modelli video 14B è il minimo con offload pesante, e la generazione è lenta; la maggior parte li usa in hosting.

fp8 abbassa la qualità?

Per i modelli immagine, non visibilmente. GGUF Q8 è equivalente; Q5 mostra piccole differenze su testi fini e texture; Q4 perde qualche dettaglio.

Perché un file SDXL da 6.5 GB serve 8 GB?

Encoder di testo, VAE, latente e attivazioni di attenzione si aggiungono ai pesi, e Windows tiene un po' di VRAM per il display.

E Apple Silicon o AMD?

La memoria unificata su
Apple Silicon
fa girare Flux fp8 su macchine da 32 GB, lentamente; AMD gira via ROCm su Linux o ZLUDA / DirectML su Windows, con meno margine. I servizi hosted aggirano entrambi.

Cosa conviene di più, una scheda da 24 GB o un piano hosted?

Un piano hosted per un anno costa meno di una 3090 usata e copre tutte le famiglie insieme; una scheda conviene se generi ore ogni giorno. Molti fanno entrambi.

Link e fonti

Modelli di questa guida

Scritto da
Captain

Guide correlate

Errori e soluzioni
Errori di ComfyUI e come risolverli: nodi rossi, modelli mancanti, CUDA out of memory
I messaggi di errore di ComfyUI che si incontrano per primi, cosa significa ognuno e la soluzione che funziona: nodi personalizzati mancanti (box rossi), "Prompt outputs failed validation", CUDA out of memory, tipo di modello sbagliato in un loader, errori di forma mat1 e mat2, deserializzazione header, incompatibilità tra torch e xformers.
Di Captain
2026-05-12
Errori e soluzioni
Errori e soluzioni di Stable Diffusion WebUI Forge (Flux, SDXL, poca VRAM)
Problemi specifici di Forge e come risolverli: Flux che non si carica o produce rumore, il cambio tipo UI (sd / xl / flux), il cursore "GPU Weights" e gli errori di memoria esaurita, mancanza di text encoder e VAE per Flux, rottura di ControlNet ed estensioni, e le differenze da Automatic1111 che confondono gli utenti.
Di Captain
2026-05-16
Errori e soluzioni
Errori e soluzioni di Automatic1111 (Stable Diffusion WebUI)
Soluzioni per gli errori di Stable Diffusion WebUI che bloccano la maggior parte delle installazioni: "Torch non riesce a usare la GPU", NansException, CUDA out of memory, "Couldn't install torch", xformers, "Stable diffusion model failed to load", estensioni rotte dopo un aggiornamento e problemi specifici di SDXL.
Di Captain
2026-05-14
Modelli video
Wan 2.2 video: configurazione, impostazioni e LoRA per text-to-video e image-to-video
Primi risultati con Wan 2.2: quale dimensione modello scegliere (5B o 14B), la coppia di esperti high-noise / low-noise, risoluzione e numero di frame che funzionano, le LoRA lightning che riducono i render a quattro step, struttura del prompt per il movimento e come usarlo in hosting quando la scheda è troppo piccola.
Di Captain
2026-05-24
Modelli
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: quale famiglia di modelli usare nel 2026
Un confronto pratico tra le famiglie di modelli open per immagini: capacità di seguire il prompt, realismo, anime e illustrazione, rendering del testo, velocità, VRAM, ecosistema LoRA e licenza, con una raccomandazione per ogni tipo di lavoro e hardware.
Di Captain
2026-05-22

Altre guide

Modelli
FLUX.1 Dev: come usarlo, impostazioni migliori e idee creative
Una guida pratica a FLUX.1 Dev di Black Forest Labs: come scrivere i prompt in linguaggio naturale, impostazioni di guida e passi, stacking di LoRA, rendering del testo e idee per prompt che sfruttano i suoi punti di forza.
Di Captain
2026-09-30
Modelli
Stable Diffusion XL 1.0: prompt, impostazioni e cosa fa ancora meglio
Come ottenere il massimo dal modello base ufficiale SDXL 1.0: risoluzioni native, impostazioni di CFG e sampler, il refiner, prompt negativi e idee per stili in cui SDXL brilla ancora.
Di Captain
2026-10-01
Modelli
Stable Diffusion 1.5: il modello classico, usato nel modo giusto
Stable Diffusion 1.5 vale ancora la pena conoscerlo: la risoluzione giusta, CFG e sampler, come usare la sua enorme libreria di LoRA e embedding, e idee creative per prompt adatte a un modello a 512 pixel.
Di Captain
2026-10-02
Modelli
FLUX.2 Dev: come usare il modello più recente di Black Forest Labs
FLUX.2 Dev supporta prompt più lunghi, testo migliore, realismo più forte e modifica con riferimenti multipli. Questa guida spiega il flusso turbo, le impostazioni di guida e risoluzione, la struttura del prompt e idee che sfruttano le sue nuove potenzialità.
Di Captain
2026-10-03
Modelli
Qwen-Image: prompt lunghi, testo perfetto e poster bilingue
Qwen-Image è il modello da usare quando le parole nell'immagine contano. Scopri come scrivere prompt descrittivi lunghi, riprodurre testo in inglese e cinese con precisione, impostare CFG e passi, e esplorare idee creative con layout complessi.
Di Captain
2026-09-29
Modelli
SDXL-Lightning: generazione in quattro passaggi su qualsiasi checkpoint SDXL
Lo LoRA SDXL-Lightning di ByteDance trasforma un rendering SDXL da 30 passaggi in uno da 4. Scopri il numero di passaggi, il CFG da usare, il sampler e come combinarlo con i tuoi checkpoint e LoRA di stile preferiti.
Di Captain
2026-09-30