Model
Trends
.ai
Model
Trends
.ai
i migliori modelli di IA open source

Guida a GPU e VRAM per immagini e video AI: cosa serve a ogni modello e cosa comprare (o no)

Argomento: Errori e soluzioni
Di Quartermaster
Pubblicato il 2026-01-07
Quanta memoria grafica serve davvero a ogni famiglia di modelli per avere una velocità utilizzabile (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), cosa ti danno la quantizzazione fp8 e GGUF, perché anche la RAM di sistema e il disco contano, una lista di schede da 8 a 32 GB, note su Mac e AMD, e il punto in cui conviene affittare invece di comprare.

Panoramica

Il numero che decide cosa puoi far girare localmente è la VRAM, la memoria sulla scheda grafica. Un modello deve starci dentro, insieme al suo codificatore di testo, al VAE e al latente di lavoro. Se non ci sta, le interfacce usano la RAM di sistema e la velocità cala da dieci a cinquanta volte, ed è da lì che vengono la maggior parte dei "ci mette 20 minuti per immagine".
I requisiti sono cresciuti in fretta.
SD 1.5
andava bene con 4 GB;
SDXL
vuole 8;
Flux dev
nella sua forma originale vuole 24 e in fp8 o GGUF 12 (usabile con 8);
FLUX.2
e
Qwen Image
sono modelli da 20B che servono 16 GB con quantizzazione;
Wan 2.2
14B video e
LTX-2
vogliono 24 GB per tutto ciò che supera clip brevi a bassa risoluzione, e i modelli audio-video (H3) sono per lo più solo cloud. La quantizzazione (fp8, NF4, GGUF Q4-Q8) è quello che rende i nuovi modelli accessibili su schede di fascia media: pesi più piccoli, qualità un po’ più bassa, stessi prompt.
Questo è anche un discorso per comprare. Una RTX 3090 usata da 24 GB è ancora il miglior affare per le immagini; una 5090 da 32 GB è il massimo locale; tutto con 8 GB è una macchina SDXL. Dall’altra parte c’è l’affitto: un abbonamento a
PirateDiffusion
o
BitVector
costa meno al mese dell’elettricità di una 3090 e include tutti i modelli di questo sito, per questo molti usano SDXL localmente e tutto il resto sul cloud.

Riferimento

Nome
Tipo
Cos'è
SD 1.5
4 GB min / 6 GB comfortable
512x768, con
LoRA
e
ControlNet
. Funziona su quasi tutto, anche laptop vecchi.
SDXL (incl. Pony, Illustrious)
8 GB min / 12 GB comfortable
1024x1024 con una o due LoRA; 8 GB serve la correzione fp16 per il VAE e niente stacking di ControlNet.
Flux dev / Krea / SRPO
12 GB fp8 / 8 GB GGUF Q4 / 24 GB fp16
Il codificatore T5 in fp8 risparmia 4 GB da solo. Q4 è visibilmente più morbido; Q6 o Q8 quasi come fp8.
FLUX.2 dev / Qwen Image / Qwen Image Edit
16 GB (fp8 or Q4) / 24 GB comfortable
Modelli immagini da 20B. Varianti
Klein 4B
e 9B di FLUX.2 girano in 8-12 GB.
Z-Image Turbo / Chroma
8-12 GB
Modelli 6B-9B; Turbo a 8 passi è veloce anche con 8 GB usando offloading.
Wan 2.2 5B (TI2V)
12 GB
Clip brevi 720p con offloading; punto d’ingresso per video locale.
Wan 2.2 14B, LTX-2, Hunyuan Video
16 GB Q4 (slow) / 24 GB / 32 GB best
Due esperti 14B per Wan 2.2; lo swapping a blocchi e GGUF rendono 16 GB possibili a bassa risoluzione e minuti per clip.
System RAM and disk
32 GB RAM / 64 GB for video; NVMe
Offloading e cambio modello vivono in RAM; i modelli si caricano da disco a ogni cambio. 1 TB si riempie in un mese.
AD
Niente GPU? Salta tutta questa guida
BitVector Prism fa girare SDXL, Flux, FLUX.2, Qwen e Z-Image sul suo hardware; serve un browser. Prova i modelli di questo sito a piena precisione prima di decidere se comprare una scheda.

Passo dopo passo

  1. Trova la tua VRAM: Windows Task Manager > Performance > GPU > Dedicated GPU memory; Linux nvidia-smi; Mac usa memoria unificata (tutta la RAM, condivisa).
  2. Confrontala con la tabella: 8 GB significa SDXL nativo e Flux/Z-Image via GGUF; 12 GB aggiunge
    Flux
    fp8 e video piccolo; 16 GB aggiunge FLUX.2/Qwen quantizzati; 24 GB+ fa girare tutto tranne il video più grande a piena qualità.
  3. Scarica la build quantizzata che la pagina del modello indica per il tuo livello (fp8 per 12-16 GB, GGUF Q4-Q6 per 8-12 GB) invece dell’originale fp16.
  4. Imposta l’interfaccia per l’offload:
    ComfyUI
    --lowvram o --novram (o automatico), il cursore pesi GPU di
    Forge
    , --medvram in A1111.
  5. Usa codificatori di testo fp8 (t5xxl_fp8,
    qwen
    2.5 vl fp8) e decodifica VAE a piastrelle; sono i due maggiori risparmi dopo il modello stesso.
  6. Chiudi l’accelerazione GPU del browser, i giochi e le app pesanti del secondo monitor; spesso vanno lì 1-2 GB.
  7. Se un modello ancora non ci sta a velocità usabile, usa quella famiglia sul cloud e tieni la scheda locale per quello che fa bene.
  8. Acquisto: 24 GB usata (3090) o nuova (4090/5090) per video serio locale; 16 GB (4070 Ti Super / 5070 Ti) per immagini inclusi FLUX.2 e Qwen; 12 GB come minimo per Flux fp8; evita schede 8 GB nuove nel 2026.

Esempi

Flag ComfyUI per una scheda da 8 GB

python main.py --lowvram --use-split-cross-attention
Flux: flux1-dev-Q4_K_S.gguf + t5xxl_fp8_e4m3fn + clip_l + ae.safetensors, 1024x1024, 20 steps

Come leggere una pagina modello per la memoria

Variant list: fp16 23.8 GB | fp8 11.9 GB | Q8 12.7 GB | Q6_K 9.8 GB | Q4_K_S 6.8 GB
Rule of thumb: pick the largest variant that leaves 3 GB free after the text encoder (4.9 GB fp8 T5 for Flux)

Consigli

  • La VRAM conta più della velocità. Una scheda vecchia da 24 GB fa girare più modelli di una più veloce da 12 GB.
  • NVIDIA è lo standard: il supporto CUDA è universale. AMD funziona con ROCm su Linux e migliora su Windows, con meno nodi personalizzati supportati; Intel Arc gira via IPEX con avvertenze simili.
  • Apple Silicon
    condivide RAM con GPU: un Mac da 32 GB fa girare Flux fp8 lentamente ma senza esaurire la memoria; un Mac da 16 GB è una macchina SDXL.
  • I modelli quantizzati sono diversi: fp8 (serve una 40-series o più nuova per velocità nativa), NF4 (Forge, veloce su schede piccole), GGUF (ComfyUI, controllo dimensione più preciso). Scegli quello che supporta la tua UI.
  • L’uso della memoria video scala con frame x risoluzione; dimezza il numero di frame prima di abbassare la precisione del modello.
  • Le pagine modello di questo sito mostrano la dimensione file per variante; come regola servono la dimensione file più 2-4 GB di VRAM.

Risoluzione dei problemi

CUDA out of memory

Perché succede
Modello + codificatore + latente superano la VRAM.

Come risolverlo
Build quantizzata, codificatore fp8, VAE a piastrelle, dimensione o batch più piccoli; la nostra guida
CUDA out of memory
ha la checklist completa.

La generazione all’improvviso impiega minuti

Perché succede
Si usa la memoria GPU condivisa (RAM di sistema) perché il modello non ci sta.

Come risolverlo
Controlla in Task Manager "Shared GPU memory"; riduci l’ingombro finché resta a zero.

Il modello fp8 è lento sulla mia 30-series

Perché succede
Il calcolo fp8 nativo serve Ada (40-series) o più nuova; le schede più vecchie convertono al volo.

Come risolverlo
Usa GGUF Q8 o NF4 su schede 20- e 30-series.

Il modello video funziona a 480p ma non a 720p

Perché succede
La dimensione del latente cresce con il quadrato della risoluzione per i frame.

Come risolverlo
Meno frame, risoluzione più bassa e ingrandisci dopo, o usa 720p sul cloud.

Mac esaurisce la memoria a 64 GB

Perché succede
macOS limita la memoria allocabile alla GPU sotto il totale, e fp16 non è sempre disponibile su MPS.

Come risolverlo
Alza il limite wired (sysctl iogpu.wired_limit_mb), usa pesi fp8/GGUF, batch più piccoli.

AD
PirateDiffusion
Video e modelli 20B senza scheda 24 GB
PirateDiffusion fa girare Wan 2.2, LTX-2, FLUX.2 e Qwen Image su GPU server e manda il risultato su Telegram. Prezzo fisso mensile, generazione illimitata, meno della bolletta di una 3090.

Domande

8 GB bastano nel 2026?

Per SDXL,
Z-Image Turbo
e GGUF Flux sì. Per FLUX.2, Qwen Image e video, aspetterai o userai il cloud.

GPU laptop o desktop?

Le schede laptop hanno gli stessi numeri di VRAM ma rallentano; una scheda laptop da 16 GB va bene per immagini, male per video. Desktop per video.

Più RAM di sistema sostituisce la VRAM?

Previene crash e permette offloading, ma con grande perdita di velocità. È un supplemento, non un sostituto.

Quando conviene affittare?

Sotto circa 10 ore di generazione a settimana, quasi sempre. Una 3090 consuma 350 W; aggiungi il prezzo d’acquisto e gli abbonamenti cloud vincono per uso casual e video.

Quale cloud per quale lavoro?

BitVector per app web con modelli pre-caricati; PirateDiffusion per la libreria completa, workflow ComfyUI e video da Telegram. Entrambi linkati da ogni pagina modello.

Link e fonti

Modelli di questa guida

Scritto da
Quartermaster

Guide correlate

Errori e soluzioni
CUDA memoria esaurita: quanta VRAM serve a ogni modello AI e come farlo entrare
Una tabella della VRAM per SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 e HunyuanVideo, e le tecniche per far entrare un modello: quantizzazione fp8 e GGUF, offload su CPU, VAE a tiles, limiti di risoluzione e frame, e quando smettere di lottare e usarlo in hosting.
Di Captain
2026-05-18
ComfyUI
Cos'è ComfyUI? Una guida per principianti ai nodi, ai flussi di lavoro e al primo grafo
ComfyUI spiegato per chi viene da Automatic1111, Fooocus o un'app web: perché è un grafo, i sette nodi nel flusso di lavoro predefinito e cosa fa ciascuno, come caricare un flusso di lavoro da un'immagine, dove vanno i modelli, il Manager per i nodi mancanti e quando è meglio usare uno strumento più semplice o il cloud.
Di Lookout
2025-12-17
App
Eseguire Stable Diffusion, SDXL e Flux su un Mac (Apple Silicon): Draw Things, ComfyUI e cosa aspettarsi
Cosa può e cosa non può fare un Mac da M1 a M4 per immagini e video AI: i tre modi per eseguire i modelli (Draw Things, ComfyUI tramite PyTorch MPS, DiffusionBee), livelli di memoria in base alla configurazione Mac, velocità realistiche per SD 1.5, SDXL e Flux, le impostazioni che evitano immagini nere e crash, e i modelli che valgono l'attesa su un Mac.
Di Captain
2026-01-21
Modelli
Quali modelli AI per immagini provare per primi, e perché: una lista iniziale ordinata
Sette modelli per la prima settimana, scelti per la loro tolleranza più che per l'hype: un fine-tuning fotografico SDXL, un fine-tuning anime, Flux dev, un modello turbo veloce, un modello per inpainting, un modello video e un upscaler, ognuno con il motivo, la memoria necessaria e lo stile di prompt che si aspetta.
Di Captain
2025-09-10
Modelli video
Generazione video AI per principianti: da immagine a video, da testo a video e il primo clip con Wan, LTX-2 e H3
La prima settimana con modelli video open: la differenza tra testo a video e immagine a video e perché iniziare con quest’ultimo, le tre famiglie di modelli da conoscere (Wan 2.2, LTX-2, MiniMax H3), i conteggi di frame e risoluzioni che funzionano, come scrivere un prompt di movimento, cosa aspettarsi da una scheda da 16 o 24 GB rispetto al cloud, e come trasformare clip di cinque secondi in qualcosa di più lungo.
Di Lookout
2026-04-29

Altre guide

Modelli
FLUX.1 Dev: come usarlo, impostazioni migliori e idee creative
Una guida pratica a FLUX.1 Dev di Black Forest Labs: come scrivere i prompt in linguaggio naturale, impostazioni di guida e passi, stacking di LoRA, rendering del testo e idee per prompt che sfruttano i suoi punti di forza.
Di Captain
2026-09-30
Modelli
Stable Diffusion XL 1.0: prompt, impostazioni e cosa fa ancora meglio
Come ottenere il massimo dal modello base ufficiale SDXL 1.0: risoluzioni native, impostazioni di CFG e sampler, il refiner, prompt negativi e idee per stili in cui SDXL brilla ancora.
Di Captain
2026-10-01
Modelli
Stable Diffusion 1.5: il modello classico, usato nel modo giusto
Stable Diffusion 1.5 vale ancora la pena conoscerlo: la risoluzione giusta, CFG e sampler, come usare la sua enorme libreria di LoRA e embedding, e idee creative per prompt adatte a un modello a 512 pixel.
Di Captain
2026-10-02
Modelli
FLUX.2 Dev: come usare il modello più recente di Black Forest Labs
FLUX.2 Dev supporta prompt più lunghi, testo migliore, realismo più forte e modifica con riferimenti multipli. Questa guida spiega il flusso turbo, le impostazioni di guida e risoluzione, la struttura del prompt e idee che sfruttano le sue nuove potenzialità.
Di Captain
2026-10-03
Modelli
Qwen-Image: prompt lunghi, testo perfetto e poster bilingue
Qwen-Image è il modello da usare quando le parole nell'immagine contano. Scopri come scrivere prompt descrittivi lunghi, riprodurre testo in inglese e cinese con precisione, impostare CFG e passi, e esplorare idee creative con layout complessi.
Di Captain
2026-09-29
Modelli
SDXL-Lightning: generazione in quattro passaggi su qualsiasi checkpoint SDXL
Lo LoRA SDXL-Lightning di ByteDance trasforma un rendering SDXL da 30 passaggi in uno da 4. Scopri il numero di passaggi, il CFG da usare, il sampler e come combinarlo con i tuoi checkpoint e LoRA di stile preferiti.
Di Captain
2026-09-30