Model
Trends
.ai
Model
Trends
.ai
model AI sumber terbuka terbaik

Keperluan VRAM untuk setiap model imej dan video AI popular (2026): ketepatan penuh, FP8 dan GGUF

Topik: Ralat & penyelesaian
Oleh P.I. Panda
Diterbitkan 2026-10-06
Berapa banyak VRAM yang anda perlukan untuk SD 1.5, SDXL, SD 3.5, Z-Image Turbo, FLUX.1, FLUX.2 Klein dan Dev, Qwen-Image, Wan 2.2, HunyuanVideo 1.5 dan LTX-2, pada ketepatan penuh, FP8 dan 4-bit GGUF, dengan kad dan lesen yang sesuai untuk setiap satu, apa yang boleh dijalankan oleh setiap saiz GPU dari 8 hingga 48 GB, dan susunan pembaikan apabila model tidak muat.

Gambaran keseluruhan

Jawapan ringkas: 8 GB
VRAM
boleh menjalankan
SDXL
dan model kecil yang pantas seperti
Z-Image Turbo
dan
FLUX.2 Klein 4B
. 12 GB boleh menjalankan
FLUX.1
dan
Qwen-Image
setelah mereka dikuantisasi. 24 GB boleh menjalankan hampir semua model imej serta video
Wan 2.2
dalam FP8. Model besar terbaru,
FLUX.2 Dev
dan
LTX-2
pada kualiti penuh, memerlukan 32 GB atau lebih.
Jadual di bawah menyenaraikan setiap model terbuka popular dengan memori yang diperlukan pada ketepatan penuh, FP8 dan sebagai fail 4-bit GGUF, menghasilkan pada kira-kira 1024x1024. Penguji yang berbeza mengira pengekod teks secara berbeza, jadi anggap setiap nombor sebagai julat dan bukan had keras. Tiga perkara yang jadual sembunyikan: SDXL masih model termurah untuk dijalankan dengan baik (asasnya muat dalam 8 GB, tetapi
LoRA
,
ControlNet
dan peningkatan resolusi menambah memori, sebab itu 12 GB adalah angka yang selesa); FLUX.2 Klein 4B adalah yang paling sesuai untuk kad kecil sekarang (kira-kira 13 GB pada ketepatan penuh, kira-kira separuh dalam FP8, Apache 2.0); dan FLUX.2 Dev bukan model rumah pada ketepatan penuh (seorang pengguna
ComfyUI
menjalankan FP8 pada 12 GB RTX 3060, menggunakan kira-kira 70 GB RAM sistem untuk itu).
Ketepatan mengubah segalanya. BF16/FP16 adalah kualiti penuh dan saiz penuh, kira-kira 2 GB VRAM setiap bilion parameter. FP8 mengurangkannya separuh, kira-kira 1 GB setiap bilion, dan kebanyakan orang tidak dapat bezakan output FP8 dari ketepatan penuh. Fail GGUF (Q8, Q5, Q4 dan lebih rendah) mengecilkan model lebih jauh: Q8 hampir kualiti penuh, Q4 menukar sedikit butiran untuk saiz yang jauh lebih kecil, dan di bawah Q4 kualiti jatuh dengan cepat. Model bukan satu-satunya yang menggunakan memori: pengekod teks (T5 untuk FLUX.1, model bahasa untuk Qwen-Image dan
FLUX.2
), VAE, LoRA, ControlNet dan imej itu sendiri semua mengambil ruang, dan ComfyUI secara automatik memindahkan sebahagian daripadanya ke RAM sistem, sebab itu dua orang dengan kad yang sama melaporkan nombor berbeza. Angka disemak pada 6 Oktober 2026 berdasarkan kad model dan ujian komuniti; dikemas kini setiap bulan.

Rujukan

Model
Full precision
FP8
4-bit / GGUF
Comfortable card
Stable Diffusion 1.5
0.9B
CreativeML OpenRAIL-M. Boleh dijalankan hampir pada apa saja.
Full precision
4 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
6-8 GB
SDXL dan fine-tunes: Pony, Illustrious, NoobAI
3.5B
OpenRAIL++ (fine-tunes berbeza). 12 GB beri ruang untuk LoRA, ControlNet dan peningkatan resolusi dalam satu aliran kerja.
Full precision
6-8 GB
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
12 GB
SD 3.5 Large
8.1B
Lesen Komuniti Stability.
Full precision
16-24 GB
FP8
lebih rendah
daripada ketepatan penuh
4-bit / GGUF
lebih rendah
daripada FP8
Comfortable card
24 GB
Z-Image Turbo
6B
Apache 2.0. 8 langkah; model pantas untuk kad kecil.
Full precision
~16 GB
FP8
~8 GB
4-bit / GGUF
~6 GB
Comfortable card
8-12 GB
FLUX.2 Klein 4B
4B
Apache 2.0, guna komersial dibenarkan. Sesuai terbaik untuk kad 8 GB pada 2026.
Full precision
~13 GB
FP8
~8 GB
4-bit / GGUF
~4-5 GB
Comfortable card
8-12 GB
FLUX.2 Klein 9B
9B
Lesen Bukan Komersial FLUX (output boleh guna komersial).
Full precision
~29 GB
FP8
~17 GB
4-bit / GGUF
~8-9 GB
Comfortable card
16-24 GB
FLUX.1 Schnell
12B
Apache 2.0. 4 langkah.
Full precision
~24 GB
FP8
~12 GB
4-bit / GGUF
~6-8 GB
Comfortable card
12-16 GB
FLUX.1 Dev
12B
Lesen bukan komersial. Pengekod T5 fp8 jimat kira-kira 4 GB sendiri.
Full precision
~24 GB
lebih dengan pengekod teks dimuat
FP8
~12-18 GB
4-bit / GGUF
~7 GB
Comfortable card
16-24 GB
Qwen-Image
20B
Apache 2.0. Rendering teks kuat; perlukan pengekod Qwen2.5-VL dalam FP8 pada apa saja bawah 32 GB.
Full precision
~41 GB
FP8
~20 GB
4-bit / GGUF
~12-13 GB
Comfortable card
24 GB
FLUX.2 Dev
32B
Lesen bukan komersial. Jangkaan penjanaan perlahan tanpa kad 32 GB.
Full precision
~90 GB
dengan pengekod teksnya
FP8
32 GB
muat kad 32 GB
4-bit / GGUF
12-16 GB
pemindahan beban berat
Comfortable card
32 GB+
HunyuanImage 3.0
80B MoE
Lesen Komuniti Tencent. Hanya pusat data; guna melalui perkhidmatan hos.
Full precision
multi-GPU
pada setiap ketepatan
FP8
n/a
4-bit / GGUF
n/a
Comfortable card
pusat data
Wan 2.1 T2V 1.3B
1.3B
Video 480p
Apache 2.0.
Full precision
8.19 GB
rasmi
FP8
8 GB
dalam praktik
4-bit / GGUF
n/a
Comfortable card
12 GB
Wan 2.2 TI2V 5B
5B
Video 720p
Apache 2.0.
Full precision
GPU pengguna
rasmi, diuji pada RTX 4090
FP8
n/a
4-bit / GGUF
8 GB
GGUF Q8
Comfortable card
24 GB
Wan 2.2 A14B T2V/I2V
2 x 14B
Video 720p
Apache 2.0. Dua pakar 14B, satu dalam VRAM pada satu masa, sebab itu kad 24 GB boleh urus. Wan 2.5-3.0 hanya API.
Full precision
80 GB
rasmi, satu GPU
FP8
~14 GB
setiap pakar
4-bit / GGUF
12-16 GB
GGUF
Comfortable card
24-32 GB
HunyuanVideo 1.5
8.3B
Video 720p, 1080p dengan peningkatnya
Lesen Komuniti Tencent.
Full precision
14 GB
rasmi, dengan pemindahan beban
FP8
14 GB
dalam praktik
4-bit / GGUF
n/a
Comfortable card
24 GB+
80 GB untuk kualiti terbaik
LTX-2 / LTX-2.3
19B / 22B
Video sehingga 4K
Lesen Komuniti LTX-2. Audio diselaraskan.
Full precision
32 GB+
rasmi
FP8
n/a
4-bit / GGUF
24 GB
FP4
Comfortable card
32 GB
AD
Setiap baris jadual ini, tiada VRAM diperlukan
BitVector Prism menjalankan SDXL, Z-Image, FLUX.1, FLUX.2 dan Qwen-Image pada ketepatan penuh pada GPU sendiri. Pilih model dari laman ini, taip prompt, jana dalam pelayar. Tiada muat turun.

Langkah demi langkah

  1. Cari VRAM anda (Pengurus Tugas > Prestasi > GPU, atau nvidia-smi) dan padankan dengan tahap di bawah; kemudian pilih model yang kolum "kad selesa" adalah sama atau lebih rendah.
  2. 6-8 GB (RTX 3060 Ti, 4060, 2070):
    SD 1.5
    dan SDXL termasuk
    Pony
    dan Illustrious dengan satu atau dua LoRA; Z-Image Turbo dan FLUX.2 Klein 4B dalam FP8 atau GGUF; FLUX.1 dalam GGUF Q4, perlahan;
    Wan 2.1
    1.3B pada 480p dan Wan 2.2 5B dalam GGUF dengan pemindahan beban.
  3. 12 GB (RTX 3060 12GB, 4070, 5070): semua di atas, lebih pantas, dengan ruang untuk ControlNet dan peningkatan resolusi;
    FLUX.1 Dev
    dan Schnell dalam FP8 atau GGUF; Qwen-Image dalam GGUF Q4;
    FLUX.2 Klein 9B
    dalam GGUF; Wan 2.2 A14B dalam GGUF Q4 dengan pemindahan beban pada resolusi rendah dan klip pendek.
  4. 16 GB (RTX 4060 Ti 16GB, 4070 Ti Super, 5070 Ti, 5080): FLUX.1 Dev dalam FP8 dengan ruang lebihan; Z-Image Turbo dan Klein 4B pada ketepatan penuh; Qwen-Image dalam GGUF Q4-Q5;
    HunyuanVideo
    1.5 dengan pemindahan beban; Wan 2.2 A14B dalam GGUF Q5 pada 720p (laporan komuniti).
  5. 24 GB (RTX 3090, 4090): hampir semua model imej kecuali FLUX.2 Dev pada ketepatan penuh; Qwen-Image dalam FP8 atau Q8; Wan 2.2 A14B dalam FP8 dan Wan 2.2 5B pada ketepatan penuh; LTX-2 dalam FP4; kebanyakan latihan LoRA untuk SDXL dan Flux.
  6. 32 GB (RTX 5090): FLUX.2 Dev dalam FP8; LTX-2 dan
    LTX-2.3
    dalam FP8; Wan 2.2 A14B pada 720p tanpa kehabisan memori di tengah klip.
  7. 48 GB dan ke atas (RTX 6000 Ada, A100, H100): Qwen-Image ketepatan penuh, LTX-2 dan FLUX.2 Dev dengan ruang lebihan; video panjang atau resolusi tinggi, penjanaan berkelompok dan latihan serius.
  8. Muat turun ketepatan untuk tahap anda dari halaman model di laman ini (ia menyenaraikan setiap varian dengan saiz failnya), muat pengekod teks dalam FP8, dan simpan 32 GB RAM sistem (64 GB untuk model terbesar) untuk pemindahan beban.

Contoh

FLUX.1 Dev pada kad 12 GB (ComfyUI)

Load Diffusion Model: flux1-dev-fp8-e4m3fn (11.9 GB) or UnetLoaderGGUF flux1-dev-Q6_K (9.8 GB) | DualCLIPLoader: clip_l + t5xxl_fp8_e4m3fn_scaled | Load VAE: ae
1024x1024, 20 steps, euler, simple, guidance 3.5 | VAE Decode (Tiled) if the last step fails

Qwen-Image pada 16 GB

UnetLoaderGGUF: qwen_image_Q4_K_M.gguf (~12.5 GB) | CLIPLoader: qwen_2.5_vl_7b_fp8_scaled, device cpu | Load VAE: qwen_image_vae
1328x1328 native; start at 1024x1024, 20 steps, cfg 2.5

Model yang sama tanpa kad langsung

/render <flux-dev> a studio photo of a vintage camera on a walnut desk, soft window light /size:1024x1024 (PirateDiffusion, Telegram)

Petua

  • Apabila anda lihat CUDA kehabisan memori, buat ini mengikut urutan: tukar ke versi FP8 atau GGUF model yang sama (penjimatan tunggal terbesar); turunkan resolusi atau panjang klip (memori bertambah dengan bilangan piksel, 1536 ke 1024 px kurangkan banyak); guna penyahkodan VAE berjubin; muat pengekod teks dalam FP8 atau simpan di CPU; tutup aplikasi GPU lain (pelayar dan permainan juga guna VRAM).
  • Pemindahan beban berfungsi tapi anda bayar dari segi kelajuan dan RAM sistem: model boleh berjalan pada kad "terlalu kecil" untuknya, beberapa kali lebih perlahan, dan anda mungkin perlukan 32-64 GB atau lebih RAM sistem.
  • Lesen dalam satu baris: Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image dan
    Wan
    2.1/2.2 adalah Apache 2.0 (guna komersial dibenarkan); FLUX.1 Dev, FLUX.2 Dev dan Klein 9B guna lesen bukan komersial Black Forest Labs, yang melarang guna model dalam produk atau perkhidmatan komersial tapi membenarkan guna imej yang dijana secara komersial. Lesen berubah; halaman model pautkan lesen terkini.
  • Beli kad 32 GB untuk jalankan FLUX.2 Dev atau LTX-2 untuk projek hujung minggu jarang berbaloi; jika model yang anda mahu ada dalam baris 24 GB+, sewa ikut jam atau pelan awan kadar tetap biasanya lebih murah dan pantas daripada pemindahan beban pada kad kecil.
  • Peraturan per bilion parameter: 2 GB pada BF16, 1 GB pada FP8, kira-kira 0.6 GB pada Q4, tambah 2-5 GB untuk pengekod, VAE dan laten.
  • Untuk video, resolusi dan panjang klip sama penting dengan model; panduan rakan tentang VRAM untuk video AI jelaskan itu.

Penyelesaian masalah

CUDA kehabisan memori pada kad yang jadual kata ok

Mengapa ia berlaku
Pengekod teks ketepatan penuh, tumpukan LoRA, ControlNet atau resolusi tinggi di atas model.

Cara membaikinya
Pengekod FP8, satu LoRA, resolusi asli, VAE berjubin; panduan CUDA kehabisan memori ada versi panjang.

Penjanaan sangat perlahan walaupun tiada kerosakan

Mengapa ia berlaku
Pemindahan beban automatik ke RAM sistem.

Cara membaikinya
Turun ke ketepatan seterusnya (FP8 ke Q6, Q6 ke Q4) sehingga Memori GPU Kongsi hampir sifar.

FLUX.2 Dev "berfungsi" pada 12 GB tapi perlukan 70 GB RAM

Mengapa ia berlaku
Berat FP8 ditukar dari memori sistem.

Cara membaikinya
Guna Klein 4B/9B secara tempatan dan FLUX.2 Dev di awan atau kad 32 GB.

Tidak dapat bezakan FP8 dari ketepatan penuh, jadi kenapa Q4 nampak lembut?

Mengapa ia berlaku
Q4 buang lebih banyak butiran daripada FP8; di bawah Q4 kualiti jatuh cepat.

Cara membaikinya
Guna Q6 atau Q8 bila muat; Q4 untuk draf.

Kekeliruan lesen pada FLUX

Mengapa ia berlaku
Schnell dan Klein 4B adalah Apache 2.0; Dev, FLUX.2 Dev dan Klein 9B bukan komersial.

Cara membaikinya
Semak kolum lesen dan kad model sebelum guna model dalam produk.

AD
PirateDiffusion
Baris 24 GB+, dari telefon anda
PirateDiffusion hoskan FLUX.2 Dev, Qwen-Image, Wan 2.2 14B dan LTX-2 pada perkakasan pelayan dan jalankan dari arahan Telegram. Penjanaan tanpa had dengan harga bulanan tetap; tiada kad, tiada pemindahan beban, tiada 70 GB RAM.

Soalan

Bolehkah saya jalankan Flux pada 8 GB VRAM?

Boleh, dengan fail yang dikuantisasi. FLUX.1 dalam GGUF Q4 perlukan kira-kira 7 GB, dan FLUX.2 Klein 4B dalam FP8 kira-kira 8 GB. Jangkaan penjanaan lebih perlahan daripada kad 12 atau 16 GB. FLUX.1 ketepatan penuh perlukan kira-kira 24 GB.

Adakah 12 GB cukup untuk SDXL?

Ya. SDXL sendiri muat dalam 8 GB; 12 GB beri ruang untuk LoRA, ControlNet dan peningkatan resolusi dalam satu aliran kerja.

Berapa banyak VRAM yang Wan 2.2 perlukan?

Ia bergantung pada versi. Model 5B berjalan pada 8 GB sebagai fail GGUF dan selesa pada 24 GB. Model A14B rasmi perlukan 80 GB tanpa pemindahan beban, tapi versi FP8 berjalan baik pada 24 GB dan versi GGUF berjalan pada 12-16 GB dengan pemindahan beban.

Adakah RAM sistem penting?

Ya, apabila mula pemindahan beban. 32 GB adalah minimum yang munasabah untuk Flux dan Wan, dan model terbesar (FLUX.2 Dev pada kad 12 GB, contohnya) boleh guna 64 GB atau lebih.

Model mana yang boleh saya guna secara komersial?

Z-Image Turbo, FLUX.2 Klein 4B, FLUX.1 Schnell, Qwen-Image dan Wan 2.1/2.2 (Apache 2.0). FLUX.1 Dev, FLUX.2 Dev dan Klein 9B bukan komersial untuk model itu sendiri, walaupun imej yang anda jana boleh digunakan secara komersial. Sentiasa semak kad model.

Adakah ada Wan terbaru yang saya boleh jalankan di rumah?

Tidak. Wan 2.2 adalah keluaran Wan terbaru dengan berat boleh muat turun; Wan 2.5, 2.6, 2.7 dan 3.0 hanya API.

Pautan dan sumber

Model dalam panduan ini

Ditulis oleh
P.I. Panda

Panduan berkaitan

Model video
Berapa Banyak VRAM yang Anda Perlukan untuk Video AI? Wan 2.2, HunyuanVideo 1.5 dan LTX-2 Mengikut Saiz GPU (2026)
VRAM yang diperlukan untuk menjalankan Wan 2.2, HunyuanVideo 1.5 dan LTX-2 secara tempatan, mengikut saiz GPU, resolusi dan panjang klip: apa yang kad 8, 12-16, 24, 32 dan 48+ GB boleh buat, kenapa video memerlukan kos seratus kali ganda imej, trik offloading yang membolehkan model 14B muat pada 24 GB, masa penjanaan yang realistik, dan bila sewa lebih baik daripada beli.
Oleh P.I. Panda
2026-10-06
Ralat & penyelesaian
CUDA kehabisan memori: berapa banyak VRAM yang diperlukan setiap model AI dan cara memuatkannya
Jadual VRAM untuk SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 dan HunyuanVideo, serta teknik yang membuat model muat: kuantisasi fp8 dan GGUF, pemindahan CPU, VAE berjubin, had resolusi dan bingkai, dan bila perlu berhenti berusaha dan gunakan yang dihoskan.
Oleh Captain
2026-05-18
Ralat & penyelesaian
Panduan GPU dan VRAM untuk imej dan video AI: apa yang setiap model perlukan dan apa yang patut dibeli (atau tidak)
Berapa banyak memori grafik yang benar-benar diperlukan oleh setiap keluarga model pada kelajuan yang boleh digunakan (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), apa yang fp8 dan kuantisasi GGUF berikan, kenapa RAM sistem dan cakera juga penting, senarai tahap kad dari 8 hingga 32 GB, nota Mac dan AMD, dan bila sewa lebih murah daripada beli.
Oleh Quartermaster
2026-01-07
Model
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: keluarga model mana yang patut digunakan pada 2026
Perbandingan praktikal keluarga model imej terbuka: mengikuti arahan prompt, realisme, anime dan ilustrasi, rendering teks, kelajuan, VRAM, ekosistem LoRA dan lesen, dengan cadangan untuk setiap jenis kerja dan perkakasan.
Oleh Captain
2026-05-22
Ralat & penyelesaian
Ralat ComfyUI dan cara membaikinya: nod merah, model hilang, CUDA kehabisan memori
Mesej ralat ComfyUI yang biasa orang hadapi, maksud setiap satu dan cara baiki yang berkesan: nod tersuai hilang (kotak merah), "Prompt outputs failed validation", CUDA kehabisan memori, jenis model salah dalam pemuat, ralat bentuk mat1 dan mat2, deserialisasi header, ketidakpadanan torch dan xformers.
Oleh Captain
2026-05-12
Perkhidmatan awan
PirateDiffusion: jalankan mana-mana model dari Telegram, tiada GPU diperlukan
Perintah penting dalam bot Telegram PirateDiffusion: /render dengan kata pencetus model, pemberatan (( )) dan [[ ]], #recipes, /adetailer, peningkatan /highdef dan /facelift, /remix, /inpaint, aliran kerja ComfyUI dengan /wf /run:, dan kemahiran baru // yang memilih model untuk kamu.
Oleh Captain
2026-10-03
Aplikasi
BitVector: Vektor untuk Discord, Spyglass di web dan sembang Prism
Cara menjalankan model yang dihoskan dan aliran kerja ComfyUI dari Discord dengan bot Vector, dari mana-mana pelayar dengan Spyglass, dan dengan berbual menggunakan Prism: pautan akaun, /ai render dan /ai workflow, media awal untuk imej-ke-imej dan imej-ke-video, kemahiran, dan pembetulan untuk ralat yang biasa dialami.
Oleh Captain
2026-10-03

Lagi panduan

Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29
Model
SDXL-Lightning: penjanaan empat langkah pada mana-mana checkpoint SDXL
LoRA SDXL-Lightning dari ByteDance menukar render SDXL 30 langkah menjadi hanya 4 langkah. Ketahui bilangan langkah, CFG yang perlu digunakan, sampler, dan cara gabungkan dengan checkpoint dan LoRA gaya kegemaran kamu.
Oleh Captain
2026-09-30