Bagaimana model imej AI generatif berfungsi: penjelasan mudah tentang difusi, latens dan pengekod teks
Topik: Model
Oleh Quartermaster
Diterbitkan 2025-08-28
Mekanisme di sebalik Stable Diffusion, SDXL, Flux dan model video tanpa matematik: apa kaitan bunyi dengan proses ini, kenapa model berfungsi dalam ruang latens yang dimampatkan, apa fungsi pengekod teks dan VAE, apa yang benar-benar berubah dengan langkah dan panduan, dan kenapa data latihan menentukan apa yang model boleh lukis.
Gambaran keseluruhan
Setiap model imej sekarang adalah denoiser. Semasa latihan, ia dipertontonkan berjuta-juta imej dengan jumlah bunyi rawak yang semakin bertambah, bersama kapsyen setiap imej, dan ia belajar untuk meramalkan bunyi yang ditambah. Semasa penjanaan, proses ini berjalan secara terbalik: mula dari bunyi tulen, tanya model bunyi apa yang ada berdasarkan prompt kamu, buang sedikit bunyi itu, ulang dua puluh atau tiga puluh kali, dan imej yang sepadan dengan kapsyen muncul. Itu saja triknya; "difusi" adalah nama bagi proses tambah bunyi secara beransur-ansur dan buang bunyi ini.
Bekerja dengan piksel saiz penuh terlalu perlahan, jadi sejak Stable Diffusion 1.x, denoising berlaku dalam ruang mampat yang dipanggil latens. Rangkaian kecil berasingan, VAE, memampatkan imej 1024x1024 ke dalam grid 128x128 nombor dan mengembangkannya semula pada akhir. Denoiser (U-Net dalam
SD 1.5
dan
SDXL
, transformer dalam
Flux
,
Qwen
,
Z-Image
dan model video) tidak pernah melihat piksel. Sebab itulah saiz imej perlu gandaan 8 atau 16, dan kenapa langkah decode VAE di akhir boleh habis memori sendiri.
Prompt masuk melalui pengekod teks, yang menukar perkataan kepada senarai nombor yang denoiser boleh gunakan sebagai syarat. SD 1.5 guna satu pengekod CLIP dengan had 77 token, SDXL guna dua, Flux tambah model bahasa T5 besar, dan model 2025 dan 2026 (
Qwen Image
,
FLUX.2
, Z-Image,
Wan 2.2
) guna LLM penuh sebagai pengekod. Perubahan ini terangkan kebanyakan perbezaan cara prompt ditulis: senarai tag untuk model berasaskan CLIP, ayat semula jadi untuk yang berasaskan LLM.
LoRA
, akhirnya, adalah set kecil pembetulan pada berat denoiser (dan kadang-kadang pengekod) yang mengarahkan apa yang dilukis; ia tidak tambah ilmu baru, cuma ubah berat apa yang model asas sudah belajar.
Rujukan
Nama | Jenis | Apakah ia |
|---|---|---|
Denoiser (U-Net / DiT) | component | |
VAE | component | Memampatkan imej ke latens dan sebaliknya. VAE yang salah atau tiada beri imej pudar atau ungu. Flux dan keluarga baru ada VAE 16-saluran sendiri. |
Text encoder | component | CLIP-L, CLIP-G, T5-XXL atau LLM (Qwen2.5-VL, Mistral, Gemma). Tentukan bagaimana prompt difahami dan berapa panjang boleh. |
Scheduler / sampler | setting | Jadual berapa banyak bunyi dibuang setiap langkah dan kaedah nombor yang digunakan. Tukar tekstur dan kelajuan konvergen, bukan kandungan. |
Steps | setting | Berapa banyak ulang denoising. Model distil (Turbo, Lightning, Schnell, Klein) dilatih untuk perlukan 1 hingga 8. |
CFG / guidance | setting | Panduan tanpa pengklasifikasi: berapa banyak ramalan berasaskan prompt dijauhkan dari yang tanpa syarat. Terlalu tinggi bakar warna; model panduan-distil ( Flux dev ) guna satu nilai panduan sahaja. |
Latent size | setting | Saiz imej dibahagi 8 (SD) atau 16 (Flux, Wan). Model lukis terbaik dekat resolusi latihan. |
Flow matching | training method | Pengganti 2024+ untuk jadual bunyi difusi klasik (Flux, SD3, Wan, Z-Image). Idea sama, jalan terus dari bunyi ke imej, kurang langkah diperlukan. |
AD

Lihat teori dalam praktik, tanpa setup
BitVector Prism bagi kamu tukar antara model SDXL, Flux dan Qwen dalam satu aplikasi web, jadi kamu boleh jalankan prompt sama melalui tiga seni bina dan lihat perbezaan yang diterangkan di sini dalam satu minit.
Langkah demi langkah
- Prompt masuk: pengekod teks tukar perkataan jadiembedding. Pada model CLIP, lebih 77 token dipotong atau dibuang; pada model LLM, satu perenggan ok.
- Setiap langkah: denoiser dijalankan dua kali pada SD dan SDXL (dengan dan tanpa prompt); beza, skala dengan CFG, arahkan latens ke prompt. Flux dev jalankan sekali dengan nilai panduan terbina.
- Sampler tolak bunyi ramalan ikut jadual (Karras, eksponen, mudah, beta). Lepas langkah terakhir, latens jadi imej bersih dalam bentuk mampat.
- Decode: VAE kembangkan latens ke piksel. Decode VAE berjubin ada sebab langkah ini boleh lebih dari memori kad 8 GB pada saiz besar.
- Laluan kedua pilihan: hires-fix tambah bunyi sikit dan denoise pada saiz lebih besar;img2imgmula dari imej sedia ada bukan bunyi tulen; inpainting hadkan perubahan pada topeng.
- Model video tambah paksi masa ke latens (klip 5 saat jadi satu latens 3D) dan lain-lain sama, sebab itu mereka perlukan memori sepuluh kali ganda.
Contoh
Prompt sama melalui tiga seni bina
SD 1.5 (CLIP, 77 tokens): "portrait of an old sailor, grey beard, wool cap, harbour background, film photo"
SDXL (two CLIPs): same words, 1024x1024, CFG 6, 28 steps
Flux dev (CLIP-L + T5): "A weathered old sailor with a grey beard and a navy wool cap stands at a harbour railing at dusk; shallow depth of field, Kodak Portra look." guidance 3.5, 24 steps
Nod ComfyUI dipetakan ke komponen
Load Checkpoint -> MODEL (denoiser), CLIP (text encoder), VAE
CLIP Text Encode (prompt) -> KSampler (sampler, steps, CFG, seed) -> VAE Decode -> Save Image
Petua
- Model tak boleh lukis apa yang tak ada dalam data latihannya. Sebab itu fine-tune anime tahu ribuan watak dan model foto tidak, dan kenapa LoRA ada untuk hampir setiap kekurangan.
- Fine-tune (DreamShaper, Juggernaut,Illustrious, Pony) guna seni bina sama dengan berat berbeza; LoRA untuk asas biasanya berfungsi pada fine-tune, LoRA untuk fine-tune sangat berbeza (Pony) sering tidak.
- Model distil tukar fleksibiliti untuk kelajuan. SDXL Lightning pada 4 langkah ok untuk draf; model penuh pada 28 langkah lebih baik untuk akhir.
- Pengekod teks biasanya fail paling besar. Flux dengan T5-XXL fp16 perlukan 9 GB hanya untuk pengekod, sebab itu versi fp8 dan GGUF ada.
- Panduan distil (Flux dev) dan CFG bukan perkara sama. Guna CFG 7 pada Flux dev beri imej terbakar; ikut tetapan halaman model.
- Semua ini berjalan di awan sama seperti tempatan; bezanya cuma siapa yang miliki GPU.
Penyelesaian masalah
Imej keluar kelabu, pudar atau ada rona ungu
Mengapa ia berlaku
VAE hilang atau tak sepadan, atau VAE fp16 overflow pada SDXL.
Cara membaikinya
Muat VAE yang sesuai dengan keluarga; pada SDXL guna VAE fp16-fix.
Prompt panjang sebahagiannya diabaikan
Mengapa ia berlaku
Had token CLIP pada SD 1.5 dan SDXL.
Cara membaikinya
Letak perkataan penting dulu, atau guna model Flux, Qwen atau Z-Image dengan pengekod LLM.
Warna terbakar dan kontras terlalu kuat
Mengapa ia berlaku
CFG terlalu tinggi untuk model, atau CFG digunakan pada model panduan-distil.
Cara membaikinya
Turunkan CFG ke 5 hingga 7 pada SDXL; guna panduan 3 hingga 4 dan CFG 1 pada Flux dev.
Tiling atau subjek berganda pada saiz besar
Mengapa ia berlaku
Latens jauh lebih besar dari resolusi latihan; model ulang diri.
Cara membaikinya
Jana pada saiz asli dan naikkan saiz, atau guna hires-fix dengan denoise 0.4.
Habis memori hanya di akhir
Mengapa ia berlaku
Langkah decode VAE pada saiz penuh.
Cara membaikinya
AD

Semua seni bina dalam satu kluster GPU
PirateDiffusion hos SD 1.5, SDXL, Flux, FLUX.2, Qwen, Z-Image dan model video berdampingan di Telegram, dengan penjanaan tanpa had pada harga tetap. Tiada kiraan VRAM, tiada fail VAE nak cari.
Soalan
Adakah model menyalin imej dari set latihannya?
Ia simpan berat, bukan imej, dan tak boleh ambil balik gambar latihan. Duplikat hampir sama imej latihan yang sangat kerap boleh muncul (lukisan terkenal, logo), sebab itu elak prompt untuk mereka.
Kenapa model baru perlukan lebih memori kalau idenya sama?
Denoiser lebih besar (12 bilion parameter untuk Flux berbanding 0.9 untuk SD 1.5), pengekod teks lebih besar dan latens lebih besar. Versi kuantisasi fp8 dan GGUF turunkan semula.
Apa beza checkpoint dan model?
Checkpoint adalah fail simpan model (denoiser, biasanya dengan pengekod dan VAE sekali). Orang guna perkataan ini sama maksud.
Kenapa seed sama bagi imej berbeza pada PC lain?
GPU berbeza, ketepatan (fp16 vs bf16) atau pelaksanaan sampler; bunyi sama tapi kiraan sedikit berbeza. Mesin sama, tetapan sama, gambar sama.
Adakah lebih banyak langkah sentiasa membantu?
Tidak. Kebanyakan sampler konvergen dalam 25 hingga 30 langkah; lebih dari itu buang masa. Model distil jadi lebih teruk dengan lebih langkah.
Pautan dan sumber
- Denoising Diffusion Probabilistic Models (Ho et al., 2020)
- High-Resolution Image Synthesis with Latent Diffusion Models (Rombach et al., 2022)
- Flow Matching for Generative Modeling (Lipman et al., 2022)
- Flux family page
- SD 1.5 family page
- BitVector web app
Model dalam panduan ini
Ditulis oleh
Quartermaster
Panduan berkaitan
Perkhidmatan awan
Memulakan penjanaan imej AI: gambar pertama anda dalam sepuluh minit
Permulaan mudah untuk pemula sepenuhnya: apa itu model, tiga cara untuk menjalankannya (aplikasi web, bot sembang, PC sendiri), cara menulis prompt pertama, maksud tetapan dan cara membezakan hasil yang baik dengan yang bernasib baik.
Oleh Captain
2025-08-14
Prompting
Langkah, CFG, sampler, penjadual dan benih: tetapan penjanaan dijelaskan dengan nilai selamat
Apa yang setiap tetapan dalam panel penjanaan ubah, nilai yang sesuai untuk setiap keluarga model (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), sampler mana yang patut diketahui, kenapa model distilasi pecahkan peraturan biasa, dan cara guna benih untuk ubah satu perkara pada satu masa.
Oleh Quartermaster
2025-11-19
Model
Checkpoint vs LoRA vs embedding vs ControlNet: fail mana buat apa
Enam jenis fail model yang akan kamu jumpa, apa yang setiap satu ubah, saiznya berapa, letak di mana dan bila guna: checkpoints dan fine-tunes, LoRAs dan saudara LyCORIS mereka, embedding textual inversion, ControlNets dan IP-Adapters, VAEs dan upscalers.
Oleh Quartermaster
2025-10-08
Model
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: keluarga model mana yang patut digunakan pada 2026
Perbandingan praktikal keluarga model imej terbuka: mengikuti arahan prompt, realisme, anime dan ilustrasi, rendering teks, kelajuan, VRAM, ekosistem LoRA dan lesen, dengan cadangan untuk setiap jenis kerja dan perkakasan.
Oleh Captain
2026-05-22
Lagi panduan
Perkhidmatan awan
Flat fee vs tokens: why unlimited plans like Graydient.ai are the best value for AI creators in 2026
A ranked cost comparison, with prices checked on 8 October 2026, of flat-fee unlimited plans like Graydient.ai against token and credit pricing from Midjourney, Leonardo, fal.ai, Replicate, Runway and Kling: what 1,000 images and 1,000 videos a month really cost on each, and why one fixed fee for unlimited images, video, audio, Grok LLM chat and web apps is the best value for creators who iterate.
Oleh Captain
2026-10-08
Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Hak cipta terpelihara