Glosari penjanaan imej dan video AI: 60 istilah dari checkpoint ke VAE, diterangkan dalam satu ayat setiap satu
Topik: Prompting
Oleh Captain
Diterbitkan 2026-04-15
Gambaran keseluruhan
Setiap komuniti cipta kosa kata dan komuniti ini cipta satu yang besar dengan cepat. Glosari di bawah adalah rujukan yang panduan lain di laman ini anggap; setiap istilah dapat satu ayat, keluarga atau alat yang ia miliki jika penting, dan panduan panjang untuk dibaca seterusnya. Istilah dikelompokkan: model dan seni bina, fail, tetapan, teknik, prompting, video, perkakasan.
Keluarga di laman ini (
Flux
,
SDXL
,
Wan
dan sebagainya) diterangkan di halaman hub mereka sendiri, dan setiap halaman model tunjukkan istilah yang digunakan: jenisnya, keluarganya, kata pencetusnya, tetapan yang disyorkan. Jika ada perkataan di halaman model yang tiada di sini, chat komuniti yang dipautkan dari FAQ adalah tempat untuk bertanya.
Rujukan
Nama | Jenis | Apakah ia |
|---|---|---|
Checkpoint / base model | file | Berat model penuh dalam satu fail (atau beberapa fail untuk model era Flux). Boleh guna sendiri. Lihat checkpoint vs LoRA vs embedding. |
Fine-tune | model | Checkpoint yang dilatih semula dengan data baru (DreamShaper, Illustrious , Pony). Seni bina sama dengan asasnya. |
Merge | model | Checkpoint yang dibuat dengan purata checkpoint lain. Warisi keluarga. |
LoRA / LyCORIS / DoRA | file | Tambahan kecil yang ubah tingkah laku checkpoint; perlukan kata pencetus dan berat. Lihat panduan LoRA. |
Embedding / textual inversion | file | Token yang dipelajari untuk pengekod teks, taip dengan nama; kebanyakannya embedding negatif pada SD 1.5 dan SDXL. |
VAE | component | Encoder/decoder antara piksel dan latents; VAE yang salah buat warna jadi pudar. |
Text encoder (CLIP, T5, LLM) | component | Tukar prompt jadi nombor; tentukan dialek prompt (tag vs ayat). |
U-Net / DiT / MMDiT | architecture | |
MoE (mixture of experts) | architecture | Beberapa sub-model yang satu dijalankan setiap langkah ( Wan 2.2 pakar bunyi tinggi/rendah, HunyuanImage 3). |
Diffusion / flow matching | training | Belajar buang bunyi langkah demi langkah; flow matching adalah formulasi lebih terus 2024+. Lihat cara model berfungsi. |
Distilled (Turbo, Lightning, Schnell, Klein, Hyper) | model | |
Guidance-distilled | model | CFG dimasukkan (dev Flux); nilai panduan gantikan CFG dan prompt negatif tiada kesan. |
fp16 / bf16 / fp8 / NF4 / GGUF Q4-Q8 | precision | Cara berat disimpan; ketepatan lebih rendah bermakna fail dan VRAM lebih kecil, kualiti sedikit kurang. Lihat panduan VRAM. |
Safetensors / ckpt | format | Format tensor selamat sahaja vs pickle yang jalankan kod. Lihat muat turun selamat. |
Steps | setting | Ulangan denoising; 20-30 biasa, 4-8 distilled. |
CFG scale | setting | Betapa kuat prompt mengarah; 5-7 SDXL, 1 Flux. Lihat tetapan diterangkan. |
Sampler / scheduler | setting | Kaedah nombor dan lengkung bunyi (Euler, DPM++ 2M; Karras, simple, beta). |
Seed | setting | Bunyi mula; seed tetap, imej boleh ulang. |
Denoise | setting | |
Shift / sigma | setting | Di mana model flow guna langkahnya (Flux, Wan, Z-Image). |
Latent | concept | Imej kerja yang dimampatkan (1/8 atau 1/16 saiz) yang denoiser edit. |
Resolution / native size | concept | 512 (SD 1.5), 1024 (SDXL, Flux); gandaan 8 atau 16. |
Hires-fix | technique | |
Upscaler (ESRGAN, SwinIR) | technique | Rangkaian pembesaran piksel dijalankan selepas penjanaan. |
technique | Jana dari imej sedia ada tambah bunyi. Lihat img2img dan inpainting. | |
Inpainting / outpainting | technique | Jana semula kawasan bertutup / luaskan kanvas. |
ControlNet / T2I-Adapter | technique | |
IP-Adapter / Redux / reference | technique | Penyesuaian gaya atau identiti berdasarkan imej. |
Face detailer / ADetailer | technique | Topeng muka automatik dan inpaint pada resolusi lebih tinggi. |
Tiled diffusion / Ultimate SD Upscale | technique | Imej besar dalam jubin bertindih dengan Tile ControlNet. |
Prompt / negative prompt | prompting | Apa nak lukis / apa nak elak (SD dan SDXL sahaja). Lihat asas prompt dan negatif. |
Trigger word | prompting | Token yang LoRA dilatih dengannya; perlu supaya ia berfungsi. |
Weight (word:1.3) | prompting | Penekanan perhatian pada model CLIP. |
Quality tags / score tags | prompting | masterpiece, best quality (Illustrious); score_9 (Pony). Anime SDXL sahaja. |
Token limit (77) | prompting | Saiz chunk CLIP; sebab prompt panjang terpotong pada SD dan SDXL. |
Prompt bleeding | prompting | Sifat melekat pada objek yang salah. |
T2I / T2V / I2V / TI2V / V2V | video | Teks ke imej / teks ke video / imej ke video / kedua-dua / video ke video. |
Frames and fps | video | 81 frame pada 16 fps adalah 5 saat pada Wan; memori bertambah ikut frame. |
High-noise / low-noise expert | video | Dua model 14B Wan 2.2 untuk langkah awal dan akhir; LoRA sasarkan satu. |
First / last frame | video | Kondisi keyframe (FLF2V) untuk gerakan terkawal. |
VACE / Fun ControlNet | video | Model suntingan dan kawalan video dalam keluarga Wan. |
Frame interpolation (RIFE, FILM) | video | Jana frame antara untuk naikkan fps. |
VRAM / offloading / block swap | hardware | Memori GPU; pindah sebahagian model ke RAM sistem bila tak muat. Lihat panduan VRAM. |
CUDA / MPS / ROCm | hardware | Backend pengiraan NVIDIA / Apple / AMD. |
tool | ||
Custom node | tool | Sambungan ComfyUI; dipasang dengan Manager. |
Heat score | this site | Sejauh mana model popular sekarang, dari muat turun, penggunaan dan carian; diterangkan di halaman FAQ. |
AD

Belajar dengan buat, bukan baca
BitVector Prism label tetapan dengan perkataan sama seperti glosari ini dan muat nilai betul ikut model. Buka sebelah halaman ini dan cuba setiap istilah pada imej sebenar. Tiada pemasangan.
Langkah demi langkah
- Baca halaman model dari atas ke bawah dengan glosari dibuka: jenis, keluarga, kata pencetus, baris tetapan bawah setiap contoh.
- Pilih tiga istilah yang buat kamu keliru dan baca panduan pautan untuk setiap satu; panduan ditulis supaya glosari ini cukup konteks.
- Bila jumpa istilah baru dalam thread forum, periksa sama ada ia fail, tetapan, teknik atau istilah video; kebanyakan kekeliruan datang dari campur kategori ini.
- Kembali bila keluarga baru muncul; halaman hub tambah istilah mereka sendiri (pakar Wan 2.2, panduan Flux) dan senarai ini dikemas kini dengan mereka.
Contoh
Baris tetapan halaman model, diterjemah
"<lora:zavy-cinematic-xl:0.7> zavy cinematic, ... | 1024x1024 | DPM++ 2M Karras | 28 steps | CFG 6 | seed 4471"
LoRA at weight 0.7 with its trigger word; native SDXL size; sampler + scheduler; 28 denoising steps; CFG 6; fixed seed
Nama workflow Wan 2.2, diterjemah
wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors -> Wan 2.2, image to video, the high-noise expert, 14B parameters, fp8 precision, safetensors format
Petua
- Tiga perkataan yang paling banyak buat pemula salah: keluarga (LoRA mesti padan), kata pencetus (LoRA perlukan), dan denoise (img2img hidup atau mati dengannya).
- Bila dua panduan tak setuju tentang CFG, mereka bercakap tentang keluarga berbeza; periksa yang mana.
- "Model" maksud checkpoint dalam kebanyakan ayat, tapi di laman ini "model" adalah mana-mana entri katalog termasuk LoRA; label jenis beritahu yang mana.
- Istilah video adalah idea sama dengan paksi masa; kalau kamu tahu T2I dan img2img kamu tahu T2V dan I2V.
- Rakan awan guna kosa kata sama: benderaPirateDiffusionadalah /steps, /guidance, /seed, /size; panelBitVectorguna nama sama.
Penyelesaian masalah
Dua sumber guna perkataan sama dengan maksud berbeza
Mengapa ia berlaku
Istilah berubah antara era SD 1.5, SDXL dan Flux ("guidance" vs "CFG").
Cara membaikinya
Fokus pada keluarga: CFG untuk SD/SDXL, guidance untuk Flux.
"Model" di Civitai maksud lain dari sini
Mengapa ia berlaku
Civitai kumpul versi di bawah satu model; laman ini senaraikan setiap versi berasingan.
Cara membaikinya
Padankan ikut hash, bukan nama.
Tetapan di halaman model tiada dalam UI saya
Mengapa ia berlaku
Nama UI berbeza (kuat denoising vs denoise; langkah hires vs laluan kedua).
Cara membaikinya
Baris glosari beri alias; panduan node ComfyUI peta nama node.
AD

Setiap istilah adalah arahan
PirateDiffusion ubah kosa kata jadi bendera Telegram: /steps, /guidance, /seed, /size, tag LoRA dan [[negatives]]. Ribuan model, render tanpa had, harga tetap.
Soalan
Adakah checkpoint sama dengan model?
Dalam penggunaan biasa ya. Secara ketat, checkpoint adalah fail simpanan model.
Apa beza guidance dan CFG?
CFG adalah panduan tanpa pengklasifikasi yang digunakan masa jalan pada SD dan SDXL; dev Flux masukkan terus dan tunjuk satu nilai panduan.
Di mana istilah khusus video?
Dalam kumpulan video di atas dan di halaman keluarga Wan,
LTX
dan H3; panduan mula video terangkan mereka.
Perlukah saya tahu semua ini untuk buat imej?
Tidak. Keluarga, kata pencetus dan denoise tutup 80 peratus masalah; selebihnya kamu belajar bila jumpa.
Pautan dan sumber
Model dalam panduan ini
Ditulis oleh
Captain
Panduan berkaitan
Perkhidmatan awan
Memulakan penjanaan imej AI: gambar pertama anda dalam sepuluh minit
Permulaan mudah untuk pemula sepenuhnya: apa itu model, tiga cara untuk menjalankannya (aplikasi web, bot sembang, PC sendiri), cara menulis prompt pertama, maksud tetapan dan cara membezakan hasil yang baik dengan yang bernasib baik.
Oleh Captain
2025-08-14
Model
Bagaimana model imej AI generatif berfungsi: penjelasan mudah tentang difusi, latens dan pengekod teks
Mekanisme di sebalik Stable Diffusion, SDXL, Flux dan model video tanpa matematik: apa kaitan bunyi dengan proses ini, kenapa model berfungsi dalam ruang latens yang dimampatkan, apa fungsi pengekod teks dan VAE, apa yang benar-benar berubah dengan langkah dan panduan, dan kenapa data latihan menentukan apa yang model boleh lukis.
Oleh Quartermaster
2025-08-28
Model
Checkpoint vs LoRA vs embedding vs ControlNet: fail mana buat apa
Enam jenis fail model yang akan kamu jumpa, apa yang setiap satu ubah, saiznya berapa, letak di mana dan bila guna: checkpoints dan fine-tunes, LoRAs dan saudara LyCORIS mereka, embedding textual inversion, ControlNets dan IP-Adapters, VAEs dan upscalers.
Oleh Quartermaster
2025-10-08
Prompting
Langkah, CFG, sampler, penjadual dan benih: tetapan penjanaan dijelaskan dengan nilai selamat
Apa yang setiap tetapan dalam panel penjanaan ubah, nilai yang sesuai untuk setiap keluarga model (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), sampler mana yang patut diketahui, kenapa model distilasi pecahkan peraturan biasa, dan cara guna benih untuk ubah satu perkara pada satu masa.
Oleh Quartermaster
2025-11-19
Model video
Penjanaan video AI untuk pemula: imej-ke-video, teks-ke-video dan klip pertama dengan Wan, LTX-2 dan H3
Minggu pertama dengan model video terbuka: perbezaan antara teks-ke-video dan imej-ke-video dan kenapa mula dengan yang kedua, tiga keluarga model yang patut dipelajari (Wan 2.2, LTX-2, MiniMax H3), bilangan bingkai dan resolusi yang sesuai, cara menulis arahan gerakan, apa yang boleh dijangka dari kad 16 atau 24 GB berbanding awan, dan cara mengubah klip lima saat menjadi sesuatu yang lebih panjang.
Oleh Lookout
2026-04-29
Lagi panduan
Perkhidmatan awan
Bayaran tetap vs token: kenapa pelan tanpa had seperti Graydient.ai adalah nilai terbaik untuk pencipta AI pada 2026
Perbandingan kos berperingkat, dengan harga diperiksa pada 8 Oktober 2026, pelan tanpa had bayaran tetap seperti Graydient.ai berbanding harga token dan kredit dari Midjourney, Leonardo, fal.ai, Replicate, Runway dan Kling: berapa kos sebenar 1,000 imej dan 1,000 video sebulan pada setiap satu, dan kenapa satu bayaran tetap untuk imej, video, audio, sembang Grok LLM dan aplikasi web tanpa had adalah nilai terbaik untuk pencipta yang membuat iterasi.
Oleh Captain
2026-10-08
Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Hak cipta terpelihara