Model
Trends
.ai
Model
Trends
.ai
model AI sumber terbuka terbaik

Glosari penjanaan imej dan video AI: 60 istilah dari checkpoint ke VAE, diterangkan dalam satu ayat setiap satu

Topik: Prompting
Oleh Captain
Diterbitkan 2026-04-15
Share

Gambaran keseluruhan

Setiap komuniti cipta kosa kata dan komuniti ini cipta satu yang besar dengan cepat. Glosari di bawah adalah rujukan yang panduan lain di laman ini anggap; setiap istilah dapat satu ayat, keluarga atau alat yang ia miliki jika penting, dan panduan panjang untuk dibaca seterusnya. Istilah dikelompokkan: model dan seni bina, fail, tetapan, teknik, prompting, video, perkakasan.
Keluarga di laman ini (
Flux
,
SDXL
,
Wan
dan sebagainya) diterangkan di halaman hub mereka sendiri, dan setiap halaman model tunjukkan istilah yang digunakan: jenisnya, keluarganya, kata pencetusnya, tetapan yang disyorkan. Jika ada perkataan di halaman model yang tiada di sini, chat komuniti yang dipautkan dari FAQ adalah tempat untuk bertanya.

Rujukan

Nama
Jenis
Apakah ia
Checkpoint
/ base model
file
Berat model penuh dalam satu fail (atau beberapa fail untuk model era Flux). Boleh guna sendiri. Lihat
checkpoint
vs
LoRA
vs embedding.
Fine-tune
model
Checkpoint yang dilatih semula dengan data baru (DreamShaper,
Illustrious
, Pony). Seni bina sama dengan asasnya.
Merge
model
Checkpoint yang dibuat dengan purata checkpoint lain. Warisi keluarga.
LoRA
/ LyCORIS / DoRA
file
Tambahan kecil yang ubah tingkah laku checkpoint; perlukan kata pencetus dan berat. Lihat panduan LoRA.
Embedding
/ textual inversion
file
Token yang dipelajari untuk pengekod teks, taip dengan nama; kebanyakannya embedding negatif pada
SD 1.5
dan SDXL.
VAE
component
Encoder/decoder antara piksel dan latents; VAE yang salah buat warna jadi pudar.
Text encoder (CLIP, T5, LLM)
component
Tukar prompt jadi nombor; tentukan dialek prompt (tag vs ayat).
U-Net / DiT / MMDiT
architecture
Reka bentuk denoiser: U-Net dalam SD 1.5 dan SDXL, diffusion transformer dalam Flux,
Qwen
, Wan,
Z-Image
.
MoE (mixture of experts)
architecture
Beberapa sub-model yang satu dijalankan setiap langkah (
Wan 2.2
pakar bunyi tinggi/rendah, HunyuanImage 3).
Diffusion / flow matching
training
Belajar buang bunyi langkah demi langkah; flow matching adalah formulasi lebih terus 2024+. Lihat cara model berfungsi.
Distilled (Turbo, Lightning, Schnell, Klein, Hyper)
model
Dilatih untuk perlukan 1-8 langkah dan
CFG
1; lebih cepat, kurang fleksibel.
Guidance-distilled
model
CFG dimasukkan (dev Flux); nilai panduan gantikan CFG dan prompt negatif tiada kesan.
fp16 / bf16 / fp8 / NF4 / GGUF Q4-Q8
precision
Cara berat disimpan; ketepatan lebih rendah bermakna fail dan
VRAM
lebih kecil, kualiti sedikit kurang. Lihat panduan VRAM.
format
Format tensor selamat sahaja vs pickle yang jalankan kod. Lihat muat turun selamat.
Steps
setting
Ulangan denoising; 20-30 biasa, 4-8 distilled.
CFG
scale
setting
Betapa kuat prompt mengarah; 5-7 SDXL, 1 Flux. Lihat tetapan diterangkan.
Sampler
/ scheduler
setting
Kaedah nombor dan lengkung bunyi (Euler, DPM++ 2M; Karras, simple, beta).
Seed
setting
Bunyi mula; seed tetap, imej boleh ulang.
Denoise
setting
Dalam
img2img
dan inpainting, berapa banyak input boleh berubah (0-1).
Shift / sigma
setting
Di mana model flow guna langkahnya (Flux, Wan, Z-Image).
Latent
concept
Imej kerja yang dimampatkan (1/8 atau 1/16 saiz) yang denoiser edit.
Resolution / native size
concept
512 (SD 1.5), 1024 (SDXL, Flux); gandaan 8 atau 16.
Hires-fix
technique
Laluan diffusion kedua pada saiz lebih besar semasa penjanaan. Lihat
upscaling
.
Upscaler
(ESRGAN, SwinIR)
technique
Rangkaian pembesaran piksel dijalankan selepas penjanaan.
technique
Jana dari imej sedia ada tambah bunyi. Lihat img2img dan inpainting.
Inpainting
/ outpainting
technique
Jana semula kawasan bertutup / luaskan kanvas.
ControlNet
/ T2I-Adapter
technique
Kawalan struktur dari pose, kedalaman atau tepi. Lihat
ControlNet
diterangkan.
IP-Adapter / Redux / reference
technique
Penyesuaian gaya atau identiti berdasarkan imej.
Face detailer / ADetailer
technique
Topeng muka automatik dan inpaint pada resolusi lebih tinggi.
Tiled diffusion / Ultimate SD Upscale
technique
Imej besar dalam jubin bertindih dengan Tile ControlNet.
prompting
Apa nak lukis / apa nak elak (SD dan SDXL sahaja). Lihat asas prompt dan negatif.
Trigger word
prompting
Token yang LoRA dilatih dengannya; perlu supaya ia berfungsi.
Weight (word:1.3)
prompting
Penekanan perhatian pada model CLIP.
Quality tags / score tags
prompting
masterpiece, best quality (Illustrious); score_9 (Pony). Anime SDXL sahaja.
Token limit (77)
prompting
Saiz chunk CLIP; sebab prompt panjang terpotong pada SD dan SDXL.
Prompt bleeding
prompting
Sifat melekat pada objek yang salah.
T2I / T2V / I2V / TI2V / V2V
video
Teks ke imej / teks ke video / imej ke video / kedua-dua / video ke video.
Frames and fps
video
81 frame pada 16 fps adalah 5 saat pada Wan; memori bertambah ikut frame.
High-noise / low-noise expert
video
Dua model 14B Wan 2.2 untuk langkah awal dan akhir; LoRA sasarkan satu.
First / last frame
video
Kondisi keyframe (FLF2V) untuk gerakan terkawal.
VACE / Fun
ControlNet
video
Model suntingan dan kawalan video dalam keluarga Wan.
Frame interpolation (RIFE, FILM)
video
Jana frame antara untuk naikkan fps.
VRAM
/ offloading / block swap
hardware
Memori GPU; pindah sebahagian model ke RAM sistem bila tak muat. Lihat panduan VRAM.
CUDA / MPS / ROCm
hardware
Backend pengiraan NVIDIA / Apple / AMD.
Workflow (
ComfyUI
)
tool
Graf node disimpan; terbenam dalam PNG
ComfyUI
. Lihat panduan pemula ComfyUI.
Custom node
tool
Sambungan ComfyUI; dipasang dengan Manager.
Heat score
this site
Sejauh mana model popular sekarang, dari muat turun, penggunaan dan carian; diterangkan di halaman FAQ.
AD
Belajar dengan buat, bukan baca
BitVector Prism label tetapan dengan perkataan sama seperti glosari ini dan muat nilai betul ikut model. Buka sebelah halaman ini dan cuba setiap istilah pada imej sebenar. Tiada pemasangan.

Langkah demi langkah

  1. Baca halaman model dari atas ke bawah dengan glosari dibuka: jenis, keluarga, kata pencetus, baris tetapan bawah setiap contoh.
  2. Pilih tiga istilah yang buat kamu keliru dan baca panduan pautan untuk setiap satu; panduan ditulis supaya glosari ini cukup konteks.
  3. Bila jumpa istilah baru dalam thread forum, periksa sama ada ia fail, tetapan, teknik atau istilah video; kebanyakan kekeliruan datang dari campur kategori ini.
  4. Kembali bila keluarga baru muncul; halaman hub tambah istilah mereka sendiri (pakar Wan 2.2, panduan Flux) dan senarai ini dikemas kini dengan mereka.

Contoh

Baris tetapan halaman model, diterjemah

"<lora:zavy-cinematic-xl:0.7> zavy cinematic, ... | 1024x1024 | DPM++ 2M Karras | 28 steps | CFG 6 | seed 4471"
LoRA at weight 0.7 with its trigger word; native SDXL size; sampler + scheduler; 28 denoising steps; CFG 6; fixed seed

Nama workflow Wan 2.2, diterjemah

wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors -> Wan 2.2, image to video, the high-noise expert, 14B parameters, fp8 precision, safetensors format

Petua

  • Tiga perkataan yang paling banyak buat pemula salah: keluarga (LoRA mesti padan), kata pencetus (LoRA perlukan), dan denoise (img2img hidup atau mati dengannya).
  • Bila dua panduan tak setuju tentang CFG, mereka bercakap tentang keluarga berbeza; periksa yang mana.
  • "Model" maksud checkpoint dalam kebanyakan ayat, tapi di laman ini "model" adalah mana-mana entri katalog termasuk LoRA; label jenis beritahu yang mana.
  • Istilah video adalah idea sama dengan paksi masa; kalau kamu tahu T2I dan img2img kamu tahu T2V dan I2V.
  • Rakan awan guna kosa kata sama: bendera
    PirateDiffusion
    adalah /steps, /guidance, /seed, /size; panel
    BitVector
    guna nama sama.

Penyelesaian masalah

Dua sumber guna perkataan sama dengan maksud berbeza

Mengapa ia berlaku
Istilah berubah antara era SD 1.5, SDXL dan Flux ("guidance" vs "CFG").

Cara membaikinya
Fokus pada keluarga: CFG untuk SD/SDXL, guidance untuk Flux.

"Model" di Civitai maksud lain dari sini

Mengapa ia berlaku
Civitai kumpul versi di bawah satu model; laman ini senaraikan setiap versi berasingan.

Cara membaikinya
Padankan ikut hash, bukan nama.

Tetapan di halaman model tiada dalam UI saya

Mengapa ia berlaku
Nama UI berbeza (kuat denoising vs denoise; langkah hires vs laluan kedua).

Cara membaikinya
Baris glosari beri alias; panduan node ComfyUI peta nama node.

AD
PirateDiffusion
Setiap istilah adalah arahan
PirateDiffusion ubah kosa kata jadi bendera Telegram: /steps, /guidance, /seed, /size, tag LoRA dan [[negatives]]. Ribuan model, render tanpa had, harga tetap.

Soalan

Adakah checkpoint sama dengan model?

Dalam penggunaan biasa ya. Secara ketat, checkpoint adalah fail simpanan model.

Apa beza guidance dan CFG?

CFG adalah panduan tanpa pengklasifikasi yang digunakan masa jalan pada SD dan SDXL; dev Flux masukkan terus dan tunjuk satu nilai panduan.

Di mana istilah khusus video?

Dalam kumpulan video di atas dan di halaman keluarga Wan,
LTX
dan H3; panduan mula video terangkan mereka.

Perlukah saya tahu semua ini untuk buat imej?

Tidak. Keluarga, kata pencetus dan denoise tutup 80 peratus masalah; selebihnya kamu belajar bila jumpa.

Pautan dan sumber

Model dalam panduan ini

Ditulis oleh
Captain

Panduan berkaitan

Perkhidmatan awan
Memulakan penjanaan imej AI: gambar pertama anda dalam sepuluh minit
Permulaan mudah untuk pemula sepenuhnya: apa itu model, tiga cara untuk menjalankannya (aplikasi web, bot sembang, PC sendiri), cara menulis prompt pertama, maksud tetapan dan cara membezakan hasil yang baik dengan yang bernasib baik.
Oleh Captain
2025-08-14
Model
Bagaimana model imej AI generatif berfungsi: penjelasan mudah tentang difusi, latens dan pengekod teks
Mekanisme di sebalik Stable Diffusion, SDXL, Flux dan model video tanpa matematik: apa kaitan bunyi dengan proses ini, kenapa model berfungsi dalam ruang latens yang dimampatkan, apa fungsi pengekod teks dan VAE, apa yang benar-benar berubah dengan langkah dan panduan, dan kenapa data latihan menentukan apa yang model boleh lukis.
Oleh Quartermaster
2025-08-28
Model
Checkpoint vs LoRA vs embedding vs ControlNet: fail mana buat apa
Enam jenis fail model yang akan kamu jumpa, apa yang setiap satu ubah, saiznya berapa, letak di mana dan bila guna: checkpoints dan fine-tunes, LoRAs dan saudara LyCORIS mereka, embedding textual inversion, ControlNets dan IP-Adapters, VAEs dan upscalers.
Oleh Quartermaster
2025-10-08
Prompting
Langkah, CFG, sampler, penjadual dan benih: tetapan penjanaan dijelaskan dengan nilai selamat
Apa yang setiap tetapan dalam panel penjanaan ubah, nilai yang sesuai untuk setiap keluarga model (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), sampler mana yang patut diketahui, kenapa model distilasi pecahkan peraturan biasa, dan cara guna benih untuk ubah satu perkara pada satu masa.
Oleh Quartermaster
2025-11-19
Model video
Penjanaan video AI untuk pemula: imej-ke-video, teks-ke-video dan klip pertama dengan Wan, LTX-2 dan H3
Minggu pertama dengan model video terbuka: perbezaan antara teks-ke-video dan imej-ke-video dan kenapa mula dengan yang kedua, tiga keluarga model yang patut dipelajari (Wan 2.2, LTX-2, MiniMax H3), bilangan bingkai dan resolusi yang sesuai, cara menulis arahan gerakan, apa yang boleh dijangka dari kad 16 atau 24 GB berbanding awan, dan cara mengubah klip lima saat menjadi sesuatu yang lebih panjang.
Oleh Lookout
2026-04-29

Lagi panduan

Perkhidmatan awan
Bayaran tetap vs token: kenapa pelan tanpa had seperti Graydient.ai adalah nilai terbaik untuk pencipta AI pada 2026
Perbandingan kos berperingkat, dengan harga diperiksa pada 8 Oktober 2026, pelan tanpa had bayaran tetap seperti Graydient.ai berbanding harga token dan kredit dari Midjourney, Leonardo, fal.ai, Replicate, Runway dan Kling: berapa kos sebenar 1,000 imej dan 1,000 video sebulan pada setiap satu, dan kenapa satu bayaran tetap untuk imej, video, audio, sembang Grok LLM dan aplikasi web tanpa had adalah nilai terbaik untuk pencipta yang membuat iterasi.
Oleh Captain
2026-10-08
Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29