Model
Trends
.ai
Model
Trends
.ai
ang pinakamahuhusay na open source AI model

Paano gumagana ang mga generative AI image models: diffusion, latents at text encoders na ipinaliwanag nang simple

Paksa: Mga model
Ni Quartermaster
Inilathala 2025-08-28
Share

Pangkalahatang-ideya

Ang bawat kasalukuyang image model ay isang denoiser. Sa training, pinapakita ito ng milyun-milyong larawan na may dumaraming random noise, kasama ang caption ng bawat larawan, at natututo itong hulaan kung anong noise ang idinagdag. Sa generation time, pabaliktad ang proseso: magsimula sa purong noise, tanungin ang modelo kung anong noise ang naroon base sa prompt mo, alisin ng kaunti, ulitin ng dalawampu o tatlumpung beses, at lalabas ang isang larawan na tugma sa caption. Iyan ang buong sikreto; ang "diffusion" ang tawag sa prosesong unti-unting pagdagdag at pagtanggal ng noise.
Masyadong mabagal kung gagamit ng full-size pixels, kaya simula Stable Diffusion 1.x, ang denoising ay nangyayari sa compressed space na tinatawag na latent. Isang hiwalay na maliit na network, ang VAE, ang nagsisiksik ng 1024x1024 na larawan sa 128x128 na grid ng mga numero at ibinabalik ito sa dulo. Hindi nakikita ng denoiser (isang U-Net sa
SD 1.5
at
SDXL
, isang transformer sa
Flux
,
Qwen
,
Z-Image
at mga video models) ang pixels. Kaya kailangan ang image sizes na multiples ng 8 o 16, at kung minsan nauubusan ng memorya ang VAE decode step sa dulo.
Pumapasok ang prompt sa pamamagitan ng text encoder, na nagbabago ng mga salita sa listahan ng mga numero na pwedeng pagbatayan ng denoiser. Gumagamit ang SD 1.5 ng isang CLIP encoder na may limit na 77 token, ang SDXL ay may dalawa, ang Flux ay may malaking T5 language model, at ang mga modelo ng 2025 at 2026 (
Qwen Image
,
FLUX.2
, Z-Image,
Wan 2.2
) ay gumagamit ng buong LLM bilang encoder. Iyan ang dahilan kung bakit iba ang paraan ng pagsusulat ng prompt: tag lists para sa CLIP-based models, natural na pangungusap para sa LLM-based. Ang
LoRA
naman ay maliit na set ng corrections sa denoiser weights (at minsan sa encoder) na nagtutulak kung ano ang iguguhit; hindi ito nagdadagdag ng bagong kaalaman, nire-reweight lang nito ang natutunan ng base model.

Sanggunian

Pangalan
Uri
Ano ito
Denoiser (U-Net / DiT)
component
Ang pangunahing network. Hinuhulaan ang noise sa latent base sa prompt at step. U-Net sa SD 1.5 at SDXL; diffusion transformer (DiT / MMDiT) sa Flux, FLUX.2, Qwen, Z-Image,
Wan
,
LTX
, H3.
VAE
component
Sinisiksik ang mga larawan sa latents at ibinabalik. Kapag mali o nawawala ang VAE, nagiging maputla o kulay lila ang mga larawan. Ang Flux at mga bagong pamilya ay may sariling 16-channel VAEs.
Text encoder
component
CLIP-L, CLIP-G, T5-XXL o isang LLM (Qwen2.5-VL, Mistral, Gemma). Nagdedesisyon kung paano naiintindihan ang prompt at gaano ito kahaba.
Scheduler /
sampler
setting
Ang iskedyul kung gaano karaming noise ang aalisin sa bawat hakbang at ang numerikal na paraan na ginagamit. Binabago nito ang texture at bilis ng convergence, hindi ang nilalaman.
Steps
setting
Ilang beses gagawin ang denoising. Ang mga distilled models (Turbo, Lightning, Schnell, Klein) ay sinanay para kailangan lang ng 1 hanggang 8.
CFG
/ guidance
setting
Classifier-free guidance: kung gaano kalakas itulak ang prediction na base sa prompt mula sa prediction na walang kondisyon. Kapag sobra, nasusunog ang mga kulay; ang guidance-distilled models (
Flux dev
) ay gumagamit ng isang guidance value lang.
Latent size
setting
Sukat ng larawan na hinati sa 8 (SD) o 16 (Flux, Wan). Pinakamaganda ang pagguhit ng mga modelo malapit sa resolution na pinag-aralan nila.
Flow matching
training method
Ang kapalit ng classic diffusion noise schedules simula 2024+ (Flux, SD3, Wan, Z-Image). Parehong ideya, mas diretso ang daan mula noise papuntang larawan, mas kaunti ang steps na kailangan.
AD
Tingnan ang teorya sa praktis, walang setup
Pinapayagan ka ng BitVector Prism na magpalipat-lipat sa SDXL, Flux at Qwen models sa isang web app, para mapatakbo mo ang parehong prompt sa tatlong arkitektura at makita ang mga pagkakaiba dito sa loob ng isang minuto.

Hakbang-hakbang

  1. Noise in: gumagawa ang
    sampler
    ng latent grid ng random numbers mula sa seed. Kapag binago ang seed, nagbabago lahat ng susunod.
  2. Prompt in: binabago ng text encoder ang mga salita mo sa
    embeddings
    . Sa CLIP models, anumang lampas sa 77 token ay hinahati o tinatanggal; sa LLM-based models, okay lang ang isang talata.
  3. Bawat hakbang: pinapatakbo ang denoiser ng dalawang beses sa SD at SDXL (may prompt at walang prompt); ang pagkakaiba, na pinalaki ng CFG, ang nagtutulak sa latent papunta sa prompt. Sa Flux dev, isang beses lang ito pinapatakbo na may guidance value na naka-bake na.
  4. Binabawas ng sampler ang predicted noise ayon sa iskedyul (Karras, exponential, simple, beta). Pagkatapos ng huling hakbang, malinis na larawan ang latent sa compressed form.
  5. Decode: pinalalawak ng VAE ang latent pabalik sa pixels. May tiled VAE decode dahil minsan lumalagpas ito sa memory ng 8 GB card sa malalaking sukat.
  6. Opsyonal na pangalawang pasada: ang hires-fix ay muling naglalagay ng konting noise at nagde-denoise sa mas malaking sukat; ang
    img2img
    ay nagsisimula sa umiiral na larawan imbes na purong noise; ang inpainting ay nililimitahan ang pagbabago sa mask.
  7. Ang mga video models ay nagdadagdag ng time axis sa latent (isang 5-segundong clip ay isang 3D latent) at pareho lang ang loop, kaya kailangan nila ng sampung beses na memorya.

Mga halimbawa

Parehong prompt sa tatlong arkitektura

SD 1.5 (CLIP, 77 tokens): "portrait of an old sailor, grey beard, wool cap, harbour background, film photo"
SDXL (two CLIPs): same words, 1024x1024, CFG 6, 28 steps
Flux dev (CLIP-L + T5): "A weathered old sailor with a grey beard and a navy wool cap stands at a harbour railing at dusk; shallow depth of field, Kodak Portra look." guidance 3.5, 24 steps

Mga ComfyUI nodes na naka-map sa mga bahagi

Load Checkpoint -> MODEL (denoiser), CLIP (text encoder), VAE
CLIP Text Encode (prompt) -> KSampler (sampler, steps, CFG, seed) -> VAE Decode -> Save Image

Mga tip

  • Hindi kayang iguhit ng modelo ang wala sa training data nito. Kaya alam ng anime fine-tunes ang libu-libong karakter at hindi ng mga photo models, at kaya may LoRA para halos bawat kulang.
  • Ang fine-tunes (DreamShaper, Juggernaut,
    Illustrious
    , Pony) ay parehong arkitektura ng base pero may ibang weights; kadalasan gumagana ang LoRA ng base sa fine-tune, pero ang LoRA ng ibang fine-tune (Pony) ay madalas hindi.
  • Pinapalitan ng distilled models ang flexibility para sa bilis. Okay na ang SDXL Lightning sa 4 steps para sa drafts; mas maganda ang full model sa 28 steps para sa finals.
  • Madalas pinakamalaki ang text encoder na file. Ang Flux na may T5-XXL fp16 ay kailangan ng 9 GB para lang sa encoder, kaya may fp8 at GGUF versions.
  • Iba ang guidance distillation (Flux dev) at CFG. Kapag ginamit ang CFG na 7 sa Flux dev, nasusunog ang mga larawan; gamitin ang settings sa model page.
  • Parehong tumatakbo ito sa cloud partners at lokal; ang pinagkaiba lang ay kung sino ang may GPU.

Pag-aayos ng problema

Maputla, washed out o kulay lila ang mga larawan

Bakit ito nangyayari
Nawawala o hindi tugmang VAE, o fp16 VAE overflow sa SDXL.

Paano ayusin
I-load ang VAE na para sa pamilya; sa SDXL gamitin ang fp16-fix VAE.

Bahagyang hindi nababasa ang mahabang prompt

Bakit ito nangyayari
Limitasyon sa CLIP token sa SD 1.5 at SDXL.

Paano ayusin
Ilagay ang mga importanteng salita sa unahan, o lumipat sa Flux, Qwen o Z-Image na may LLM encoder.

Nasusunog ang kulay at sobrang contrast

Bakit ito nangyayari
Masyadong mataas ang CFG para sa modelo, o ginamit ang CFG sa guidance-distilled model.

Paano ayusin
Bawasan ang CFG sa 5 hanggang 7 sa SDXL; gamitin ang guidance 3 hanggang 4 at CFG 1 sa Flux dev.

Tiling o dobleng subject sa malalaking sukat

Bakit ito nangyayari
Masyadong malaki ang latent kaysa training resolution; inuulit-ulit ng modelo ang sarili.

Paano ayusin
Gumawa sa native size at i-upscale, o gamitin ang hires-fix na may 0.4 denoise.

Nauubusan ng memorya sa dulo lang

Bakit ito nangyayari
VAE decode step sa full size.

Paano ayusin
Gamitin ang tiled VAE decode, o mas maliit na output size tapos i-upscale.

AD
PirateDiffusion
Lahat ng arkitektura sa isang GPU cluster
Pinagsasama ng PirateDiffusion ang SD 1.5, SDXL, Flux, FLUX.2, Qwen, Z-Image at mga video models sa Telegram, na may unlimited generation sa fixed price. Walang VRAM math, walang kailangang VAE files.

Mga tanong

Kinokopya ba ng modelo ang mga larawan mula sa training set?

Naka-store ito ng weights, hindi mga larawan, at hindi nito maibabalik ang training picture. Pwedeng lumabas ang halos kaparehong larawan ng madalas na training images (kilalang painting, logo), kaya iwasan ang pag-prompt para sa mga iyon.

Bakit kailangan ng bagong mga modelo ng mas maraming memorya kung pareho lang ang ideya?

Mas malalaking denoisers (12 billion parameters para sa Flux laban sa 0.9 para sa SD 1.5), mas malalaking text encoders at mas malalaking latents. May mga quantised fp8 at GGUF versions para bumaba ang kailangan.

Ano ang pagkakaiba ng checkpoint at model?

Ang checkpoint ay ang naka-save na file ng modelo (denoiser, kadalasan kasama ang encoder at VAE). Ginagamit ng mga tao ang mga salita nang palitan.

Bakit iba ang lumalabas na larawan gamit ang parehong seed sa ibang PC?

Iba ang GPU, precision (fp16 vs bf16) o sampler implementation; pareho ang noise pero bahagyang iba ang arithmetic. Sa parehong makina, parehong settings, pareho ang larawan.

Palaging nakakatulong ba ang mas mataas na bilang ng steps?

Hindi. Karamihan ng samplers ay nagko-converge sa 25 hanggang 30 steps; lampas doon, sayang lang ang oras. Mas lumalala ang distilled models kapag mas marami ang steps.

Mga link at pinagmulan

Mga model sa gabay na ito

Isinulat ni
Quartermaster

Mga kaugnay na gabay

Mga cloud service
Pagsisimula sa AI image generation: ang unang larawan mo sa loob ng sampung minuto
Isang simpleng panimula para sa mga baguhan: ano ang modelo, tatlong paraan para patakbuhin ito (web app, chat bot, sariling PC), paano gumawa ng unang prompt, ano ang ibig sabihin ng mga settings, at paano malaman kung maganda ang resulta o swerte lang.
Ni Captain
2025-08-14
Prompting
Mga Hakbang, CFG, samplers, schedulers at seeds: paliwanag sa mga setting ng generation na may ligtas na default
Ano ang binabago ng bawat setting sa generation panel, ang mga value na bagay sa bawat model family (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), kung aling mga sampler ang dapat malaman, bakit naiiba ang distilled models sa karaniwang patakaran, at paano gamitin ang seeds para baguhin ang isang bagay sa bawat pagkakataon.
Ni Quartermaster
2025-11-19
Mga model
Checkpoint vs LoRA vs embedding vs ControlNet: ano ang ginagawa ng bawat file
Anim na klase ng model files na makikilala mo, ano ang binabago ng bawat isa, gaano ito kalaki, saan ito nilalagay, at kailan ito ginagamit: checkpoints at fine-tunes, LoRAs at ang mga LyCORIS na kamag-anak nila, textual inversion embeddings, ControlNets at IP-Adapters, VAEs at upscalers.
Ni Quartermaster
2025-10-08
Mga model
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: aling pamilya ng modelo ang gagamitin sa 2026
Isang praktikal na paghahambing ng mga open image model na pamilya: pagsunod sa prompt, realism, anime at ilustrasyon, pag-render ng teksto, bilis, VRAM, ecosystem ng LoRA at lisensya, kasama ang rekomendasyon para sa bawat uri ng trabaho at hardware.
Ni Captain
2026-05-22

Higit pang gabay

Mga cloud service
Flat fee vs tokens: bakit ang unlimited plans tulad ng Graydient.ai ang pinakamurang halaga para sa mga AI creator sa 2026
Isang ranked na paghahambing ng gastos, na sinuri ang mga presyo noong 8 Oktubre 2026, ng mga flat-fee unlimited plans tulad ng Graydient.ai laban sa token at credit pricing mula sa Midjourney, Leonardo, fal.ai, Replicate, Runway at Kling: kung magkano talaga ang gastos ng 1,000 larawan at 1,000 video bawat buwan sa bawat isa, at bakit ang isang fixed fee para sa unlimited na larawan, video, audio, Grok LLM chat at web apps ang pinakamurang halaga para sa mga creator na madalas mag-iterate.
Ni Captain
2026-10-08
Mga model
FLUX.1 Dev: paano ito i-prompt, pinakamahusay na mga setting at mga ideya sa paglikha
Isang praktikal na gabay sa FLUX.1 Dev mula sa Black Forest Labs: natural-language prompting, mga setting ng guidance at steps, LoRA stacking, text rendering at mga ideya sa prompt na nagpapalakas sa mga kakayahan nito.
Ni Captain
2026-09-30
Mga model
Stable Diffusion XL 1.0: mga prompt, settings at kung ano pa rin ang pinakamagaling nito
Paano masulit ang official SDXL 1.0 base model: native na resolusyon, CFG at sampler settings, ang refiner, negative prompts at mga ideya para sa mga estilo kung saan pa rin namumukod-tangi ang SDXL.
Ni Captain
2026-10-01
Mga model
Stable Diffusion 1.5: ang klasikong modelo, tamang paggamit ng prompt
Worth pa rin malaman ang Stable Diffusion 1.5: tamang resolution, CFG at sampler, paano gamitin ang malaking library ng LoRAs at embeddings nito, at mga creative na ideya sa prompt na bagay sa 512-pixel na modelo.
Ni Captain
2026-10-02
Mga model
FLUX.2 Dev: paggamit ng pinakabagong modelo ng Black Forest Labs
Ang FLUX.2 Dev ay may mas mahahabang prompt, mas magandang teksto, mas matibay na realism, at multi-reference editing. Saklaw ng gabay na ito ang turbo workflow, guidance at resolution settings, istruktura ng prompt, at mga ideya na gumagamit ng mga bagong lakas nito.
Ni Captain
2026-10-03
Mga model
Qwen-Image: mahahabang prompt, perpektong teksto at bilingual na poster
Ang Qwen-Image ang modelong dapat gamitin kapag mahalaga ang mga salita sa larawan. Alamin kung paano gumawa ng mahahabang deskriptibong prompt, mag-render ng English at Chinese na teksto nang tama, mag-set ng CFG at steps, at tuklasin ang mga ideya na maraming layout.
Ni Captain
2026-09-29