Model
Trends
.ai
Model
Trends
.ai
de bästa AI-modellerna med öppen källkod

Checkpoint vs LoRA vs embedding vs ControlNet: vilken fil gör vad

Ämne: Modeller
Av Quartermaster
Publicerad 2025-10-08
De sex typerna av modelfiler du kommer stöta på, vad varje ändrar, hur stor den är, var den ska ligga och när du ska använda den: checkpoints och fine-tunes, LoRAs och deras LyCORIS-kusiner, textual inversion embeddings, ControlNets och IP-Adapters, VAEs och upscalers.

Översikt

En ny användare laddar ner en "modell" och upptäcker att det är en av sex olika saker som ska ligga i sex olika mappar och gör sex olika jobb. Katalogen på den här sidan märker varje post med sin typ (basmodell,
LoRA
, embedding, annan) och dess familj av den anledningen. Den här guiden förklarar typerna en gång, så att etiketterna blir meningsfulla.
Regeln är: en checkpoint är hela målaren; en LoRA lär målaren ett nytt motiv eller stil; en embedding lär målaren ett nytt ord; en
ControlNet
eller IP-Adapter berättar för målaren var saker ska vara eller vad som ska kopieras från en referens; VAE är målarens ögon som omvandlar mellan duken och det komprimerade arbetsutrymmet; en
upscaler
är en separat hantverkare som förstorar den färdiga bilden. Endast checkpointen kan fungera själv. Allt annat behöver en checkpoint från samma familj.
Storlekar säger mycket. 2 till 7 GB för en
SDXL
checkpoint och 12 till 24 GB för
Flux
; 10 till 700 MB för en LoRA; under 1 MB för en embedding; 1 till 2,5 GB för en ControlNet; 300 MB för en VAE; 60 MB för en ESRGAN upscaler. Om en fil som kallas LoRA är 6 GB är det en checkpoint. Modellsidan här visar storleken och hashen så du kan se innan du laddar ner.

Referens

Namn
Typ
Vad det är
Checkpoint (base model)
2-24 GB
Den fullständiga denoisern, vanligtvis med textkodare och VAE inkluderade. Fine-tunes (DreamShaper, Juggernaut,
Illustrious
, Pony) är checkpoints som tränats om på ny data. Mapp: models/checkpoints (
ComfyUI
), models/Stable-diffusion (A1111,
Forge
). Flux,
Qwen
och
Wan
levereras som separata diffusion_models + text_encoders + vae filer.
LoRA
10-700 MB
En liten viktförändring som läggs ovanpå en checkpoint. Karaktärer, stilar, koncept, reglage, rörelse. Kräver ett triggerord och en vikt. Mapp: models/loras eller models/Lora.
LyCORIS / LoCon / LoHa / DoRA
10-700 MB
LoRA-varianter som påverkar fler lager eller använder en annan faktorisering. Laddas som LoRAs i alla nuvarande UI.
Embedding (textual inversion)
10-200 KB
En inlärd token för textkodaren. Anropas med sitt filnamn i prompten. Vanligt som negativa embeddings (bad-hands, easynegative) på
SD 1.5
och SDXL; sällsynt på Flux. Mapp: models/embeddings.
ControlNet / T2I-Adapter
0.3-2.5 GB
Ett sidonätverk som styr denoisern baserat på pose, djupkarta, kantkarta eller skiss. Familjespecifikt. Mapp: models/controlnet.
IP-Adapter / reference
50 MB-1 GB
Styr baserat på en bild istället för text: stilöverföring, ansiktsreferens. Kräver en matchande CLIP vision-modell.
VAE
160-330 MB
Encoder/decoder mellan pixlar och latenter. Vanligtvis inkluderad i checkpoints; separata filer fixar urvattnade färger (SDXL fp16-fix) eller följer med nya familjer (Flux ae.safetensors, Wan VAE).
Upscaler
2-70 MB
ESRGAN, Real-ESRGAN, SwinIR, DAT: separata nätverk som förstorar pixlar efter generering. Mapp: models/upscale_models.
AD
Inga mappar, inga filtyper, inget VAE-jakt
BitVector Prism förladdar checkpointen, LoRAs, VAE och ControlNets som hör ihop. Välj en modell från den här sidan, välj ett tillägg och generera i webbläsaren.

Steg för steg

  1. Identifiera filtypen från katalogetiketten och storleken innan nedladdning. Basmodell, LoRA, embedding eller annan på kortet; exakta bytes på modellsidan.
  2. Matcha familjen. Varje icke-checkpoint-fil anger familjen den byggdes för (SDXL, Flux,
    Wan 2.2
    14B); den fungerar bara med checkpoints från den familjen.
  3. Lägg filen i mappen för dess typ (tabellen ovan) och uppdatera UI.
  4. Checkpoint: välj den som modell. För split-familjer (Flux, Qwen, Wan,
    Z-Image
    ) ladda diffusion-modellen, textkodarna och VAE separat i ComfyUI.
  5. LoRA: Ladda LoRA-noden efter checkpointen, eller <lora:name:0.8> i prompten, plus triggerordet.
  6. Embedding: skriv filnamnet i prompten (eller i negativ prompt för negativa embeddings); ComfyUI använder embedding:name.
  7. ControlNet: Använd ControlNet-noden med den förbehandlade bilden (pose, djup); börja med styrka 0.8 och slutprocent 0.8.
  8. VAE och upscaler: välj VAE i loadern eller inställningarna när färgerna är fel; kör upscalern som sista steg via Upscale Image (using Model).

Exempel

En komplett SDXL-stack i en Forge-prompt

Checkpoint: juggernautXL_v9.safetensors | VAE: sdxl_vae_fp16fix.safetensors
Prompt: zavy cinematic, <lora:zavy-cinematic-xl:0.7> a knight resting by a campfire, night, embers, 35mm
Negative: easynegative, bad-hands-5, blurry | ControlNet: openpose, weight 0.8 | Upscaler: 4x-UltraSharp 2x

Samma stack som ComfyUI-noder

Load Checkpoint -> Load LoRA -> Apply ControlNet (OpenPose image) -> KSampler -> VAE Decode (fp16-fix VAE) -> Upscale Image (using Model: 4x-UltraSharp)

Tips

  • Katalogtypen "other" täcker ControlNets, VAEs,
    upscalers
    och arbetsflöden; modellsidan säger vilken.
  • Merges är checkpoints gjorda genom att medelvärdesbilda andra checkpoints; de ärver familjen från sina föräldrar och behåller LoRA-kompatibilitet.
  • En
    inpainting
    checkpoint är en checkpoint med extra ingångskanaler; den behöver inpainting-arbetsflödet och är inte en drop-in för text-till-bild.
  • Negativa embeddings var SD 1.5:s sätt att fixa händer; på SDXL hjälper de mindre och på Flux gör de inget eftersom modellen saknar CFG-negativ.
  • Flux Fill, Flux Redux, Flux Depth och Canny är checkpoints eller adaptrar, inte LoRAs, även om de levereras bredvid LoRAs på hubben.
  • När du är osäker har molnpartnerna rätt kombination förladdad: välj modellen och LoRA:n så hanteras matchande VAE och ControlNet automatiskt.

Felsökning

Laddade ner en "LoRA" och den är 6 GB

Varför det händer
Det är en checkpoint; uppladdaren märkte den slarvigt.

Så löser du det
Lägg den i checkpoints-mappen och välj den som modell. Katalogetiketten här är pålitlig.

Embedding gör ingenting

Varför det händer
Fel familj (SD 1.5 embedding på SDXL), eller namnet som skrivits in matchar inte filnamnet.

Så löser du det
Matcha familjen; skriv exakt filnamn utan ändelse; i ComfyUI använd embedding:name.

ControlNet ger brus eller ignorerar posen

Varför det händer
ControlNet för en annan familj, eller råfotot matades in istället för den förbehandlade kartan.

Så löser du det
Använd ControlNet byggd för checkpoint-familjen och kör förbehandlingsnoden först.

Färger ser urvattnade ut

Varför det händer
Saknad eller fel VAE.

Så löser du det
Ladda familjens VAE; på SDXL fp16-fix VAE.

Modellen laddas men genererar svarta bilder

Varför det händer
fp16 overflow i VAE eller en checkpoint som behöver --no-half-vae.

Så löser du det
Använd fp16-fix VAE eller no-half-vae-flaggan; på Flux kontrollera att textkodarens precision matchar bygget.

AD
PirateDiffusion
Checkpoints, LoRAs, embeddings och ControlNets, redan kopplade
PirateDiffusion håller tusentals modelfiler organiserade åt dig på sina egna GPU:er; du anger checkpoint och LoRA-taggar i ett Telegram-kommando och matchande VAE och ControlNets appliceras. Obegränsad generering, fast pris.

Frågor

Vilken ska en nybörjare ladda ner först?

En checkpoint från den familj du vill använda. LoRAs kommer som nummer två när du vet vilken bas du gillar. Embeddings och ControlNets används när ett specifikt problem kräver dem.

Kan jag slå ihop en LoRA med en checkpoint?

Ja, varje UI har ett merge-verktyg och resultatet är en ny checkpoint. Det sparar en nod men fryser vikten; de flesta håller LoRAs separata.

Är en fine-tune samma sak som en LoRA?

Nej. En fine-tune tränar om hela checkpointen (gigabyte); en LoRA är ett litet tillägg (megabyte). Många fine-tunes började som LoRAs som slogs ihop.

Använder Flux och Qwen embeddings?

Nästan aldrig. Deras LLM-textkodare tränas inte så; stil- och konceptarbete görs med LoRAs.

Vad är en workflow-fil?

En ComfyUI JSON som kopplar ihop dessa komponenter. Katalogen listar några som "other"; de innehåller inga vikter, bara receptet.

Länkar och källor

Modeller i den här guiden

Skriven av
Quartermaster

Relaterade guider

Modeller
Vad är en LoRA och hur använder man en i ComfyUI, Forge, Automatic1111 och i molnet
LoRAs förklarade för dig som vill ha resultat, inte matte: vad en LoRA-fil ändrar, varför den måste matcha basmodellens familj, triggerord, vikter, stapling av flera LoRAs, mappen och syntaxen för varje UI, och hur du testar en LoRA i molnet innan du laddar ner något.
Av Captain
2026-05-20
Appar
Hur man installerar en LoRA: mappar, filkontroller och första användning i ComfyUI, Forge, Automatic1111 och Draw Things
Den praktiska installationsguiden: var du laddar ner en LoRA, hur du kontrollerar filens hash mot modellens sida, vilken mapp den ska ligga i för varje populärt UI, hur du uppdaterar listan, hur du laddar den första gången, och tre sätt att använda en i molnet utan att installera något.
Av Lookout
2025-09-24
Modeller
Hur generativa AI-bildmodeller fungerar: diffusion, latenter och textkodare förklarade enkelt
Mekanismerna bakom Stable Diffusion, SDXL, Flux och videomodellerna utan matte: vad brus har med det att göra, varför modeller jobbar i ett komprimerat latent utrymme, vad textkodaren och VAE gör, vad steg och vägledning egentligen ändrar, och varför träningsdata bestämmer vad en modell kan rita.
Av Quartermaster
2025-08-28
Promptning
ControlNet förklarat: pose, djup, kanter och referensbilder för SD 1.5, SDXL och Flux
Hur ControlNet får en modell att följa en pose, en djupkarta, en kantteckning eller en klotter istället för att gissa kompositionen från prompten: de vanliga kontrolltyperna och när man ska använda dem, förbehandlingssteget, styrka och slutprocentinställningar, familjespecifika filer och Flux-erans alternativ (Flux Depth, Canny, Kontext).
Av Captain
2026-02-18
Modeller
Förstoring av AI-bilder: ESRGAN-modeller, hires-fix, tiled diffusion och när man ska använda vad
De tre typerna av förstoring och vad de är till för: snabba pixel-förstorare (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) för ren förstoring, hires-fix för att lägga till detaljer under genereringen, och tiled diffusion (Ultimate SD Upscale, SUPIR, Flux-baserade) för att göra en 1024-rendering till en detaljerad 4K-utskrift; med värden för brusreducering, kakstorlekar och modeller värda att ladda ner.
Av Quartermaster
2026-03-04

Fler guider

Modeller
FLUX.1 Dev: hur du promptar det, bästa inställningarna och kreativa idéer
En praktisk guide till FLUX.1 Dev från Black Forest Labs: naturligt språk för prompts, styrning och steginställningar, LoRA-stapling, textrendering och promptidéer som spelar på dess styrkor.
Av Captain
2026-09-30
Modeller
Stable Diffusion XL 1.0: prompts, inställningar och vad den fortfarande är bäst på
Hur du får ut mest av den officiella SDXL 1.0 basmodellen: inbyggda upplösningar, CFG- och sampler-inställningar, refiner, negativa prompts och idéer för stilar där SDXL fortfarande glänser.
Av Captain
2026-10-01
Modeller
Stable Diffusion 1.5: den klassiska modellen, rätt promptad
Stable Diffusion 1.5 är fortfarande värd att känna till: rätt upplösning, CFG och sampler, hur du använder dess stora bibliotek av LoRAs och embeddings, och kreativa promptidéer som passar en 512-pixelmodell.
Av Captain
2026-10-02
Modeller
FLUX.2 Dev: promptning av den senaste modellen från Black Forest Labs
FLUX.2 Dev ger längre prompts, bättre text, starkare realism och redigering med flera referenser. Den här guiden täcker turboarbetsflödet, styrning och upplösningsinställningar, promptstruktur och idéer som använder dess nya styrkor.
Av Captain
2026-10-03
Modeller
Qwen-Image: långa prompts, perfekt text och tvåspråkiga affischer
Qwen-Image är modellen du ska använda när orden i bilden är viktiga. Lär dig hur du skriver långa beskrivande prompts, återger engelska och kinesiska texter korrekt, ställer in CFG och steg, och utforskar kreativa idéer med mycket layout.
Av Captain
2026-09-29
Modeller
SDXL-Lightning: fyrastegs-generering på vilken SDXL-checkpoint som helst
ByteDance:s SDXL-Lightning LoRA förvandlar en 30-stegs SDXL-rendering till en på 4 steg. Lär dig antal steg, vilken CFG du måste använda, samplern och hur du kombinerar den med dina favoritcheckpoints och stil-LoRAs.
Av Captain
2026-09-30