Model
Trends
.ai
Model
Trends
.ai
de bästa AI-modellerna med öppen källkod

Ordlista för AI-bild- och videogenerering: 60 termer från checkpoint till VAE, förklarade med en mening vardera

Ämne: Promptning
Av Captain
Publicerad 2026-04-15
Share

Översikt

Varje community hittar på ett eget språk och det här gjorde det snabbt och stort. Ordlistan nedan är referensen som de andra guiderna på den här sidan utgår ifrån; varje term får en mening, familjen eller verktyget den hör till när det är viktigt, och länken till den längre guiden att läsa efteråt. Termerna är grupperade: modeller och arkitekturer, filer, inställningar, tekniker, prompting, video, hårdvara.
Familjer på den här sidan (
Flux
,
SDXL
,
Wan
och så vidare) förklaras på egna hubbsidor, och varje modellsida visar termerna i användning: dess typ, familj, triggerord, rekommenderade inställningar. Om ett ord på en modellsida inte finns här är community-chatten som länkas från FAQ rätt plats att fråga.

Referens

Namn
Typ
Vad det är
Checkpoint
/ base model
file
De fullständiga modellvikterna i en fil (eller några filer för Flux-era modeller). Fungerar självständigt. Se
checkpoint
vs
LoRA
vs embedding.
Fine-tune
model
En checkpoint som tränats om på ny data (DreamShaper,
Illustrious
, Pony). Samma arkitektur som basen.
Merge
model
En checkpoint skapad genom att ta medelvärdet av andra. Ärver familjen.
LoRA
/ LyCORIS / DoRA
file
Ett litet tillägg som ändrar en checkpoints beteende; kräver ett triggerord och en vikt. Se LoRA-guiden.
Embedding
/ textual inversion
file
En inlärd token för textkodaren, skrivs med namn; mest negativa embeddings på
SD 1.5
och SDXL.
VAE
component
Encoder/decoder mellan pixlar och latenta representationer; fel VAE ger urvattnade färger.
Text encoder (CLIP, T5, LLM)
component
Gör om prompten till siffror; bestämmer promptens dialekt (taggar vs meningar).
U-Net / DiT / MMDiT
architecture
Denoiser-designen: U-Net i SD 1.5 och SDXL, diffusion transformer i Flux,
Qwen
, Wan,
Z-Image
.
MoE (mixture of experts)
architecture
Flera undermodeller där en körs per steg (
Wan 2.2
high/low noise experts, HunyuanImage 3).
Diffusion / flow matching
training
Lär sig ta bort brus steg för steg; flow matching är den rakare 2024+ formuleringen. Se hur modeller fungerar.
Distilled (Turbo, Lightning, Schnell, Klein, Hyper)
model
Tränad för att behöva 1-8 steg och
CFG
1; snabbare, mindre flexibel.
Guidance-distilled
model
CFG inbakad (
Flux dev
); ett guidance-värde ersätter CFG och negativ prompt gör inget.
fp16 / bf16 / fp8 / NF4 / GGUF Q4-Q8
precision
Hur vikterna lagras; lägre precision betyder mindre filer och
VRAM
, något sämre kvalitet. Se VRAM-guiden.
format
Safe tensor-only format vs kod-exekverande pickle. Se säkra nedladdningar.
Steps
setting
Antal denoising-iterationer; 20-30 normalt, 4-8 distilled.
CFG
scale
setting
Hur hårt prompten styr; 5-7 SDXL, 1 Flux. Se inställningar förklarade.
Sampler
/ scheduler
setting
Numerisk metod och bruskurva (Euler, DPM++ 2M; Karras, simple, beta).
Seed
setting
Startbruset; fast seed, upprepningsbar bild.
Denoise
setting
I
img2img
och inpainting, hur mycket av input som får ändras (0-1).
Shift / sigma
setting
Var en flow-modell spenderar sina steg (Flux, Wan, Z-Image).
Latent
concept
Den komprimerade arbetsbilden (1/8 eller 1/16 storlek) som denoisern redigerar.
Resolution / native size
concept
512 (SD 1.5), 1024 (SDXL, Flux); multiplar av 8 eller 16.
Hires-fix
technique
Andra diffusionspasset i större storlek under generering. Se uppskalning.
Upscaler
(ESRGAN, SwinIR)
technique
Pixel-förstoringsnätverk som körs efter generering.
technique
Generera från en befintlig bild plus brus. Se img2img och inpainting.
Inpainting
/ outpainting
technique
Återskapa ett maskerat område / förlänga duken.
ControlNet
/ T2I-Adapter
technique
Strukturkontroll från pose, djup eller kanter. Se
ControlNet
förklarat.
IP-Adapter / Redux / reference
technique
Bildbaserad stil- eller identitetsstyrning.
Face detailer / ADetailer
technique
Automatisk ansiktsmask plus inpaint i högre upplösning.
Tiled diffusion / Ultimate SD Upscale
technique
Stora bilder i överlappande kakel med Tile ControlNet.
prompting
Vad som ska ritas / vad som ska undvikas (endast SD och SDXL). Se prompt basics och negatives.
Trigger word
prompting
Token som en LoRA tränades under; krävs för att den ska aktiveras.
Weight (word:1.3)
prompting
Vikt på uppmärksamhet i CLIP-modeller.
Quality tags / score tags
prompting
masterpiece, best quality (Illustrious); score_9 (Pony). Endast Anime SDXL.
Token limit (77)
prompting
CLIP chunk-storlek; anledningen till att långa prompts kapas i SD och SDXL.
Prompt bleeding
prompting
En egenskap som fäster vid fel objekt.
T2I / T2V / I2V / TI2V / V2V
video
Text till bild / text till video / bild till video / båda / video till video.
Frames and fps
video
81 frames vid 16 fps är 5 sekunder på Wan; minnet ökar med fler frames.
High-noise / low-noise expert
video
Wan 2.2:s två 14B-modeller för tidiga och sena steg; LoRAs riktar sig mot en.
First / last frame
video
Keyframe-styrning (FLF2V) för kontrollerad rörelse.
VACE / Fun
ControlNet
video
Videoredigering och kontrollmodeller i Wan-familjen.
Frame interpolation (RIFE, FILM)
video
Genererar mellanframes för att höja fps.
VRAM
/ offloading / block swap
hardware
GPU-minne; flyttar delar av en modell till system-RAM när det inte får plats. Se VRAM-guiden.
CUDA / MPS / ROCm
hardware
NVIDIA / Apple / AMD beräknings-backends.
Workflow (
ComfyUI
)
tool
En sparad nodgraf; inbäddad i
ComfyUI
PNG-filer. Se ComfyUI nybörjarguide.
Custom node
tool
En ComfyUI-förlängning; installeras med Manager.
Heat score
this site
Hur populär en modell är just nu, baserat på nedladdningar, körningar och sökningar; förklaras på FAQ-sidan.
AD
Lär dig genom att göra, inte bara läsa
BitVector Prism märker sina inställningar med samma ord som den här ordlistan och förladdar rätt värden per modell. Öppna den bredvid den här sidan och testa varje term på en riktig bild. Ingen installation.

Steg för steg

  1. Läs en modellsida uppifrån och ner med ordlistan öppen: typ, familj, triggerord, inställningsrad under varje exempel.
  2. Välj de tre termer som förvirrade dig och läs den länkade guiden för var och en; guiderna är skrivna så att den här ordlistan räcker som kontext.
  3. När du stöter på en ny term i en forumtråd, kolla om det är en fil, en inställning, en teknik eller en videoterm; mest förvirring kommer från att blanda dessa kategorier.
  4. Kom tillbaka när en ny familj dyker upp; hubbsidorna lägger till egna termer (Wan 2.2 experts, Flux guidance) och den här listan uppdateras med dem.

Exempel

En inställningsrad på en modellsida, avkodad

"<lora:zavy-cinematic-xl:0.7> zavy cinematic, ... | 1024x1024 | DPM++ 2M Karras | 28 steps | CFG 6 | seed 4471"
LoRA at weight 0.7 with its trigger word; native SDXL size; sampler + scheduler; 28 denoising steps; CFG 6; fixed seed

Ett Wan 2.2 workflow-namn, avkodad

wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors -> Wan 2.2, image to video, the high-noise expert, 14B parameters, fp8 precision, safetensors format

Tips

  • Tre ord orsakar flest nybörjarfel: familj (en LoRA måste matcha den), triggerord (en LoRA behöver det) och denoise (img2img lever eller dör på det).
  • När två guider är oense om CFG pratar de om olika familjer; kolla vilken.
  • "Model" betyder checkpoint i de flesta meningar, men på den här sidan är "model" vilken katalogpost som helst inklusive LoRAs; typetiketten visar vilken.
  • Videotermer är samma idéer fast med en tidsaxel; om du kan T2I och img2img kan du T2V och I2V.
  • Molnpartnerna använder samma vokabulär: PirateDiffusions flaggor är /steps, /guidance, /seed, /size; BitVectors panel använder samma namn.

Felsökning

Två källor använder samma ord olika

Varför det händer
Termer har ändrat betydelse mellan SD 1.5, SDXL och Flux-erorna ("guidance" vs "CFG").

Så löser du det
Fäst vid familjen: CFG för SD/SDXL, guidance för Flux.

"Model" på Civitai betyder något annat än här

Varför det händer
Civitai grupperar versioner under en modell; den här sidan listar varje version separat.

Så löser du det
Matcha med hash, inte namn.

En inställning som nämns på en modellsida saknas i mitt UI

Varför det händer
Olika UI-namn (denoising strength vs denoise; hires steps vs second pass).

Så löser du det
Ordlistans rad ger alias; ComfyUI nodguiden mappar nodnamn.

AD
PirateDiffusion
Varje term är ett kommando
PirateDiffusion gör om vokabulären till Telegram-flaggor: /steps, /guidance, /seed, /size, LoRA-taggar och [[negatives]]. Tusentals modeller, obegränsade renderingar, fast pris.

Frågor

Är en checkpoint samma sak som en modell?

I vardagligt tal ja. Strikt är en checkpoint den sparade filen för en modell.

Vad är skillnaden mellan guidance och CFG?

CFG är classifier-free guidance som appliceras i realtid på SD och SDXL; Flux dev har det inbakat och visar ett enda guidance-värde istället.

Var finns video-specifika ord?

I videogruppen ovan och på Wan,
LTX
och H3 familjsidor; videoguide för nybörjare går igenom dem.

Måste jag kunna allt detta för att göra bilder?

Nej. Familj, triggerord och denoise täcker 80 procent av problemen; resten lär du dig när du stöter på det.

Länkar och källor

Modeller i den här guiden

Skriven av
Captain

Relaterade guider

Molntjänster
Kom igång med AI-bildgenerering: din första bild på tio minuter
En enkel start för helt nya: vad en modell är, de tre sätten att köra en (webbapp, chattbot, din egen dator), hur du skriver en första prompt, vad inställningarna betyder och hur du ser skillnad på ett bra resultat och en slump.
Av Captain
2025-08-14
Modeller
Hur generativa AI-bildmodeller fungerar: diffusion, latenter och textkodare förklarade enkelt
Mekanismerna bakom Stable Diffusion, SDXL, Flux och videomodellerna utan matte: vad brus har med det att göra, varför modeller jobbar i ett komprimerat latent utrymme, vad textkodaren och VAE gör, vad steg och vägledning egentligen ändrar, och varför träningsdata bestämmer vad en modell kan rita.
Av Quartermaster
2025-08-28
Modeller
Checkpoint vs LoRA vs embedding vs ControlNet: vilken fil gör vad
De sex typerna av modelfiler du kommer stöta på, vad varje ändrar, hur stor den är, var den ska ligga och när du ska använda den: checkpoints och fine-tunes, LoRAs och deras LyCORIS-kusiner, textual inversion embeddings, ControlNets och IP-Adapters, VAEs och upscalers.
Av Quartermaster
2025-10-08
Promptning
Steg, CFG, samplers, schemaläggare och frön: förklaringar av genereringsinställningarna med säkra standardvärden
Vad varje inställning i genereringspanelen ändrar, vilka värden som fungerar för varje modelfamilj (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), vilka samplers som är värda att känna till, varför destillerade modeller bryter de vanliga reglerna och hur man använder frön för att ändra en sak i taget.
Av Quartermaster
2025-11-19
Videomodeller
AI-videogenerering för nybörjare: bild-till-video, text-till-video och den första klippet med Wan, LTX-2 och H3
En första vecka med öppna videomodeller: skillnaden mellan text-till-video och bild-till-video och varför man bör börja med det senare, de tre modellsfamiljerna värda att lära sig (Wan 2.2, LTX-2, MiniMax H3), bildrutor och upplösningar som funkar, hur man skriver en rörelse-prompt, vad man kan förvänta sig av ett 16 eller 24 GB-kort jämfört med molnet, och hur man gör femsekundersklipp längre.
Av Lookout
2026-04-29

Fler guider

Molntjänster
Fast avgift vs tokens: varför obegränsade planer som Graydient.ai är bäst värde för AI-skapare 2026
En rankad kostnadsjämförelse, med priser kontrollerade den 8 oktober 2026, av fast avgift obegränsade planer som Graydient.ai mot token- och kreditpriser från Midjourney, Leonardo, fal.ai, Replicate, Runway och Kling: vad 1 000 bilder och 1 000 videor i månaden verkligen kostar på varje, och varför en fast avgift för obegränsade bilder, video, ljud, Grok LLM-chatt och webbappar är bäst för skapare som itererar.
Av Captain
2026-10-08
Modeller
FLUX.1 Dev: hur du promptar det, bästa inställningarna och kreativa idéer
En praktisk guide till FLUX.1 Dev från Black Forest Labs: naturligt språk för prompts, styrning och steginställningar, LoRA-stapling, textrendering och promptidéer som spelar på dess styrkor.
Av Captain
2026-09-30
Modeller
Stable Diffusion XL 1.0: prompts, inställningar och vad den fortfarande är bäst på
Hur du får ut mest av den officiella SDXL 1.0 basmodellen: inbyggda upplösningar, CFG- och sampler-inställningar, refiner, negativa prompts och idéer för stilar där SDXL fortfarande glänser.
Av Captain
2026-10-01
Modeller
Stable Diffusion 1.5: den klassiska modellen, rätt promptad
Stable Diffusion 1.5 är fortfarande värd att känna till: rätt upplösning, CFG och sampler, hur du använder dess stora bibliotek av LoRAs och embeddings, och kreativa promptidéer som passar en 512-pixelmodell.
Av Captain
2026-10-02
Modeller
FLUX.2 Dev: promptning av den senaste modellen från Black Forest Labs
FLUX.2 Dev ger längre prompts, bättre text, starkare realism och redigering med flera referenser. Den här guiden täcker turboarbetsflödet, styrning och upplösningsinställningar, promptstruktur och idéer som använder dess nya styrkor.
Av Captain
2026-10-03
Modeller
Qwen-Image: långa prompts, perfekt text och tvåspråkiga affischer
Qwen-Image är modellen du ska använda när orden i bilden är viktiga. Lär dig hur du skriver långa beskrivande prompts, återger engelska och kinesiska texter korrekt, ställer in CFG och steg, och utforskar kreativa idéer med mycket layout.
Av Captain
2026-09-29