Model
Trends
.ai
Model
Trends
.ai
najlepsze otwarte modele AI

Słownik generowania obrazów i wideo AI: 60 terminów od checkpoint do VAE, wyjaśnionych w jednym zdaniu

Temat: Promptowanie
Autor: Captain
Opublikowano 2026-04-15
Share

Przegląd

Każda społeczność wymyśla swój słownik i ta szybko stworzyła spory. Poniższy słownik to punkt odniesienia, na którym opierają się inne przewodniki na tej stronie; każdy termin ma jedno zdanie, rodzinę lub narzędzie, do którego należy, jeśli to ważne, oraz link do dłuższego przewodnika. Terminy są pogrupowane: modele i architektury, pliki, ustawienia, techniki, promptowanie, wideo, sprzęt.
Rodziny na tej stronie (
Flux
,
SDXL
,
Wan
i inne) są wyjaśnione na osobnych stronach, a każda strona modelu pokazuje używane terminy: jego typ, rodzinę, słowa wyzwalające, zalecane ustawienia. Jeśli na stronie modelu jest słowo, którego tu nie ma, miejsce na pytania to czat społeczności pod linkiem z FAQ.

Odniesienie

Nazwa
Typ
Co to jest
Checkpoint
/ base model
file
Pełne wagi modelu w jednym pliku (lub kilku dla modeli z ery Flux). Działa samodzielnie. Zobacz
checkpoint
vs
LoRA
vs embedding.
Fine-tune
model
Checkpoint przetrenowany na nowych danych (DreamShaper,
Illustrious
, Pony). Ta sama architektura co baza.
Merge
model
Checkpoint powstały przez uśrednienie innych. Dziedziczy rodzinę.
LoRA
/ LyCORIS / DoRA
file
Mały dodatek zmieniający zachowanie checkpointu; potrzebuje słowa wyzwalającego i wagi. Zobacz przewodnik LoRA.
Embedding
/ textual inversion
file
Nauczony token dla enkodera tekstu, wpisywany nazwą; głównie negatywne embeddingi na
SD 1.5
i SDXL.
VAE
component
Enkoder/dekoder między pikselami a latentami; zły VAE daje wyprane kolory.
Text encoder (CLIP, T5, LLM)
component
Przekształca prompt w liczby; decyduje o dialekcie promptu (tagi vs zdania).
U-Net / DiT / MMDiT
architecture
Projekt denoisera: U-Net w SD 1.5 i SDXL, diffusion transformer w Flux,
Qwen
, Wan,
Z-Image
.
MoE (mixture of experts)
architecture
Kilka podmodeli, z których jeden działa na krok (
Wan 2.2
eksperci wysokiego/niskiego szumu, HunyuanImage 3).
Diffusion / flow matching
training
Nauka usuwania szumu krok po kroku; flow matching to prostsza formuła od 2024+. Zobacz jak działają modele.
Distilled (Turbo, Lightning, Schnell, Klein, Hyper)
model
Trenowany, by potrzebować 1-8 kroków i
CFG
1; szybszy, mniej elastyczny.
Guidance-distilled
model
CFG wbudowane (
Flux dev
); wartość guidance zastępuje CFG, a negatywny prompt nic nie robi.
fp16 / bf16 / fp8 / NF4 / GGUF Q4-Q8
precision
Jak przechowywane są wagi; niższa precyzja to mniejsze pliki i
VRAM
, trochę gorsza jakość. Zobacz przewodnik VRAM.
format
Format tylko tensorów bez kodu vs pickle wykonujący kod. Zobacz bezpieczne pobieranie.
Steps
setting
Iteracje denoisingu; 20-30 normalnie, 4-8 distilled.
CFG
scale
setting
Jak mocno prompt kieruje generacją; 5-7 SDXL, 1 Flux. Zobacz wyjaśnienie ustawień.
Sampler
/ scheduler
setting
Metoda numeryczna i krzywa szumu (Euler, DPM++ 2M; Karras, simple, beta).
Seed
setting
Początkowy szum; stałe ziarno, powtarzalny obraz.
Denoise
setting
W
img2img
i inpaintingu, ile z wejścia może się zmienić (0-1).
Shift / sigma
setting
Gdzie model flow spędza kroki (Flux, Wan, Z-Image).
Latent
concept
Skompresowany obraz roboczy (1/8 lub 1/16 rozmiaru), który edytuje denoiser.
Resolution / native size
concept
512 (SD 1.5), 1024 (SDXL, Flux); wielokrotności 8 lub 16.
Hires-fix
technique
Drugi przebieg dyfuzji w większym rozmiarze podczas generacji. Zobacz skalowanie.
Upscaler
(ESRGAN, SwinIR)
technique
Sieć powiększająca piksele uruchamiana po generacji.
technique
Generowanie z istniejącego obrazu plus szum. Zobacz img2img i inpainting.
Inpainting
/ outpainting
technique
Odtwarzanie zamaskowanego obszaru / rozszerzanie płótna.
ControlNet
/ T2I-Adapter
technique
Kontrola struktury z pozy, głębi lub krawędzi. Zobacz wyjaśnienie
ControlNet
.
IP-Adapter / Redux / reference
technique
Styl lub tożsamość oparta na obrazie.
Face detailer / ADetailer
technique
Automatyczna maska twarzy plus inpaint w wyższej rozdzielczości.
Tiled diffusion / Ultimate SD Upscale
technique
Duże obrazy w nakładających się kafelkach z Tile ControlNet.
prompting
Co narysować / czego unikać (tylko SD i SDXL). Zobacz podstawy promptów i negatywy.
Trigger word
prompting
Token, pod którym trenowano LoRA; potrzebny, by działała.
Weight (word:1.3)
prompting
Nacisk uwagi w modelach CLIP.
Quality tags / score tags
prompting
masterpiece, best quality (Illustrious); score_9 (Pony). Tylko Anime SDXL.
Token limit (77)
prompting
Rozmiar kawałka CLIP; powód, dla którego długie promptu są obcinane w SD i SDXL.
Prompt bleeding
prompting
Atrybut przypisany do niewłaściwego obiektu.
T2I / T2V / I2V / TI2V / V2V
video
Tekst na obraz / tekst na wideo / obraz na wideo / oba / wideo na wideo.
Frames and fps
video
81 klatek przy 16 fps to 5 sekund na Wan; pamięć rośnie z liczbą klatek.
High-noise / low-noise expert
video
Dwa modele 14B Wan 2.2 na wczesne i późne kroki; LoRA celuje w jeden.
First / last frame
video
Warunkowanie klatki kluczowej (FLF2V) dla kontrolowanego ruchu.
VACE / Fun
ControlNet
video
Modele do edycji i kontroli w rodzinie Wan.
Frame interpolation (RIFE, FILM)
video
Generowanie klatek pośrednich, by podnieść fps.
VRAM
/ offloading / block swap
hardware
Pamięć GPU; przenoszenie części modelu do RAM systemowego, gdy nie mieści się. Zobacz przewodnik VRAM.
CUDA / MPS / ROCm
hardware
NVIDIA / Apple / AMD backendy obliczeniowe.
Workflow (
ComfyUI
)
tool
Zapisany graf węzłów; wbudowany w PNG
ComfyUI
. Zobacz przewodnik dla początkujących ComfyUI.
Custom node
tool
Rozszerzenie ComfyUI; instalowane przez Manager.
Heat score
this site
Jak popularny jest model teraz, na podstawie pobrań, uruchomień i wyszukiwań; wyjaśnione na stronie FAQ.
AD
Ucz się przez działanie, nie czytanie
BitVector Prism oznacza swoje ustawienia tymi samymi słowami co ten słownik i ładuje właściwe wartości dla modelu. Otwórz obok tej strony i wypróbuj każdy termin na prawdziwym obrazie. Bez instalacji.

Krok po kroku

  1. Przeczytaj stronę modelu od góry do dołu ze słownikiem obok: typ, rodzina, słowa wyzwalające, linia ustawień pod każdym przykładem.
  2. Wybierz trzy terminy, które Cię zmyliły i przeczytaj powiązany przewodnik; przewodniki są napisane tak, że ten słownik wystarcza jako kontekst.
  3. Gdy spotkasz nowy termin na forum, sprawdź, czy to plik, ustawienie, technika czy termin wideo; większość nieporozumień wynika z mieszania tych kategorii.
  4. Wracaj, gdy pojawi się nowa rodzina; strony hubów dodają własne terminy (eksperci Wan 2.2, guidance Flux) i ta lista jest aktualizowana.

Przykłady

Linia ustawień na stronie modelu, rozszyfrowana

"<lora:zavy-cinematic-xl:0.7> zavy cinematic, ... | 1024x1024 | DPM++ 2M Karras | 28 steps | CFG 6 | seed 4471"
LoRA at weight 0.7 with its trigger word; native SDXL size; sampler + scheduler; 28 denoising steps; CFG 6; fixed seed

Nazwa workflow Wan 2.2, rozszyfrowana

wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors -> Wan 2.2, image to video, the high-noise expert, 14B parameters, fp8 precision, safetensors format

Porady

  • Trzy słowa powodują większość błędów początkujących: rodzina (LoRA musi do niej pasować), słowo wyzwalające (LoRA go potrzebuje) i denoise (img2img zależy od niego).
  • Gdy dwa przewodniki różnią się co do CFG, mówią o różnych rodzinach; sprawdź, która.
  • "Model" w większości zdań oznacza checkpoint, ale na tej stronie "model" to każdy wpis w katalogu, w tym LoRA; etykieta typu mówi, który to.
  • Terminy wideo to te same pomysły z osią czasu; jeśli znasz T2I i img2img, znasz T2V i I2V.
  • Partnerzy w chmurze używają tego samego słownika: flagi
    PirateDiffusion
    to /steps, /guidance, /seed, /size; panel
    BitVector
    używa tych samych nazw.

Rozwiązywanie problemów

Dwa źródła używają tego samego słowa inaczej

Dlaczego tak się dzieje
Terminy zmieniały znaczenie między erami SD 1.5, SDXL i Flux ("guidance" vs "CFG").

Jak to naprawić
Trzymaj się rodziny: CFG dla SD/SDXL, guidance dla Flux.

"Model" na Civitai znaczy coś innego niż tutaj

Dlaczego tak się dzieje
Civitai grupuje wersje pod jednym modelem; ta strona wymienia każdą wersję osobno.

Jak to naprawić
Dopasuj po hash, nie po nazwie.

Ustawienie z modelu nie pasuje do mojego UI

Dlaczego tak się dzieje
Różne nazwy w UI (denoising strength vs denoise; hires steps vs second pass).

Jak to naprawić
Wiersz słownika podaje aliasy; przewodnik po węzłach ComfyUI mapuje nazwy węzłów.

AD
PirateDiffusion
Każdy termin to komenda
PirateDiffusion zamienia słownictwo na flagi Telegrama: /steps, /guidance, /seed, /size, tagi LoRA i [[negatives]]. Tysiące modeli, nieograniczone rendery, stała cena.

Pytania

Czy checkpoint to to samo co model?

W codziennym użyciu tak. Ściśle, checkpoint to zapisany plik modelu.

Jaka jest różnica między guidance a CFG?

CFG to classifier-free guidance stosowane w czasie działania na SD i SDXL; Flux dev ma to wbudowane i pokazuje pojedynczą wartość guidance.

Gdzie są terminy specyficzne dla wideo?

W grupie wideo powyżej i na stronach rodzin Wan,
LTX
i H3; przewodnik startowy do wideo je omawia.

Czy muszę znać to wszystko, żeby robić obrazy?

Nie. Rodzina, słowo wyzwalające i denoise rozwiązują 80 procent problemów; resztę poznasz w trakcie.

Linki i źródła

Modele w tym poradniku

Autor
Captain

Powiązane poradniki

Usługi w chmurze
Pierwsze kroki z generowaniem obrazów AI: twoje pierwsze zdjęcie w dziesięć minut
Proste wprowadzenie dla zupełnych początkujących: czym jest model, trzy sposoby na jego uruchomienie (aplikacja webowa, czat bot, własny komputer), jak napisać pierwszy prompt, co oznaczają ustawienia i jak odróżnić dobry wynik od szczęśliwego trafu.
Autor: Captain
2025-08-14
Modele
Jak działają generatywne modele AI do obrazów: proste wyjaśnienie dyfuzji, latentów i enkoderów tekstu
Mechanika działania Stable Diffusion, SDXL, Flux i modeli wideo bez matematyki: co ma do tego szum, dlaczego modele działają w skompresowanej przestrzeni latentnej, co robi enkoder tekstu i VAE, co naprawdę zmieniają kroki i wskazówki oraz dlaczego dane treningowe decydują, co model potrafi narysować.
Autor: Quartermaster
2025-08-28
Modele
Checkpoint vs LoRA vs embedding vs ControlNet: co robi który plik
Sześć rodzajów plików modelu, które spotkasz, co każdy zmienia, jak duży jest, gdzie go umieścić i kiedy używać: checkpointy i fine-tune’y, LoRA i ich kuzyni LyCORIS, tekstowe embeddingi, ControlNet i IP-Adaptery, VAE i upscalery.
Autor: Quartermaster
2025-10-08
Promptowanie
Kroki, CFG, samplery, schedulery i ziarna: wyjaśnienie ustawień generowania z bezpiecznymi domyślnymi wartościami
Co zmienia każde ustawienie w panelu generowania, jakie wartości działają dla rodzin modeli (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), które samplery warto znać, dlaczego modele destylowane łamią zwykłe zasady i jak używać ziaren, by zmieniać po kolei tylko jedną rzecz.
Autor: Quartermaster
2025-11-19
Modele wideo
Generowanie wideo AI dla początkujących: obraz na wideo, tekst na wideo i pierwszy klip z Wan, LTX-2 i H3
Pierwszy tydzień z otwartymi modelami wideo: różnica między tekstem na wideo a obrazem na wideo i dlaczego warto zacząć od tego drugiego, trzy rodziny modeli warte poznania (Wan 2.2, LTX-2, MiniMax H3), liczba klatek i rozdzielczości, które działają, jak napisać prompt ruchu, czego się spodziewać po karcie 16 lub 24 GB w porównaniu z chmurą oraz jak zamienić pięciosekundowe klipy w coś dłuższego.
Autor: Lookout
2026-04-29

Więcej poradników

Usługi w chmurze
Stała opłata vs tokeny: dlaczego nieograniczone plany jak Graydient.ai to najlepsza wartość dla twórców AI w 2026
Porównanie kosztów z 8 października 2026, pokazujące ceny stałych, nieograniczonych planów takich jak Graydient.ai w porównaniu do cen za tokeny i kredyty w Midjourney, Leonardo, fal.ai, Replicate, Runway i Kling: ile naprawdę kosztuje 1 000 obrazów i 1 000 filmów miesięcznie na każdej z tych usług i dlaczego jedna stała opłata za nieograniczoną liczbę obrazów, wideo, audio, czat Grok LLM i aplikacje webowe to najlepsza opcja dla twórców, którzy często poprawiają swoje prace.
Autor: Captain
2026-10-08
Modele
FLUX.1 Dev: jak go promptować, najlepsze ustawienia i pomysły kreatywne
Praktyczny przewodnik po FLUX.1 Dev od Black Forest Labs: naturalne promptowanie, ustawienia guidance i kroków, nakładanie LoRA, renderowanie tekstu i pomysły na prompt, które wykorzystują jego mocne strony.
Autor: Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompt, ustawienia i co nadal robi najlepiej
Jak wyciągnąć najwięcej z oficjalnego modelu bazowego SDXL 1.0: natywne rozdzielczości, ustawienia CFG i samplerów, refiner, negatywne prompt i pomysły na style, w których SDXL nadal błyszczy.
Autor: Captain
2026-10-01
Modele
Stable Diffusion 1.5: klasyczny model, używany właściwie
Stable Diffusion 1.5 wciąż warto znać: odpowiednia rozdzielczość, CFG i sampler, jak korzystać z ogromnej biblioteki LoRAs i embeddingów oraz pomysły na kreatywne prompta dopasowane do modelu 512-pikselowego.
Autor: Captain
2026-10-02
Modele
FLUX.2 Dev: jak korzystać z najnowszego modelu Black Forest Labs
FLUX.2 Dev obsługuje dłuższe prompt’y, lepszy tekst, silniejszy realizm i edycję z wieloma odniesieniami. Ten przewodnik pokazuje turbo workflow, ustawienia guidance i rozdzielczości, strukturę prompta oraz pomysły wykorzystujące nowe możliwości.
Autor: Captain
2026-10-03
Modele
Qwen-Image: długie prompt’y, idealny tekst i dwujęzyczne plakaty
Qwen-Image to model, do którego sięgasz, gdy liczą się słowa na obrazku. Naucz się pisać jego długie, opisowe prompt’y, dokładnie odwzorowywać tekst po angielsku i chińsku, ustawiać CFG i kroki oraz odkrywać pomysły na kreatywne projekty z dużą ilością układu.
Autor: Captain
2026-09-29