Model
Trends
.ai
Model
Trends
.ai
najlepsze otwarte modele AI

Checkpoint vs LoRA vs embedding vs ControlNet: co robi który plik

Temat: Modele
Autor: Quartermaster
Opublikowano 2025-10-08
Sześć rodzajów plików modelu, które spotkasz, co każdy zmienia, jak duży jest, gdzie go umieścić i kiedy używać: checkpointy i fine-tune’y, LoRA i ich kuzyni LyCORIS, tekstowe embeddingi, ControlNet i IP-Adaptery, VAE i upscalery.

Przegląd

Nowy użytkownik pobiera „model” i odkrywa, że to jedno z sześciu różnych rzeczy, które trafiają do sześciu różnych folderów i pełnią sześć różnych funkcji. Katalog na tej stronie oznacza każdy wpis jego typem (model bazowy,
LoRA
, embedding, inne) i rodziną właśnie z tego powodu. Ten przewodnik wyjaśnia te typy raz na zawsze, żeby te oznaczenia miały sens.
Zasada jest taka: checkpoint to cały malarz; LoRA uczy malarza nowego tematu lub stylu; embedding uczy malarza nowego słowa;
ControlNet
lub IP-Adapter mówi malarzowi, gdzie co ma być albo co skopiować z odniesienia; VAE to oczy malarza, które zamieniają między płótnem a skompresowaną przestrzenią roboczą;
upscaler
to osobny fachowiec, który powiększa gotowy obraz. Tylko checkpoint może działać sam. Reszta potrzebuje checkpointa z tej samej rodziny.
Rozmiary mówią dużo. 2 do 7 GB dla checkpointa
SDXL
i 12 do 24 GB dla
Flux
; 10 do 700 MB dla LoRA; poniżej 1 MB dla embeddingu; 1 do 2,5 GB dla ControlNet; 300 MB dla VAE; 60 MB dla ESRGAN upscalera. Jeśli plik nazwany LoRA ma 6 GB, to jest checkpoint. Strona modelu pokazuje rozmiar i hash, więc możesz to sprawdzić przed pobraniem.

Odniesienie

Nazwa
Typ
Co to jest
Checkpoint (model bazowy)
2-24 GB
Pełny denoiser, zwykle z tekstowym enkoderem i VAE w pakiecie. Fine-tune’y (DreamShaper, Juggernaut,
Illustrious
, Pony) to checkpointy przetrenowane na nowych danych. Folder: models/checkpoints (
ComfyUI
), models/Stable-diffusion (A1111,
Forge
). Flux,
Qwen
i
Wan
dostarczane jako osobne pliki diffusion_models + text_encoders + vae.
LoRA
10-700 MB
Mała różnica wag nakładana na checkpoint. Postacie, style, koncepcje, suwaki, ruch. Potrzebuje słowa wyzwalającego i wagi. Folder: models/loras lub models/Lora.
LyCORIS / LoCon / LoHa / DoRA
10-700 MB
Warianty LoRA, które dotykają więcej warstw lub używają innej faktoryzacji. Ładowane jak LoRA w każdym obecnym UI.
Embedding (tekstowa inwersja)
10-200 KB
Nauczony token dla tekstowego enkodera. Wywoływany nazwą pliku w promptcie. Częste jako negatywne embeddingi (bad-hands, easynegative) na
SD 1.5
i SDXL; rzadkie na Flux. Folder: models/embeddings.
ControlNet / T2I-Adapter
0.3-2.5 GB
Boczna sieć, która warunkuje denoiser na pozy, mapie głębokości, krawędzi lub szkicu. Specyficzne dla rodziny. Folder: models/controlnet.
IP-Adapter / odniesienie
50 MB-1 GB
Warunkuje na obrazie zamiast na tekście: transfer stylu, odniesienie twarzy. Potrzebuje pasującego modelu wizji CLIP.
VAE
160-330 MB
Enkoder/dekoder między pikselami a latentami. Zwykle w pakiecie z checkpointami; osobne pliki naprawiają wyblakłe kolory (SDXL fp16-fix) lub są z nowymi rodzinami (Flux ae.safetensors, Wan VAE).
Upscaler
2-70 MB
ESRGAN, Real-ESRGAN, SwinIR, DAT: osobne sieci, które powiększają piksele po generacji. Folder: models/upscale_models.
AD
Bez folderów, bez typów plików, bez szukania VAE
BitVector Prism ładuje razem checkpoint, LoRA, VAE i ControlNety, które do siebie pasują. Wybierz model z tej strony, dodatek i generuj w przeglądarce.

Krok po kroku

  1. Zidentyfikuj typ pliku po oznaczeniu w katalogu i rozmiarze przed pobraniem. Model bazowy, LoRA, embedding lub inne na karcie; dokładna liczba bajtów na stronie modelu.
  2. Dopasuj rodzinę. Każdy plik nie będący checkpointem podaje rodzinę, dla której został zrobiony (SDXL, Flux,
    Wan 2.2
    14B); działa tylko z checkpointami tej rodziny.
  3. Włóż plik do folderu dla jego typu (tabela wyżej) i odśwież UI.
  4. Checkpoint: wybierz go jako model. Dla rodzin podzielonych (Flux, Qwen, Wan,
    Z-Image
    ) ładuj diffusion model, tekstowe enkodery i VAE osobno w ComfyUI.
  5. LoRA: załaduj węzeł LoRA po checkpointcie albo <lora:name:0.8> w promptcie, plus słowo wyzwalające.
  6. Embedding: wpisz nazwę pliku w prompt (lub w negatywnym promptcie dla negatywnych embeddingów); ComfyUI używa embedding:name.
  7. ControlNet: zastosuj węzeł ControlNet z przetworzonym obrazem (poza, głębokość); zacznij od siły 0.8 i końcowego procentu 0.8.
  8. VAE i upscaler: wybierz VAE w loaderze lub ustawieniach, gdy kolory są złe; uruchom upscaler jako ostatni krok przez Upscale Image (używając Model).

Przykłady

Pełny stos SDXL w promptcie Forge

Checkpoint: juggernautXL_v9.safetensors | VAE: sdxl_vae_fp16fix.safetensors
Prompt: zavy cinematic, <lora:zavy-cinematic-xl:0.7> a knight resting by a campfire, night, embers, 35mm
Negative: easynegative, bad-hands-5, blurry | ControlNet: openpose, weight 0.8 | Upscaler: 4x-UltraSharp 2x

Ten sam stos jako węzły ComfyUI

Load Checkpoint -> Load LoRA -> Apply ControlNet (OpenPose image) -> KSampler -> VAE Decode (fp16-fix VAE) -> Upscale Image (using Model: 4x-UltraSharp)

Porady

  • Typ „inne” w katalogu obejmuje ControlNety, VAE, upscalery i workflowy; strona modelu mówi, co to dokładnie jest.
  • Merges to checkpointy powstałe przez uśrednianie innych checkpointów; dziedziczą rodzinę rodziców i zachowują kompatybilność z LoRA.
  • Checkpoint do inpaintingu to checkpoint z dodatkowymi kanałami wejściowymi; wymaga workflow inpaintingu i nie jest zamiennikiem do text-to-image.
  • Negatywne embeddingi były sposobem SD 1.5 na poprawę rąk; na SDXL pomagają mniej, a na Flux nie działają, bo model nie ma
    CFG
    negative.
  • Flux Fill, Flux Redux, Flux Depth i Canny to checkpointy lub adaptery, nie LoRA, choć są obok LoRA na hubie.
  • W razie wątpliwości partnerzy w chmurze mają gotowe kombinacje: wybierz model i LoRA, a pasujące VAE i ControlNet zostaną dobrane automatycznie.

Rozwiązywanie problemów

Pobrano „LoRA”, a to 6 GB

Dlaczego tak się dzieje
To jest checkpoint; uploader oznaczył go luźno.

Jak to naprawić
Włóż go do folderu checkpoints i wybierz jako model. Oznaczenie w katalogu tutaj jest wiarygodne.

Embedding nic nie robi

Dlaczego tak się dzieje
Zła rodzina (embedding SD 1.5 na SDXL) lub wpisana nazwa nie pasuje do nazwy pliku.

Jak to naprawić
Dopasuj rodzinę; wpisz dokładną nazwę pliku bez rozszerzenia; w ComfyUI użyj embedding:name.

ControlNet generuje szum lub ignoruje pozę

Dlaczego tak się dzieje
ControlNet dla innej rodziny albo podano surowe zdjęcie zamiast przetworzonej mapy.

Jak to naprawić
Użyj ControlNet zbudowanego dla rodziny checkpointa i najpierw uruchom węzeł preprocessora.

Kolory wyglądają na wyblakłe

Dlaczego tak się dzieje
Brak lub zły VAE.

Jak to naprawić
Załaduj VAE rodziny; na SDXL fp16-fix VAE.

Model się ładuje, ale generuje czarne obrazy

Dlaczego tak się dzieje
Przepełnienie fp16 w VAE lub checkpoint, który wymaga --no-half-vae.

Jak to naprawić
Użyj fp16-fix VAE lub flagi no-half-vae; na Flux sprawdź, czy precyzja enkodera tekstu pasuje do wersji.

AD
PirateDiffusion
Checkpointy, LoRA, embeddingi i ControlNety, już połączone
PirateDiffusion organizuje tysiące plików modeli na swoich GPU; podajesz checkpoint i tagi LoRA w komendzie Telegram, a pasujące VAE i ControlNety są stosowane. Nieograniczona generacja, stała cena.

Pytania

Co powinien pobrać początkujący najpierw?

Jeden checkpoint z rodziny, której chcesz używać. LoRA dopiero potem, gdy wiesz, który bazowy model lubisz. Embeddingi i ControlNety, gdy pojawi się konkretna potrzeba.

Czy mogę scalić LoRA z checkpointem?

Tak, każde UI ma narzędzie do scalania, a wynik to nowy checkpoint. Oszczędza węzeł, ale zamraża wagę; większość ludzi trzyma LoRA osobno.

Czy fine-tune to to samo co LoRA?

Nie. Fine-tune przetrenowuje cały checkpoint (gigabajty); LoRA to mały dodatek (megabajty). Wiele fine-tune’ów zaczynało jako scalone LoRA.

Czy Flux i Qwen używają embeddingów?

Praktycznie nigdy. Ich LLM tekstowe enkodery nie są trenowane w ten sposób; styl i koncepcje robi się przez LoRA.

Co to jest plik workflow?

ComfyUI JSON, który łączy te komponenty razem. Katalog oznacza niektóre jako „inne”; nie zawierają wag, tylko przepis.

Linki i źródła

Modele w tym poradniku

Autor
Quartermaster

Powiązane poradniki

Modele
Co to jest LoRA i jak jej używać w ComfyUI, Forge, Automatic1111 oraz w chmurze
LoRA wyjaśnione dla osób, które chcą efektów, a nie matematyki: co zmienia plik LoRA, dlaczego musi pasować do rodziny bazowego modelu, słowa wyzwalające, wagi, łączenie kilku LoR, folder i składnia dla każdego UI oraz jak wypróbować LoRA w chmurze przed pobraniem czegokolwiek.
Autor: Captain
2026-05-20
Aplikacje
Jak zainstalować LoRA: foldery, sprawdzanie plików i pierwsze użycie w ComfyUI, Forge, Automatic1111 i Draw Things
Praktyczny przewodnik instalacji: skąd pobrać LoRA, jak sprawdzić hash pliku względem strony modelu, do którego folderu trafić dla każdego popularnego UI, jak odświeżyć listę, jak załadować po raz pierwszy i trzy sposoby użycia LoRA w chmurze bez instalacji.
Autor: Lookout
2025-09-24
Modele
Jak działają generatywne modele AI do obrazów: proste wyjaśnienie dyfuzji, latentów i enkoderów tekstu
Mechanika działania Stable Diffusion, SDXL, Flux i modeli wideo bez matematyki: co ma do tego szum, dlaczego modele działają w skompresowanej przestrzeni latentnej, co robi enkoder tekstu i VAE, co naprawdę zmieniają kroki i wskazówki oraz dlaczego dane treningowe decydują, co model potrafi narysować.
Autor: Quartermaster
2025-08-28
Promptowanie
ControlNet wyjaśniony: pozowanie, głębia, krawędzie i obrazy referencyjne dla SD 1.5, SDXL i Flux
Jak ControlNet sprawia, że model podąża za pozą, mapą głębi, rysunkiem krawędzi lub szkicem zamiast zgadywać kompozycję na podstawie promptu: popularne typy kontroli i kiedy ich używać, krok preprocessora, ustawienia siły i końcowego procentu, pliki specyficzne dla rodziny oraz alternatywy z ery Flux (Flux Depth, Canny, Kontext).
Autor: Captain
2026-02-18
Modele
Skalowanie obrazów AI: modele ESRGAN, hires-fix, dyfuzja kafelkowa i kiedy używać każdego z nich
Trzy rodziny skalowania i do czego służą: szybkie skalery pikselowe (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) do czystego powiększania, hires-fix do dodawania detali podczas generowania oraz dyfuzja kafelkowa (Ultimate SD Upscale, SUPIR, oparta na Flux) do zamiany renderu 1024 na szczegółowy wydruk 4K; z wartościami denoise, rozmiarami kafelków i modelami, które warto pobrać.
Autor: Quartermaster
2026-03-04

Więcej poradników

Modele
FLUX.1 Dev: jak go promptować, najlepsze ustawienia i pomysły kreatywne
Praktyczny przewodnik po FLUX.1 Dev od Black Forest Labs: naturalne promptowanie, ustawienia guidance i kroków, nakładanie LoRA, renderowanie tekstu i pomysły na prompt, które wykorzystują jego mocne strony.
Autor: Captain
2026-09-30
Modele
Stable Diffusion XL 1.0: prompt, ustawienia i co nadal robi najlepiej
Jak wyciągnąć najwięcej z oficjalnego modelu bazowego SDXL 1.0: natywne rozdzielczości, ustawienia CFG i samplerów, refiner, negatywne prompt i pomysły na style, w których SDXL nadal błyszczy.
Autor: Captain
2026-10-01
Modele
Stable Diffusion 1.5: klasyczny model, używany właściwie
Stable Diffusion 1.5 wciąż warto znać: odpowiednia rozdzielczość, CFG i sampler, jak korzystać z ogromnej biblioteki LoRAs i embeddingów oraz pomysły na kreatywne prompta dopasowane do modelu 512-pikselowego.
Autor: Captain
2026-10-02
Modele
FLUX.2 Dev: jak korzystać z najnowszego modelu Black Forest Labs
FLUX.2 Dev obsługuje dłuższe prompt’y, lepszy tekst, silniejszy realizm i edycję z wieloma odniesieniami. Ten przewodnik pokazuje turbo workflow, ustawienia guidance i rozdzielczości, strukturę prompta oraz pomysły wykorzystujące nowe możliwości.
Autor: Captain
2026-10-03
Modele
Qwen-Image: długie prompt’y, idealny tekst i dwujęzyczne plakaty
Qwen-Image to model, do którego sięgasz, gdy liczą się słowa na obrazku. Naucz się pisać jego długie, opisowe prompt’y, dokładnie odwzorowywać tekst po angielsku i chińsku, ustawiać CFG i kroki oraz odkrywać pomysły na kreatywne projekty z dużą ilością układu.
Autor: Captain
2026-09-29
Modele
SDXL-Lightning: generowanie w czterech krokach na dowolnym checkpointcie SDXL
LoRA SDXL-Lightning od ByteDance zmienia renderowanie SDXL z 30 kroków na 4 kroki. Dowiedz się, ile kroków używać, jaką wartość CFG ustawić, jaki sampler wybrać i jak połączyć to z ulubionymi checkpointami i style LoRA.
Autor: Captain
2026-09-30