Model
Trends
.ai
Model
Trends
.ai
de bästa AI-modellerna med öppen källkod

Förstoring av AI-bilder: ESRGAN-modeller, hires-fix, tiled diffusion och när man ska använda vad

Ämne: Modeller
Av Quartermaster
Publicerad 2026-03-04
De tre typerna av förstoring och vad de är till för: snabba pixel-förstorare (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) för ren förstoring, hires-fix för att lägga till detaljer under genereringen, och tiled diffusion (Ultimate SD Upscale, SUPIR, Flux-baserade) för att göra en 1024-rendering till en detaljerad 4K-utskrift; med värden för brusreducering, kakstorlekar och modeller värda att ladda ner.

Översikt

Bildmodeller ritar bra i sin ursprungliga storlek (512 för
SD 1.5
, 1024 för
SDXL
och
Flux
) men dåligt långt över den, så sättet att få en stor bild är att generera i ursprungsstorlek och förstora efteråt. Det finns tre sätt att förstora, och de är inte utbytbara. Pixel-förstorare är små nätverk (ESRGAN-familjen, SwinIR, DAT) som skärper upp samtidigt som de ändrar storlek; de är snabba, trogna och lägger inte till nytt innehåll. Hires-fix är ett andra diffusionsteg i större storlek under genereringen som lägger till verkliga detaljer med måttlig brusreducering. Tiled diffusion delar upp en stor bild i överlappande kakor och kör
img2img
på varje, vilket kan hitta på trovärdiga detaljer i 4K och mer, styrt av en Tile
ControlNet
så att kakorna håller sig trogna.
Vilken du behöver beror på vad du vill ha. För webben och sociala medier räcker en 2x pixel-förstoring av en ren rendering och tar bara några sekunder. För utskrifter, produkter och bakgrunder ger en pixel-förstoring till 2x följt av en tiled diffusion-pass med låg brusreducering den detaljrikedom folk förväntar sig av "4K AI-konst". Hires-fix ligger mitt emellan och är standard i
Forge
och A1111 av en anledning: det fixar suddiga ansikten i 1024 utan en extra arbetsgång.
Familjen
Upscalers
på den här sidan listar pixel-förstorarna med deras användningsområden (foto, anime, ansikten, text) och diffusion-baserade förbättrare med deras basfamilj. Molnpartnerna kör samma verktyg:
PirateDiffusion
har kommandon /upscale och /enhance,
BitVector
en knapp för förstoring bredvid varje resultat.

Referens

Namn
Typ
Vad det är
4x-UltraSharp
pixel upscaler, ESRGAN
Standard för foton och renderingar: skarp, lite hård; skala ner till 2x efteråt för ett naturligt utseende.
Real-ESRGAN x4plus / x4plus-anime
pixel upscaler
Robust allround; anime-varianten håller linjer rena på illustrationer.
4x-NMKD-Siax, 4x-Foolhardy-Remacri
pixel upscaler
Mildare alternativ till UltraSharp; Remacri för mjuka foton, Siax för detaljerade texturer.
SwinIR / DAT / HAT
pixel upscaler, transformer
Högre trohet, långsammare; bäst för foton där ESRGAN hittar på textur.
Hires-fix
generation setting
Förstora med 1.5-2x med en pixel-förstoring och sen brusreducera 0.3-0.5 i den nya storleken. A1111/Forge kryssruta;
ComfyUI
som en andra KSampler.
Ultimate SD Upscale
tiled diffusion
Kakor på 1024 med 64 px överlapp, brusreducering 0.2-0.35, Tile ControlNet på. Gör 2048 till 4096 med nya detaljer.
SUPIR / Flux tiled / SeedVR
diffusion restorers
Tunga modeller som återställer och förbättrar gamla eller lågkvalitativa bilder; 16 GB+ och flera minuter per bild.
Denoise
0.2-0.5
I vilken diffusion-förstoring som helst, hur mycket som får ändras. 0.2 behåller allt; 0.5 ritar om texturer och kan ändra ansikten.
AD
Förstora med ett klick
Varje bild du gör i BitVector Prism har en Upscale-knapp som kör rätt förstoring för modellen; resultatet laddas ner i 2x eller 4x. Inga modellfiler att samla.

Steg för steg

  1. Generera i ursprungsstorlek och fixa komposition och ansikten först (inpainting); förstoring förstärker fel istället för att fixa dem.
  2. Snabb väg: Upscale Image (using Model) med 4x-UltraSharp, sen Image Scale till 2x originalstorleken. Klart på några sekunder; bra för webben.
  3. Hires-fix-vägen (Forge, A1111): slå på Hires. fix, välj upscaler 4x-UltraSharp eller Latent, förstora med 1.5-2, hires steg 15, brusreducering 0.4. I ComfyUI: Upscale Latent By 1.5 -> andra KSampler med brusreducering 0.45.
  4. Utskriftsvägen: pixel-förstora till 2x, sen Ultimate SD Upscale med samma
    checkpoint
    , kakstorlek 1024, padding 32, brusreducering 0.25, Tile ControlNet styrka 0.6, sömmar fix "half tile". Räkna med flera minuter.
  5. Ansikten: efter förstoringen kör en face detailer-pass (ADetailer, FaceDetailer node) med brusreducering 0.35; stora bilder gör små ansikten igen.
  6. Skärp lätt och exportera som PNG för utskrifter, WebP eller JPEG 92 för webben. Jämför med 1x-renderingen i 100 procent för att upptäcka påhittade artefakter.
  7. I molnet: svara på en PirateDiffusion-rendering med /upscale (pixel) eller /enhance (diffusion); i BitVector tryck på Upscale på bildkortet.

Exempel

Snabb 2x i ComfyUI

VAE Decode -> Upscale Image (using Model: 4x-UltraSharp) -> Image Scale (0.5, lanczos) -> Save Image

Forge hires-fix-inställningar

Hires. fix: upscaler 4x-UltraSharp | upscale by 1.5 | hires steps 15 | denoising strength 0.4 | same seed

Ultimate SD Upscale för utskrift

Input 2048x2048 (after 2x pixel upscale) | upscale_by 2 | tile 1024x1024 | mask blur 16 | padding 32 | denoise 0.25 | ControlNet Tile 0.6 | seam fix half tile

Tips

  • Förstora slutbilden, inte varje utkast; en 4x-pass på en 1024-rendering är 16 miljoner pixlar och tar tid.
  • ESRGAN-modeller är tränade för 4x; att köra dem på 2x betyder 4x först och sen nedskalning, vilket gör att resultatet ser för skarpt ut om du hoppar över nedskalningen.
  • Anime och platta illustrationer behöver anime-varianterna annars blir linjerna dubbla; foton behöver SwinIR, DAT eller Remacri annars blir huden plastig.
  • I tiled diffusion håll prompten kort och generell ("highly detailed, sharp focus, natural skin") så att ingen kaka hittar på ett nytt motiv.
  • Latent-förstoring i hires-fix behöver brusreducering 0.5+ för att bli skarp; pixel-förstorare i hires-fix funkar på 0.3-0.4 och håller bilden närmare originalet.
  • Familjen Upscalers-sidan sorterar efter popularitet; de tre översta täcker 90 procent av behoven.

Felsökning

Förstorad bild ser för skarp och hård ut

Varför det händer
4x ESRGAN-utdata behålls som 4x.

Så löser du det
Skala ner till 2x, eller använd Remacri/SwinIR.

Ansikten ändrades efter tiled-pass

Varför det händer
Brusreducering för hög; kakorna hittade på ansiktet.

Så löser du det
Brusreducering 0.2-0.25, Tile ControlNet på, face detailer efteråt.

Synliga rutnätsömmar

Varför det händer
Låg överlappning eller ingen sömfix.

Så löser du det
Padding 32-64, sömfix-läge, eller SUPIR för enstegsåterställning.

Hires-fix ger dubbla lemmar

Varför det händer
Förstoringsfaktor eller brusreducering för hög för modellen.

Så löser du det
Förstora max 1.5, brusreducering 0.4, eller använd pixel-förstoring istället för latent.

Minnesbrist vid dekodningssteget

Varför det händer
Fullstor VAE-dekodning av en 4K-bild.

Så löser du det
VAE Decode (Tiled) och mindre kakor.

AD
PirateDiffusion
/upscale och /enhance från chatten
Svara på vilken PirateDiffusion-rendering som helst med /upscale för en ren 4x eller /enhance för en tiled diffusion-pass med nya detaljer. Server-GPU:er gör jobbet; obegränsade pass till fast pris.

Frågor

Vilken förstoring är bäst?

4x-UltraSharp för de flesta renderingar, Real-ESRGAN anime för illustration, SwinIR eller DAT för foton. Familjen Upscalers-sidan rankar dem efter användning.

Fixar förstoring dåliga händer?

Nej; den förstorar dem. Måla om först, förstora sist.

Hur stort kan jag gå?

Pixel-förstorare till vilken storlek som helst; tiled diffusion till 8K med tålamod. Över 4x hittar modellen på mer än den bevarar.

Är hires-fix samma som förstoring?

Det är en förstoring med ett diffusionsteg inuti genereringen; det lägger till detaljer, en vanlig förstoring gör inte det.

Kan jag förstora video?

Ja: bildruta för bildruta med ESRGAN (snabbt, risk för flimmer) eller med videorestaurerare som SeedVR; videoguiderna täcker det.

Länkar och källor

Modeller i den här guiden

Skriven av
Quartermaster

Relaterade guider

Promptning
img2img, inpainting och outpainting grunder: fixa händer, byta objekt och förlänga en bild
De tre sätten att generera från en befintlig bild istället för från brus: img2img för att ändra stil med ett denoise-värde, inpainting för att måla om bara ett maskerat område (standardfixen för händer och ansikten), och outpainting för att förlänga duken; med val av denoise, padding och modell för SD 1.5, SDXL, Flux Fill och Qwen Image Edit.
Av Captain
2025-12-03
Promptning
ControlNet förklarat: pose, djup, kanter och referensbilder för SD 1.5, SDXL och Flux
Hur ControlNet får en modell att följa en pose, en djupkarta, en kantteckning eller en klotter istället för att gissa kompositionen från prompten: de vanliga kontrolltyperna och när man ska använda dem, förbehandlingssteget, styrka och slutprocentinställningar, familjespecifika filer och Flux-erans alternativ (Flux Depth, Canny, Kontext).
Av Captain
2026-02-18
Modeller
Krea2 Enhancer: renare detaljer och belysning för alla Krea 2-stilar
vrgamedevgirls Krea2 Enhancer LoRA förbättrar Krea 2-bilder inom realistiska, anime, produkt- och fantasistilar utan att ändra promptens avsikt. Lär dig vikten, arbetsflödet och idéerna.
Av Captain
2026-09-30
Promptning
Steg, CFG, samplers, schemaläggare och frön: förklaringar av genereringsinställningarna med säkra standardvärden
Vad varje inställning i genereringspanelen ändrar, vilka värden som fungerar för varje modelfamilj (SD 1.5, SDXL, Flux, Qwen, Z-Image, Wan), vilka samplers som är värda att känna till, varför destillerade modeller bryter de vanliga reglerna och hur man använder frön för att ändra en sak i taget.
Av Quartermaster
2025-11-19
Modeller
LTX 2.3 Crisp Enhance: skarpare, mer filmisk videodetalj
vrgamedevgirls Crisp Enhance LoRA för LTX 2.3 ökar skärpa, mikrodetaill och kontrast i genererad video. Lär dig hur du balanserar den med Soft Enhance-syskonet, vikter och promptidéer.
Av Captain
2026-10-03

Fler guider

Modeller
FLUX.1 Dev: hur du promptar det, bästa inställningarna och kreativa idéer
En praktisk guide till FLUX.1 Dev från Black Forest Labs: naturligt språk för prompts, styrning och steginställningar, LoRA-stapling, textrendering och promptidéer som spelar på dess styrkor.
Av Captain
2026-09-30
Modeller
Stable Diffusion XL 1.0: prompts, inställningar och vad den fortfarande är bäst på
Hur du får ut mest av den officiella SDXL 1.0 basmodellen: inbyggda upplösningar, CFG- och sampler-inställningar, refiner, negativa prompts och idéer för stilar där SDXL fortfarande glänser.
Av Captain
2026-10-01
Modeller
Stable Diffusion 1.5: den klassiska modellen, rätt promptad
Stable Diffusion 1.5 är fortfarande värd att känna till: rätt upplösning, CFG och sampler, hur du använder dess stora bibliotek av LoRAs och embeddings, och kreativa promptidéer som passar en 512-pixelmodell.
Av Captain
2026-10-02
Modeller
FLUX.2 Dev: promptning av den senaste modellen från Black Forest Labs
FLUX.2 Dev ger längre prompts, bättre text, starkare realism och redigering med flera referenser. Den här guiden täcker turboarbetsflödet, styrning och upplösningsinställningar, promptstruktur och idéer som använder dess nya styrkor.
Av Captain
2026-10-03
Modeller
Qwen-Image: långa prompts, perfekt text och tvåspråkiga affischer
Qwen-Image är modellen du ska använda när orden i bilden är viktiga. Lär dig hur du skriver långa beskrivande prompts, återger engelska och kinesiska texter korrekt, ställer in CFG och steg, och utforskar kreativa idéer med mycket layout.
Av Captain
2026-09-29
Modeller
SDXL-Lightning: fyrastegs-generering på vilken SDXL-checkpoint som helst
ByteDance:s SDXL-Lightning LoRA förvandlar en 30-stegs SDXL-rendering till en på 4 steg. Lär dig antal steg, vilken CFG du måste använda, samplern och hur du kombinerar den med dina favoritcheckpoints och stil-LoRAs.
Av Captain
2026-09-30