Model
Trends
.ai
Model
Trends
.ai
de bästa AI-modellerna med öppen källkod

AI-videogenerering för nybörjare: bild-till-video, text-till-video och den första klippet med Wan, LTX-2 och H3

Ämne: Videomodeller
Av Lookout
Publicerad 2026-04-29
Share

Översikt

Videomodeller är bildmodeller med en tidsaxel: samma brusreduceringsloop körs på en block av bildrutor samtidigt, så allt du vet om prompts, seeds och brusreducering gäller fortfarande, liksom kostnaderna, fast multiplicerat med antal bildrutor. De praktiska konsekvenserna för en nybörjare är tre. Börja med bild-till-video (I2V), för en bra stillbild från en bildmodell fixar komposition och stil och lämnar bara rörelsen till videomodellen att hitta på. Håll klippen korta (ungefär fem sekunder), för det är vad modellerna tränats på. Och räkna med att köra de stora modellerna i molnet om du inte har ett 24 GB-kort.
Tre öppna familjer täcker de flesta behov 2026.
Wan 2.2
(Alibaba) är allroundmodellen: en 5B-modell som körs på 12-16 GB och en 14B två-expertmodell med bästa öppna kvaliteten, plus ett stort LoRA-ekosystem för rörelse och stil.
LTX-2
(Lightricks) är snabb och genererar synkad ljud men vill ha 24-32 GB.
MiniMax H3
är ljud-video-modellen med dialog och ljudeffekter, mest använd via hostade arbetsflöden; H3-promptguiderna på den här sidan av Mark White går på djupet.
Hunyuan
Video 1.5 är ett lättare alternativ till
Wan
14B.
Katalogen listar varje videomodell och dess
LoRAs
med bas och storlek de riktar sig mot (5B eller 14B, högbrus- eller lågbrus-expert), och modell-sidorna visar exempelklipp med deras prompts. Kör-knappen öppnar modellen på
PirateDiffusion
, där ett arbetsflödeskommando skapar klippet från ett svar på din bild, eller på
BitVector
.

Referens

Namn
Typ
Vad det är
I2V (image to video)
mode
Animera en stillbild. Bästa första läget: kompositionen är redan rätt; prompten beskriver bara rörelse.
T2V (text to video)
mode
Bara från en prompt. Mer variation, mindre kontroll; använd för idéer och B-roll.
FLF2V / first-last frame
mode
Två nyckelbilder; modellen fyller i rörelsen däremellan. Kontrollerade övergångar.
Frames and fps
setting
Wan: 81 bildrutor vid 16 fps (5 s); LTX-2: 97-121 bildrutor vid 24-25 fps; H3: 145 bildrutor vid ~24 fps. Minnesanvändning ökar med antal bildrutor.
Resolution
setting
Wan 2.2: 832x480 eller 480x832 (snabbt), 1280x720 (24 GB+); LTX-2 upp till 1080p+ med 32 GB. Porträtt för personer, landskap för scener.
Motion prompt
prompt
En rörelse för motivet plus en för kameran: "hon vänder sig mot fönstret och ler; långsam inzoomning". Undvik att lista scenens detaljer som redan finns i bilden.
Steps /
CFG
/ shift
setting
Wan 2.2 14B: 20 steg delat 10/10 mellan experter,
CFG
3.5, shift 5; 5B: 20-30 steg, CFG 5; LTX-2: 25-30 steg med egen schema; destillerade LoRAs (lightx2v) ger Wan 4-8 steg vid CFG 1.
Motion
LoRAs
file
Kamerarörelser, dans, gester, fysik; anpassade till 5B/14B och experten. Sidor här namnger målet.
Interpolation and upscale
post
RIFE eller FILM till 32-60 fps; bildruta-för-bildruta ESRGAN eller SeedVR för upplösning.
AD
Ditt första klipp utan GPU
BitVector Prism animerar en stillbild med Wan-modellerna från den här guiden i webbläsaren: ladda upp bilden, skriv rörelsesatsen, ladda ner klippet. Inget att installera, funkar från en laptop.

Steg för steg

  1. Gör eller välj en stillbild: en 1024x1024 eller 832x1216 rendering med ett tydligt motiv och enkel bakgrund. Ansikten större än en tiondel av bilden animeras bäst.
  2. Öppna en Wan 2.2 I2V-modellsida på den här sidan, kopiera exempel-promptmönstret för rörelse och tryck på Kör-knappen (PirateDiffusion: svara på din bild med /workflow-kommandot; BitVector: ladda upp och välj modellen).
  3. Skriv en rörelse-prompt med en mening för motivet och en för kameran. Inget om kläder, färger eller ljus; det finns redan i bilden.
  4. Generera i 832x480 (landskap) eller 480x832 (porträtt), 81 bildrutor, standardsteg. Titta på hela klippet; bedöm rörelsen, inte skärpan.
  5. Jobba vidare bara med rörelse-prompten: långsammare verb ("långsamt", "mjukt") minskar ryckighet; en enda kamerainstruktion förhindrar hopp.
  6. Lokalt, med ett 16 GB-kort:
    Wan 2.2 5B
    fp8 eller GGUF, 832x480, 49-81 bildrutor, textkodare på CPU. Med 24 GB: 14B fp8 vid 480p, 720p med kodaren avlastad. Se VRAM-guiden för AI-video.
  7. Längre stycken: ta sista bilden från klipp ett som startbild för klipp två med en fortsättande rörelse-prompt; sätt ihop i en editor; interpolera till 30 fps och skala upp i slutet.
  8. Lägg till ljud: LTX-2 och H3 genererar ljud med klippet; för Wan, lägg till musik eller effekter i editorn.

Exempel

Rörelse-prompt för I2V

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

PirateDiffusion arbetsflödeskommando

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B på 16 GB

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

Tips

  • Rörelseverb är viktigare än adjektiv: "vänder, går, lyfter, häller, vinkar" ger varje sin egen tydliga rörelse; "vacker filmisk" ger inget.
  • En kamerarörelse per klipp: inzoomning, utzoomning, panorera vänster, cirkla runt. Två rörelser ger skakningar.
  • Porträttstills animerar ansikten bättre; landskapstills animerar miljöer bättre.
  • Wan LoRAs för högbrus-experten formar rörelsen; lågbrus formar detaljer. Många paket har båda; ladda varje på sin expert.
  • Destillerade LoRAs (lightx2v, FastWan) minskar Wan från 20 steg till 4-6 vid CFG 1 med liten kvalitetsförlust; modellsidorna listar dem.
  • Räkna med 3-10 minuter per klipp på en 4090 för Wan 14B och ungefär 90 sekunder för LTX-2; molnet ger tillbaka de flesta klipp på en till två minuter.

Felsökning

Klippet är en stillbild med lätt skimmer

Varför det händer
Ingen rörelseverb i prompten, eller en statisk LoRA-vikt för hög.

Så löser du det
Lägg till en rörelse för motivet och en för kameran; sänk LoRAs till 0.7.

Ansiktet smälter eller ändrar identitet

Varför det händer
Ansiktet för litet, för många bildrutor, eller 480p på ett detaljerat ansikte.

Så löser du det
Beskär närmare, 49-61 bildrutor, eller 720p i molnet; en ansiktsdetaljeringspass per bildruta är sista utvägen.

Kamerahopp eller scenklipp

Varför det händer
Två kamerainstruktioner, eller "cut to"-ord i prompten.

Så löser du det
En kamerarörelse; sätt "jump cut" i det negativa.

Minnesbrist vid 720p

Varför det händer
Bildrutor gånger upplösning överstiger
VRAM
.

Så löser du det
Sänk till 480p eller färre bildrutor, avlasta textkodaren; se VRAM-guiden för AI-video.

Motion LoRA gör inget

Varför det händer
Inläst på fel expert eller fel modellstorlek.

Så löser du det
Kolla modellsidan för 5B/14B och hög/låg brus; ladda rätt med dess triggerord.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 och H3 från Telegram
PirateDiffusion kör de stora videomodellerna på server-GPU: svara på vilken bild som helst med ett arbetsflödeskommando så kommer klippet tillbaka i chatten. Obegränsad generering till fast pris, inget 24 GB-kort behövs.

Frågor

Vilken videomodell först?

Wan 2.2 I2V: förlåtande, väl dokumenterad, flest LoRAs. Wan-startguiden har hela setupen.

Kan jag göra detta på ett 8 GB-kort?

Korta 480p-klipp med
Wan 2.1
1.3B eller Wan 2.2 5B GGUF, långsamt. Realistiskt, börja i molnet.

Hur får jag ljud?

LTX-2 och MiniMax H3 genererar synkat ljud; Mark Whites H3-promptguider förklarar dialog- och effektprompter.

Hur långt kan ett klipp vara?

Ungefär fem sekunder som standard. Längre stycken är kedjade klipp; kvaliteten försämras efter sex till åtta sekunder i ett pass.

Är de senaste kommersiella modellerna (Veo, Kling, Wan 3.0) tillgängliga lokalt?

Nej; de är API-endast. Allt i den här guiden är öppna vikter och körs lokalt eller på molnpartner.

Länkar och källor

Modeller i den här guiden

Skriven av
Lookout

Relaterade guider

Videomodeller
Wan 2.2 video: text-till-video och bild-till-video setup, inställningar och LoRAs
Få dina första resultat från Wan 2.2: vilken modellstorlek du ska välja (5B eller 14B), expertparet med hög brusnivå / låg brusnivå, upplösning och antal bilder som funkar, lightning-LoRAs som kortar ner renderingar till fyra steg, promptstruktur för rörelse och hur du kör det hostat när kortet är för litet.
Av Captain
2026-05-24
Videomodeller
Hur mycket VRAM behöver du för AI-video? Wan 2.2, HunyuanVideo 1.5 och LTX-2 efter GPU-storlek (2026)
VRAM som behövs för att köra Wan 2.2, HunyuanVideo 1.5 och LTX-2 lokalt, beroende på GPU-storlek, upplösning och klippets längd: vad 8, 12-16, 24, 32 och 48+ GB-kort klarar, varför video kostar hundra gånger mer än en bild, offloading-tricken som får 14B-modeller att rymmas på 24 GB, realistiska genereringstider och när det är bättre att hyra än att köpa.
Av P.I. Panda
2026-10-06
Promptning
Prompting MiniMax H3: text till video, bild till video, referensvideo och ljud
Hur du styr MiniMax H3 från ett chattkommando: receptet WHO + WHERE + ACTION + CAMERA + SOUND för text till video, animera en stillbild med bild till video, ge varje referensbild en uppgift i referensläge och få ren dialog istället för mumlande. Med kopiera-och-försök-promptar och författarens PDF.
Av Mark White
2026-09-20
Videomodeller
MiniMax H3 videopromptar: den officiella strukturen
Hur MiniMax vill att en H3-prompt ska skrivas: justeringsraden för bildankrade videor, de tre kärnfälten, tagningar och klipp, kamerarörelser, talar-ID:n och dialogtaggar, ljudbilden och musiken. Sammanfattat från den officiella promptskrivarguiden.
Av Captain
2026-09-14
Modeller
LTX 2.3 Crisp Enhance: skarpare, mer filmisk videodetalj
vrgamedevgirls Crisp Enhance LoRA för LTX 2.3 ökar skärpa, mikrodetaill och kontrast i genererad video. Lär dig hur du balanserar den med Soft Enhance-syskonet, vikter och promptidéer.
Av Captain
2026-10-03
Fel och lösningar
GPU- och VRAM-guide för AI-bild och video: vad varje modell behöver och vad du ska köpa (eller inte)
Hur mycket grafikminne varje modells familj verkligen behöver för användbar hastighet (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), vad fp8 och GGUF-kvantisering ger dig, varför system-RAM och disk också spelar roll, en rankning av kort från 8 till 32 GB, Mac- och AMD-noteringar, och när det är billigare att hyra än att köpa.
Av Quartermaster
2026-01-07

Fler guider

Molntjänster
Fast avgift vs tokens: varför obegränsade planer som Graydient.ai är bäst värde för AI-skapare 2026
En rankad kostnadsjämförelse, med priser kontrollerade den 8 oktober 2026, av fast avgift obegränsade planer som Graydient.ai mot token- och kreditpriser från Midjourney, Leonardo, fal.ai, Replicate, Runway och Kling: vad 1 000 bilder och 1 000 videor i månaden verkligen kostar på varje, och varför en fast avgift för obegränsade bilder, video, ljud, Grok LLM-chatt och webbappar är bäst för skapare som itererar.
Av Captain
2026-10-08
Modeller
FLUX.1 Dev: hur du promptar det, bästa inställningarna och kreativa idéer
En praktisk guide till FLUX.1 Dev från Black Forest Labs: naturligt språk för prompts, styrning och steginställningar, LoRA-stapling, textrendering och promptidéer som spelar på dess styrkor.
Av Captain
2026-09-30
Modeller
Stable Diffusion XL 1.0: prompts, inställningar och vad den fortfarande är bäst på
Hur du får ut mest av den officiella SDXL 1.0 basmodellen: inbyggda upplösningar, CFG- och sampler-inställningar, refiner, negativa prompts och idéer för stilar där SDXL fortfarande glänser.
Av Captain
2026-10-01
Modeller
Stable Diffusion 1.5: den klassiska modellen, rätt promptad
Stable Diffusion 1.5 är fortfarande värd att känna till: rätt upplösning, CFG och sampler, hur du använder dess stora bibliotek av LoRAs och embeddings, och kreativa promptidéer som passar en 512-pixelmodell.
Av Captain
2026-10-02
Modeller
FLUX.2 Dev: promptning av den senaste modellen från Black Forest Labs
FLUX.2 Dev ger längre prompts, bättre text, starkare realism och redigering med flera referenser. Den här guiden täcker turboarbetsflödet, styrning och upplösningsinställningar, promptstruktur och idéer som använder dess nya styrkor.
Av Captain
2026-10-03
Modeller
Qwen-Image: långa prompts, perfekt text och tvåspråkiga affischer
Qwen-Image är modellen du ska använda när orden i bilden är viktiga. Lär dig hur du skriver långa beskrivande prompts, återger engelska och kinesiska texter korrekt, ställer in CFG och steg, och utforskar kreativa idéer med mycket layout.
Av Captain
2026-09-29