AI-video maken voor beginners: van afbeelding naar video, tekst naar video en de eerste clip met Wan, LTX-2 en H3
Onderwerp: Videomodellen
Door Lookout
Gepubliceerd op 2026-04-29
Overzicht
Videomodellen zijn afbeeldingsmodellen met een tijdas: dezelfde denoising loop draait op een blok frames tegelijk, dus alles wat je weet over prompts, seeds en denoise geldt ook hier, net als de kosten, vermenigvuldigd met het aantal frames. Voor een beginner heeft dat drie praktische gevolgen. Begin met afbeelding-naar-video (I2V), want een goede still van een afbeeldingsmodel legt compositie en stijl vast en laat het videomodel alleen de beweging verzinnen. Houd clips kort (ongeveer vijf seconden), want dat is waarop de modellen getraind zijn. En verwacht dat je de grote modellen in de cloud draait tenzij je een 24 GB kaart hebt.
Drie open families dekken de meeste behoeften in 2026.
Wan 2.2
(Alibaba) is de alleskunner: een 5B model dat draait op 12-16 GB en een 14B twee-expert model met de beste open kwaliteit, plus een enorme LoRA-ecosysteem voor beweging en stijl.
LTX-2
(Lightricks) is snel en maakt gesynchroniseerde audio maar wil 24-32 GB.
MiniMax H3
is het audio-video model met dialoog en geluidseffecten, meestal gebruikt via gehoste workflows; de H3 prompting gidsen op deze site door Mark White gaan er diep op in.
Hunyuan
Video 1.5 is een lichtere optie dan
Wan
14B.
De catalogus lijst elk videomodel en zijn
LoRA
’s met de basis en grootte waarop ze mikken (5B of 14B, high-noise of low-noise expert), en de modelpagina’s tonen voorbeeldclips met hun prompts. De Run-knop opent het model op
PirateDiffusion
, waar een workflow-commando de clip maakt vanuit een antwoord op je afbeelding, of op
BitVector
.
Naslag
Naam | Type | Wat het is |
|---|---|---|
I2V (image to video) | mode | Een still animeren. Beste eerste modus: compositie klopt al; de prompt beschrijft alleen beweging. |
T2V (text to video) | mode | Alleen vanuit een prompt. Meer variatie, minder controle; gebruik voor ideeën en B-roll. |
FLF2V / first-last frame | mode | Twee keyframes; het model vult de beweging daartussen in. Gecontroleerde overgangen. |
Frames and fps | setting | Wan: 81 frames bij 16 fps (5 s); LTX-2: 97-121 frames bij 24-25 fps; H3: 145 frames bij ~24 fps. Geheugen schaalt mee met frames. |
Resolution | setting | Wan 2.2: 832x480 of 480x832 (snel), 1280x720 (24 GB+); LTX-2 tot 1080p+ met 32 GB. Portret voor mensen, landschap voor scènes. |
Motion prompt | prompt | Beweging van één onderwerp plus één camerabeweging: "ze draait naar het raam en glimlacht; langzaam inzoomen". Vermijd het opsommen van details die al in de afbeelding zitten. |
setting | Wan 2.2 14B: 20 stappen verdeeld 10/10 over experts, CFG 3.5, shift 5; 5B: 20-30 stappen, CFG 5; LTX-2: 25-30 stappen met eigen schema; gedistilleerde LoRA’s (lightx2v) brengen Wan naar 4-8 stappen bij CFG 1. | |
Motion LoRAs | file | Camera bewegingen, dansen, gebaren, natuurkunde; afgestemd op 5B/14B en op de expert. Pagina’s hier noemen het doel. |
Interpolation and upscale | post | RIFE of FILM naar 32-60 fps; frame-voor-frame ESRGAN of SeedVR voor resolutie. |
AD

Je eerste clip zonder GPU
BitVector Prism animeert een still met de Wan modellen uit deze gids in de browser: upload de afbeelding, schrijf de bewegingszin, download de clip. Niets te installeren, werkt vanaf een laptop.
Stap voor stap
- Maak of kies een still: een 1024x1024 of 832x1216 render met een duidelijk onderwerp en een simpele achtergrond. Gezichten groter dan een tiende van het frame animeren het beste.
- Open een Wan 2.2 I2V modelpagina op deze site, kopieer het voorbeeld van de bewegingsprompt, en druk op de Run-knop (PirateDiffusion: antwoord op je afbeelding met het /workflow commando; BitVector: upload en kies het model).
- Schrijf een bewegingsprompt van één zin voor het onderwerp en één voor de camera. Niets over kleding, kleuren of licht; dat zit al in de afbeelding.
- Genereer op 832x480 (landschap) of 480x832 (portret), 81 frames, standaard stappen. Kijk de hele clip; beoordeel de beweging, niet de scherpte.
- Pas alleen de bewegingsprompt aan: langzamere werkwoorden ("langzaam", "zachtjes") verminderen wild bewegen; één camera-instructie voorkomt sprongen.
- Lokaal, met een 16 GB kaart:Wan 2.2 5Bfp8 of GGUF, 832x480, 49-81 frames, tekstencoder op CPU. Met 24 GB: 14B fp8 bij 480p, 720p met de encoder uitbesteed. Zie deVRAMvoor AI video gids.
- Langere stukken: neem het laatste frame van clip één als startafbeelding van clip twee met een doorlopende bewegingsprompt; voeg samen in een editor; interpoleer naar 30 fps en schaal op aan het eind.
- Voeg geluid toe: LTX-2 en H3 maken audio met de clip; voor Wan voeg je muziek of effecten toe in de editor.
Voorbeelden
Bewegingsprompt voor I2V
Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text
PirateDiffusion workflow commando
/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)
ComfyUI Wan 2.2 5B op 16 GB
UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)
Tips
- Bewegingswerkwoorden zijn belangrijker dan bijvoeglijke naamwoorden: "draait, loopt, tilt op, schenkt in, zwaait" geven elk een duidelijke, betrouwbare beweging; "mooi cinematografisch" levert niets op.
- Eén camerabeweging per clip: inzoomen, uitzoomen, naar links pannen, rond draaien. Twee bewegingen geven een wiebel.
- Portretstills animeren gezichten beter; landschapstills animeren omgevingen beter.
- Wan LoRA’s voor de high-noise expert bepalen de beweging; low-noise vormen de details. Veel packs bevatten beide; laad ze elk op hun expert.
- Gedistilleerde LoRA’s (lightx2v, FastWan) brengen Wan van 20 stappen naar 4-6 bij CFG 1 met weinig kwaliteitsverlies; de modelpagina’s vermelden ze.
- Reken op 3-10 minuten per clip op een 4090 voor Wan 14B en ongeveer 90 seconden voor LTX-2; de cloud levert de meeste clips binnen een minuut of twee terug.
Probleemoplossing
De clip is een still met een lichte flikkering
Waarom het gebeurt
Geen bewegingswerkwoord in de prompt, of een statisch LoRA gewicht te hoog.
Zo los je het op
Voeg een beweging van het onderwerp en een camerabeweging toe; verlaag LoRA’s naar 0.7.
Gezicht smelt of verandert identiteit
Waarom het gebeurt
Gezicht te klein, te veel frames, of 480p op een gedetailleerd gezicht.
Zo los je het op
Snijd dichterbij, 49-61 frames, of 720p in de cloud; een face-detailer per frame is het laatste redmiddel.
Camera springt of de scène knipt
Waarom het gebeurt
Twee camera-instructies, of "cut to" woorden in de prompt.
Zo los je het op
Eén camerabeweging; zet "jump cut" in de negatieve prompt.
Geheugen tekort bij 720p
Waarom het gebeurt
Frames keer resolutie overschrijdt VRAM.
Zo los je het op
Ga naar 480p of minder frames, besteed de tekstencoder uit; zie de VRAM voor AI video gids.
Motion LoRA doet niets
Waarom het gebeurt
Geladen op de verkeerde expert of verkeerde modelgrootte.
Zo los je het op
Check de modelpagina voor 5B/14B en high/low noise; laad met het juiste triggerwoord.
AD

Wan 2.2 14B, LTX-2 en H3 via Telegram
PirateDiffusion draait de grote videomodellen op server-GPU’s: antwoord op elke afbeelding met een workflow commando en de clip komt terug in de chat. Onbeperkt genereren voor een vaste prijs, geen 24 GB kaart nodig.
Vragen
Welk videomodel eerst?
Wan 2.2 I2V: vergevingsgezind, goed gedocumenteerd, de meeste LoRA’s. De Wan startgids heeft de volledige setup.
Kan ik dit doen op een 8 GB kaart?
Korte 480p clips met
Wan 2.1
1.3B of Wan 2.2 5B GGUF, langzaam. Realistisch gezien begin je in de cloud.
Hoe krijg ik geluid?
LTX-2 en MiniMax H3 maken gesynchroniseerde audio; Mark White’s H3 prompting gidsen leggen dialoog en effecten prompts uit.
Hoe lang kan een clip zijn?
Ongeveer vijf seconden native. Langere stukken zijn aaneengeschakelde clips; kwaliteit gaat achteruit na zes tot acht seconden in één keer.
Zijn de nieuwste commerciële modellen (Veo, Kling, Wan 3.0) lokaal beschikbaar?
Nee; ze zijn alleen via API. Alles in deze gids is open-weight en draait lokaal of bij cloudpartners.
Links en bronnen
- Wan 2.2 repository
- LTX-2 (Lightricks)
- Wan family page
- LTX-2 family page
- MiniMax H3 family page
- PirateDiffusion
- BitVector web app
Modellen in deze gids
Geschreven door
Lookout
Verwante gidsen
Videomodellen
Wan 2.2 video: tekst-naar-video en afbeelding-naar-video setup, instellingen en LoRA's
Eerste resultaten met Wan 2.2: welke modelgrootte kies je (5B of 14B), het high-noise / low-noise expertpaar, resolutie en aantal frames die werken, de lightning LoRA's die renders terugbrengen tot vier stappen, promptstructuur voor beweging, en hoe je het gehost draait als je kaart te klein is.
Door Captain
2026-05-24

Videomodellen
Hoeveel VRAM heb je nodig voor AI-video? Wan 2.2, HunyuanVideo 1.5 en LTX-2 per GPU-grootte (2026)
VRAM die nodig is om Wan 2.2, HunyuanVideo 1.5 en LTX-2 lokaal te draaien, per GPU-grootte, resolutie en cliplengte: wat 8, 12-16, 24, 32 en 48+ GB kaarten aankunnen, waarom video honderd keer meer kost dan een afbeelding, de offloading-trucs die 14B modellen op 24 GB passen, realistische generatie-tijden en wanneer huren beter is dan kopen.
Door P.I. Panda
2026-10-06
Prompten
Prompting MiniMax H3: tekst naar video, afbeelding naar video, referentievideo en audio
Hoe je MiniMax H3 aanstuurt vanuit een chatcommando: het WHO + WHERE + ACTION + CAMERA + SOUND recept voor tekst naar video, een stilstaand beeld animeren met afbeelding naar video, elke referentieafbeelding een taak geven in referentiemodus, en duidelijke dialogen krijgen in plaats van gemompel. Met kopieer-en-probeer prompts en de PDF van de auteur.
Door Mark White
2026-09-20
Videomodellen
MiniMax H3 video prompts: de officiële structuur
Hoe MiniMax wil dat een H3-prompt wordt geschreven: de uitlijningsregel voor beeld-gebonden video's, de drie kernvelden, shots en cuts, camerabewegingen, spreker-ID's en dialooglabels, het geluid en de muziek. Samengevat uit de officiële prompt schrijfhandleiding.
Door Captain
2026-09-14
Modellen
LTX 2.3 Crisp Enhance: scherpere, meer filmische videodetails
vrgamedevgirl's Crisp Enhance LoRA voor LTX 2.3 verhoogt scherpte, microdetails en contrast in gegenereerde video. Leer hoe je het in balans brengt met de Soft Enhance variant, gewichten en promptideeën.
Door Captain
2026-10-03
Fouten en oplossingen
GPU- en VRAM-gids voor AI-beeld en video: wat elk model nodig heeft en wat je moet kopen (of niet)
Hoeveel grafisch geheugen elke modelfamilie echt nodig heeft bij bruikbare snelheid (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), wat fp8 en GGUF-quantisatie je opleveren, waarom systeem-RAM en schijf ook belangrijk zijn, een ranglijst van kaarten van 8 tot 32 GB, Mac- en AMD-notities, en het punt waarop huren goedkoper is dan kopen.
Door Quartermaster
2026-01-07
Meer gidsen
Clouddiensten
Vaste prijs versus tokens: waarom onbeperkte plannen zoals Graydient.ai de beste waarde bieden voor AI-makers in 2026
Een gerangschikte kostenvergelijking, met prijzen gecontroleerd op 8 oktober 2026, van vaste prijs onbeperkte plannen zoals Graydient.ai tegenover token- en creditprijzen van Midjourney, Leonardo, fal.ai, Replicate, Runway en Kling: wat 1.000 afbeeldingen en 1.000 video's per maand echt kosten bij elk, en waarom één vaste prijs voor onbeperkte afbeeldingen, video, audio, Grok LLM chat en webapps de beste waarde is voor makers die veel experimenteren.
Door Captain
2026-10-08
Modellen
FLUX.1 Dev: hoe je het aanstuurt, beste instellingen en creatieve ideeën
Een praktische gids voor FLUX.1 Dev van Black Forest Labs: natuurlijk-taal prompts, begeleiding en stapinstellingen, LoRA stapeling, tekstweergave en promptideeën die goed werken met dit model.
Door Captain
2026-09-30
Modellen
Stable Diffusion XL 1.0: prompts, instellingen en waar het nog steeds het beste in is
Hoe je het meeste haalt uit het officiële SDXL 1.0 basismodel: native resoluties, CFG- en sampler-instellingen, de refiner, negatieve prompts en ideeën voor stijlen waarin SDXL nog steeds uitblinkt.
Door Captain
2026-10-01
Modellen
Stable Diffusion 1.5: het klassieke model, goed aangestuurd
Stable Diffusion 1.5 is nog steeds de moeite waard om te kennen: de juiste resolutie, CFG en sampler, hoe je de enorme bibliotheek met LoRAs en embeddings gebruikt, en creatieve promptideeën die passen bij een 512-pixel model.
Door Captain
2026-10-02
Modellen
FLUX.2 Dev: prompten met het nieuwste model van Black Forest Labs
FLUX.2 Dev brengt langere prompts, betere tekst, sterkere realisme en multi-reference bewerking. Deze gids behandelt de turbo workflow, guidance en resolutie-instellingen, promptstructuur en ideeën die gebruikmaken van de nieuwe mogelijkheden.
Door Captain
2026-10-03
Modellen
Qwen-Image: lange prompts, perfecte tekst en tweetalige posters
Qwen-Image is het model dat je moet gebruiken als de woorden in de afbeelding belangrijk zijn. Leer hoe je lange, beschrijvende prompts schrijft, Engelse en Chinese tekst nauwkeurig weergeeft, CFG en stappen instelt, en creatieve ideeën met veel lay-out onderzoekt.
Door Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Alle rechten voorbehouden