Model
Trends
.ai
Model
Trends
.ai
die besten Open-Source-KI-Modelle

KI-Videoerstellung für Anfänger: Bild-zu-Video, Text-zu-Video und der erste Clip mit Wan, LTX-2 und H3

Thema: Videomodelle
Von Lookout
Veröffentlicht am 2026-04-29
Share

Überblick

Videomodelle sind Bildmodelle mit einer Zeitachse: dieselbe Rauschunterdrückungsschleife läuft auf einem Block von Frames gleichzeitig, also gilt alles, was du über Prompts, Seeds und Rauschunterdrückung weißt, auch hier, ebenso die Kosten, multipliziert mit der Anzahl der Frames. Für Anfänger hat das drei praktische Folgen. Fang mit Bild-zu-Video (I2V) an, weil ein gutes Standbild von einem Bildmodell Komposition und Stil festlegt und das Videomodell nur noch die Bewegung erfinden muss. Halte Clips kurz (etwa fünf Sekunden), denn so wurden die Modelle trainiert. Und rechne damit, die großen Modelle in der Cloud laufen zu lassen, wenn du keine 24-GB-Karte hast.
Drei offene Familien decken 2026 die meisten Bedürfnisse ab.
Wan 2.2
(Alibaba) ist der Allrounder: ein 5B-Modell, das auf 12-16 GB läuft, und ein 14B-Zwei-Experten-Modell mit der besten offenen Qualität, dazu ein riesiges LoRA-Ökosystem für Bewegung und Stil.
LTX-2
(Lightricks) ist schnell und erzeugt synchronen Ton, braucht aber 24-32 GB.
MiniMax H3
ist das Audio-Video-Modell mit Dialog und Soundeffekten, meist über gehostete Workflows genutzt; die H3-Prompt-Guides von Mark White auf dieser Seite gehen tief darauf ein.
Hunyuan
Video 1.5 ist eine leichtere Alternative zum
Wan
14B.
Der Katalog listet jedes Videomodell und seine
LoRAs
mit der Basis und Größe, auf die sie abzielen (5B oder 14B, High-Noise- oder Low-Noise-Experte), und die Modellseiten zeigen Beispielclips mit ihren Prompts. Der Run-Button öffnet das Modell auf
PirateDiffusion
, wo ein Workflow-Befehl den Clip aus einer Antwort auf dein Bild erzeugt, oder auf
BitVector
.

Referenz

Name
Typ
Bedeutung
I2V (image to video)
mode
Bewege ein Standbild. Der beste erste Modus: Die Komposition stimmt schon; der Prompt beschreibt nur die Bewegung.
T2V (text to video)
mode
Nur aus einem Prompt. Mehr Vielfalt, weniger Kontrolle; nutze es für Ideen und B-Roll.
FLF2V / first-last frame
mode
Zwei Keyframes; das Modell füllt die Bewegung dazwischen. Kontrollierte Übergänge.
Frames and fps
setting
Wan: 81 Frames bei 16 fps (5 s); LTX-2: 97-121 Frames bei 24-25 fps; H3: 145 Frames bei ~24 fps. Speicherbedarf steigt mit der Framezahl.
Resolution
setting
Wan 2.2: 832x480 oder 480x832 (schnell), 1280x720 (ab 24 GB); LTX-2 bis 1080p+ mit 32 GB. Hochformat für Personen, Querformat für Szenen.
Motion prompt
prompt
Eine Bewegung des Subjekts plus eine Kamerabewegung: "sie dreht sich zum Fenster und lächelt; langsames Heranzoomen". Vermeide es, Details der Szene zu nennen, die schon im Bild sind.
Steps /
CFG
/ shift
setting
Wan 2.2 14B: 20 Schritte, aufgeteilt 10/10 auf die Experten,
CFG
3.5, Shift 5; 5B: 20-30 Schritte, CFG 5; LTX-2: 25-30 Schritte mit eigenem Zeitplan; destillierte LoRAs (lightx2v) bringen Wan auf 4-8 Schritte bei CFG 1.
Motion
LoRAs
file
Kamerabewegungen, Tänze, Gesten, Physik; passend zu 5B/14B und zum Experten. Die Seiten hier nennen das Ziel.
Interpolation and upscale
post
RIFE oder FILM auf 32-60 fps; frameweise ESRGAN oder SeedVR für die Auflösung.
AD
Dein erster Clip ohne GPU
BitVector Prism animiert ein Standbild mit den Wan-Modellen aus diesem Guide im Browser: Bild hochladen, Bewegungssatz schreiben, Clip herunterladen. Nichts zu installieren, funktioniert vom Laptop aus.

Schritt für Schritt

  1. Mach oder such dir ein Standbild: ein 1024x1024 oder 832x1216 Render mit einem klaren Motiv und einfachem Hintergrund. Gesichter, die größer als ein Zehntel des Bildes sind, animieren am besten.
  2. Öffne eine Wan 2.2 I2V-Modellseite auf dieser Seite, kopiere das Beispiel für den Bewegungs-Prompt und drücke den Run-Button (PirateDiffusion: antworte auf dein Bild mit dem /workflow-Befehl; BitVector: lade hoch und wähle das Modell).
  3. Schreib einen Bewegungs-Prompt mit einem Satz für das Motiv und einem für die Kamera. Nichts zu Kleidung, Farben oder Licht; das Bild hat das schon.
  4. Generiere bei 832x480 (Querformat) oder 480x832 (Hochformat), 81 Frames, Standard-Schritte. Schau dir den ganzen Clip an; beurteile die Bewegung, nicht die Schärfe.
  5. Arbeite nur am Bewegungs-Prompt weiter: langsamere Verben ("langsam", "sanft") reduzieren wildes Herumfuchteln; eine einzige Kameraanweisung verhindert Sprünge.
  6. Lokal, mit einer 16-GB-Karte:
    Wan 2.2 5B
    fp8 oder GGUF, 832x480, 49-81 Frames, Text-Encoder auf CPU. Mit 24 GB: 14B fp8 bei 480p, 720p mit ausgelagertem Encoder. Siehe den VRAM-für-KI-Video-Guide.
  7. Längere Stücke: nimm den letzten Frame von Clip eins als Startbild für Clip zwei mit einem fortlaufenden Bewegungs-Prompt; füge sie im Editor zusammen; interpolier auf 30 fps und skaliere am Ende hoch.
  8. Ton hinzufügen: LTX-2 und H3 erzeugen Audio mit dem Clip; bei Wan füge Musik oder Effekte im Editor hinzu.

Beispiele

Bewegungs-Prompt für I2V

Positive: she lifts the coffee cup, takes a sip and looks out of the window; slow push-in, shallow depth of field, natural motion
Negative (Wan): static, blurry, distorted face, extra fingers, jump cut, text

PirateDiffusion Workflow-Befehl

/workflow /run:wan22-i2v she lifts the coffee cup and looks out of the window, slow push-in /length:81 (as a reply to the still)

ComfyUI Wan 2.2 5B auf 16 GB

UnetLoaderGGUF wan2.2_ti2v_5B_Q8_0 | CLIPLoader umt5_xxl_fp8 (cpu) | Wan VAE 2.2 | WanImageToVideo 832x480, 81 frames | KSampler 24 steps, cfg 5, uni_pc, simple | VAE Decode (Tiled)

Tipps

  • Bewegungsverben sind wichtiger als Adjektive: "dreht sich, geht, hebt, gießt, winkt" erzeugen jeweils klare, verlässliche Bewegungen; "schön, filmisch" erzeugt nichts.
  • Eine Kamerabewegung pro Clip: Heranzoomen, Herauszoomen, Schwenk nach links, Umlauf. Zwei Bewegungen führen zu Wackeln.
  • Hochformatige Standbilder animieren Gesichter besser; Querformatige animieren Umgebungen besser.
  • Wan-LoRAs für den High-Noise-Experten formen die Bewegung; Low-Noise formen Details. Viele Pakete haben beide; lade jeweils auf den passenden Experten.
  • Destillierte LoRAs (lightx2v, FastWan) reduzieren Wan von 20 Schritten auf 4-6 bei CFG 1 mit wenig Qualitätsverlust; die Modellseiten listen sie auf.
  • Rechne mit 3-10 Minuten pro Clip auf einer 4090 für Wan 14B und etwa 90 Sekunden für LTX-2; die Cloud liefert die meisten Clips in ein bis zwei Minuten zurück.

Fehlerbehebung

Der Clip ist ein Standbild mit leichtem Flimmern

Warum es passiert
Kein Bewegungsverb im Prompt oder ein statisches LoRA-Gewicht zu hoch.

So behebst du es
Füge eine Bewegung des Subjekts und der Kamera hinzu; senke LoRAs auf 0,7.

Gesicht schmilzt oder ändert Identität

Warum es passiert
Gesicht zu klein, zu viele Frames oder 480p bei einem detaillierten Gesicht.

So behebst du es
Nähe das Bild enger zu, 49-61 Frames oder 720p in der Cloud; eine Gesichts-Detailierung pro Frame ist der letzte Ausweg.

Kamera springt oder die Szene schneidet

Warum es passiert
Zwei Kameraanweisungen oder "cut to" Wörter im Prompt.

So behebst du es
Nur eine Kamerabewegung; setze "jump cut" in den Negativ-Prompt.

Speicher voll bei 720p

Warum es passiert
Frames mal Auflösung überschreiten den
VRAM
.

So behebst du es
Falle auf 480p oder weniger Frames zurück, lade den Text-Encoder aus; siehe den VRAM-für-KI-Video-Guide.

Motion LoRA bewirkt nichts

Warum es passiert
Auf dem falschen Experten oder falscher Modellgröße geladen.

So behebst du es
Prüfe die Modellseite für 5B/14B und High/Low Noise; lade entsprechend mit dem passenden Triggerwort.

AD
PirateDiffusion
Wan 2.2 14B, LTX-2 und H3 per Telegram
PirateDiffusion betreibt die großen Videomodelle auf Server-GPUs: antworte auf ein Bild mit einem Workflow-Befehl und der Clip kommt im Chat zurück. Unbegrenzte Generierung zum Festpreis, keine 24-GB-Karte nötig.

Fragen

Welches Videomodell zuerst?

Wan 2.2 I2V: verzeihend, gut dokumentiert, die meisten LoRAs. Die Wan-Einsteigeranleitung hat die komplette Einrichtung.

Geht das auf einer 8-GB-Karte?

Kurze 480p-Clips mit
Wan 2.1
1.3B oder Wan 2.2 5B GGUF, langsam. Realistisch gesehen fang in der Cloud an.

Wie bekomme ich Ton?

LTX-2 und MiniMax H3 erzeugen synchronen Ton; Mark Whites H3-Prompt-Guides erklären Dialog- und Effekt-Prompts.

Wie lang kann ein Clip sein?

Etwa fünf Sekunden nativ. Längere Stücke sind verkettete Clips; die Qualität leidet ab sechs bis acht Sekunden in einem Durchlauf.

Sind die neuesten kommerziellen Modelle (Veo, Kling, Wan 3.0) lokal verfügbar?

Nein; sie sind nur per API zugänglich. Alles in diesem Guide ist Open-Weight und läuft lokal oder bei Cloud-Partnern.

Links und Quellen

Modelle in dieser Anleitung

Geschrieben von
Lookout

Verwandte Anleitungen

Videomodelle
Wan 2.2 Video: Text-zu-Video und Bild-zu-Video Setup, Einstellungen und LoRAs
Erste Ergebnisse mit Wan 2.2: Welches Modell wählt man (5B oder 14B), das Expertenpaar mit hohem/niedrigem Rauschen, Auflösung und Bildanzahl, die funktionieren, die Lightning-LoRAs, die Render auf vier Schritte reduzieren, Prompt-Struktur für Bewegung und wie man es gehostet laufen lässt, wenn die Grafikkarte zu klein ist.
Von Captain
2026-05-24
Videomodelle
Wie viel VRAM brauchst du für KI-Video? Wan 2.2, HunyuanVideo 1.5 und LTX-2 nach GPU-Größe (2026)
Benötigter VRAM für das lokale Ausführen von Wan 2.2, HunyuanVideo 1.5 und LTX-2, nach GPU-Größe, Auflösung und Clip-Länge: was 8, 12-16, 24, 32 und 48+ GB Karten schaffen, warum Video hundertmal mehr kostet als ein Bild, die Tricks zum Auslagern, die 14B-Modelle auf 24 GB passen lassen, realistische Generierungszeiten und wann Mieten besser ist als Kaufen.
Von P.I. Panda
2026-10-06
Prompting
MiniMax H3 ansteuern: Text zu Video, Bild zu Video, Referenzvideo und Audio
Wie du MiniMax H3 per Chatbefehl steuerst: das WHO + WHERE + ACTION + CAMERA + SOUND Rezept für Text zu Video, eine Standaufnahme mit Bild zu Video animieren, jedem Referenzbild eine Aufgabe im Referenzmodus geben und sauberen Dialog statt Gemurmel bekommen. Mit Kopier- und Ausprobier-Prompts und dem PDF des Autors.
Von Mark White
2026-09-20
Videomodelle
MiniMax H3 Video-Prompts: die offizielle Struktur
Wie MiniMax einen H3-Prompt geschrieben haben will: die Ausrichtungszeile für bildverankerte Videos, die drei Kernfelder, Einstellungen und Schnitte, Kamerabewegungen, Sprecher-IDs und Dialog-Tags, die Klangkulisse und die Musik. Komprimiert aus dem offiziellen Prompt-Schreibleitfaden.
Von Captain
2026-09-14
Modelle
LTX 2.3 Crisp Enhance: schärfer, kinoreiferes Videodetail
vrgamedevgirls Crisp Enhance LoRA für LTX 2.3 erhöht Schärfe, Mikrodetails und Kontrast in generierten Videos. Erfahre, wie du es mit dem Soft Enhance Geschwister ausbalancierst, mit Gewichten und Prompt-Ideen.
Von Captain
2026-10-03
Fehler & Lösungen
GPU- und VRAM-Leitfaden für KI-Bild- und Video-Modelle: Was jedes Modell braucht und was man kaufen sollte (oder nicht)
Wie viel Grafikspeicher jede Modellfamilie wirklich bei nutzbarer Geschwindigkeit braucht (SD 1.5, SDXL, Flux, FLUX.2, Qwen Image, Z-Image, Wan 2.2, LTX-2, H3), was fp8- und GGUF-Quantisierung bringen, warum auch System-RAM und Festplatte wichtig sind, eine Rangliste von Grafikkarten von 8 bis 32 GB, Hinweise zu Mac und AMD sowie ab wann Mieten günstiger ist als Kaufen.
Von Quartermaster
2026-01-07

Weitere Anleitungen

Cloud-Dienste
Pauschalpreis vs. Tokens: Warum unbegrenzte Pläne wie Graydient.ai 2026 den besten Wert für KI-Schöpfer bieten
Ein kostenbasierter Vergleich, Stand 8. Oktober 2026, von Pauschalpreisen für unbegrenzte Pläne wie Graydient.ai gegenüber Token- und Kreditpreisen von Midjourney, Leonardo, fal.ai, Replicate, Runway und Kling: Was 1.000 Bilder und 1.000 Videos pro Monat wirklich kosten und warum eine feste Gebühr für unbegrenzte Bilder, Videos, Audio, Grok LLM-Chat und Web-Apps für Schöpfer, die viel ausprobieren, am besten ist.
Von Captain
2026-10-08
Modelle
FLUX.1 Dev: wie man es anweist, beste Einstellungen und kreative Ideen
Ein praktischer Leitfaden zu FLUX.1 Dev von Black Forest Labs: natürlichsprachige Eingaben, Guidance- und Schritt-Einstellungen, LoRA-Stapelung, Textrendering und Ideen für Eingaben, die seine Stärken nutzen.
Von Captain
2026-09-30
Modelle
Stable Diffusion XL 1.0: Prompts, Einstellungen und was es immer noch am besten kann
Wie du das offizielle SDXL 1.0 Basismodell optimal nutzt: native Auflösungen, CFG- und Sampler-Einstellungen, der Refiner, negative Prompts und Ideen für Stile, in denen SDXL immer noch glänzt.
Von Captain
2026-10-01
Modelle
Stable Diffusion 1.5: das klassische Modell, richtig genutzt
Stable Diffusion 1.5 ist immer noch wichtig: die richtige Auflösung, CFG und Sampler, wie du die riesige Bibliothek von LoRAs und Embeddings nutzt und kreative Prompt-Ideen, die zu einem 512-Pixel-Modell passen.
Von Captain
2026-10-02
Modelle
FLUX.2 Dev: das neueste Black Forest Labs Modell prompten
FLUX.2 Dev bringt längere Prompts, besseren Text, stärkeren Realismus und Multi-Referenz-Bearbeitung. Diese Anleitung erklärt den Turbo-Workflow, Guidance- und Auflösungseinstellungen, die Prompt-Struktur und Ideen, die seine neuen Stärken nutzen.
Von Captain
2026-10-03
Modelle
Qwen-Image: lange Prompts, perfekter Text und zweisprachige Poster
Qwen-Image ist das Modell, das du nutzen solltest, wenn die Wörter im Bild wichtig sind. Lerne, wie du lange, beschreibende Prompts schreibst, englischen und chinesischen Text genau darstellst, CFG und Schritte einstellst und layoutlastige kreative Ideen umsetzt.
Von Captain
2026-09-29