Model
Trends
.ai
Model
Trends
.ai
die besten Open-Source-KI-Modelle

Wan 2.2 Video: Text-zu-Video und Bild-zu-Video Setup, Einstellungen und LoRAs

Thema: Videomodelle
Von Captain
Veröffentlicht am 2026-05-24
Erste Ergebnisse mit Wan 2.2: Welches Modell wählt man (5B oder 14B), das Expertenpaar mit hohem/niedrigem Rauschen, Auflösung und Bildanzahl, die funktionieren, die Lightning-LoRAs, die Render auf vier Schritte reduzieren, Prompt-Struktur für Bewegung und wie man es gehostet laufen lässt, wenn die Grafikkarte zu klein ist.

Überblick

Wan 2.2
ist Alibabas offene Videofamilie und das meist heruntergeladene Videomodell auf dieser Seite. Es gibt ein 5B Hybridmodell für Text- und Bild-zu-Video, das für Consumer-Grafikkarten gebaut ist (720p auf 8 bis 12 GB), und 14B Text-zu-Video und Bild-zu-Video Modelle, die zwei Experten nutzen: ein Modell mit hohem Rauschen, das Bewegung und Komposition in den ersten Schritten festlegt, und ein Modell mit niedrigem Rauschen, das in den letzten Schritten Details hinzufügt. Das 14B Paar liefert die cineastischen Ergebnisse, die geteilt werden; das 5B Modell ist das zum Lernen.
Die Community hat hunderte
Wan
LoRAs
trainiert: Kamerabewegungen (Orbit, Dolly, Crash Zoom), Bewegungsstile, Charaktere, Effekte und die Lightning-/Distillation-LoRAs, die 30-Schritte-Render auf 4 bis 8 Schritte mit wenig Verlust reduzieren. Die Wan-Familienseite sortiert sie nach Beliebtheit; die Lightning-LoRAs sind fast immer ganz oben.
Gehostete Optionen sind gut für Video geeignet, weil Render lange dauern und viel
VRAM
brauchen:
PirateDiffusion
läuft Wan-Workflows über Telegram mit /wf /run, und
BitVector
hält die Wan-Graphen vorinstalliert mit den LoRAs. Beide sind im Run-Bereich jeder Wan-Modellseite verlinkt.

Referenz

Name
Typ
Bedeutung
Wan2.2-TI2V-5B
model
Ein Modell für Text- und Bild-zu-Video, 720p bei 24 fps, maximal 121 Frames. fp16 10 GB, fp8 5 GB. 8 bis 12 GB Karten.
Wan2.2-T2V-A14B / I2V-A14B
model pair
Experten mit hohem und niedrigem Rauschen, je 14B (insgesamt 27B, 14B aktiv). 480p und 720p. fp8 etwa 14 GB je Modell; GGUF Q4 etwa 8 GB je Modell.
umt5-xxl text encoder
file
fp8 skaliert (6 GB) oder fp16 (11 GB). Wird von allen Wan-Modellen geteilt.
Wan 2.1
/ 2.2 VAE
file
Das 5B Modell nutzt die 2.2 VAE; die 14B Modelle die 2.1 VAE. Mischen führt zu Müll.
Resolution
setting
480x832 oder 832x480 für schnelle Tests; 720x1280 / 1280x720 für Endversionen. Vielfache von 16.
Frames
setting
4n+1: 33, 49, 65, 81. 81 Frames bei 16 fps sind fünf Sekunden.
Steps / shift /
CFG
setting
20 bis 30 Schritte, shift 5 bis 8,
CFG
3.5 bis 5 ohne Lightning. Mit Lightning-LoRAs: 4 bis 8 Schritte, CFG 1, shift 5.
Lightning / distill
LoRA
Separate LoRAs für die Experten mit hohem und niedrigem Rauschen; jeweils auf das eigene Modell laden. Gewicht 1.0.
Prompt
text
Subjekt, Aktion, Kamera, Beleuchtung, Stil, in dieser Reihenfolge. Bewegungsverben explizit beschreiben. Negativer Prompt wird von Wan genutzt (anders als bei
Flux
).
AD
Keine Installation nötig – KI-Modelle in der Cloud ausführen
BitVector Prism ist der einfachste Einstieg: Modell wählen, Prompt eingeben und in einer übersichtlichen Web-App generieren, ohne etwas einzurichten. BitVector gibt es auch auf Discord und im Web (SpyGlass).

Schritt für Schritt

  1. Installiere die Loader:
    ComfyUI
    Core unterstützt Wan 2.2; füge ComfyUI-GGUF für quantisierte Dateien hinzu. ComfyUI zuerst aktualisieren.
  2. Lade für deine Karte herunter: 5B fp8 plus 2.2 VAE und umt5 fp8 für 8 bis 12 GB; das 14B fp8 Paar plus 2.1 VAE für 24 GB; das 14B GGUF Q4 Paar für 12 bis 16 GB.
  3. Lade die offizielle Vorlage (Workflow > Browse Templates > Video > Wan 2.2) und ersetze die Loader durch deine Dateien. Für GGUF tausche Load Diffusion Model gegen Unet Loader (GGUF).
  4. Für 14B: zwei KSampler Advanced Nodes. Der erste läuft mit dem Modell mit hohem Rauschen für Schritte 0 bis N/2 (gibt Restrauschen zurück), der zweite läuft mit dem Modell mit niedrigem Rauschen von N/2 bis N. Die Vorlage ist dafür schon verdrahtet.
  5. Erster Render: 480x832, 33 Frames, 20 Schritte, CFG 4, shift 8, Prompt „a corgi runs along a beach at sunset, camera tracks alongside, golden light, shallow depth of field“. Rechne mit 2 bis 6 Minuten.
  6. Füge die Lightning-LoRAs von der Wan-Familienseite hinzu (je eine für jeden Experten), setze Schritte auf 6 (3 + 3), CFG 1. Renderzeiten sinken bei 480p auf unter eine Minute.
  7. Bild-zu-Video: Lade das I2V-Paar, gib das Bild in WanImageToVideo, halte den Prompt bei Bewegung und Kamera statt das Bild zu beschreiben.
  8. Endversionen: 720p, 81 Frames, mit RIFE oder FILM auf 32 fps interpolieren, bei Bedarf mit einem Video-Upscaler aus der Upscalers-Familie hochskalieren.
  9. Zu langsam oder zu groß: Nutze denselben Workflow auf BitVector oder auf PirateDiffusion mit /workflow /show:wan, um die Felder zu sehen, und /wf /run:wan mit deinem Prompt.

Beispiele

Text-zu-Video Prompt

A fisherman in a yellow raincoat hauls a net onto a small wooden boat in heavy rain, waves rock the boat, the camera is handheld and close, grey stormy light, cinematic, 35mm film grain
Negative: overexposed, static, blurry details, subtitles, worst quality, low quality, deformed, extra fingers, still image

Bild-zu-Video Prompt (nur Bewegung)

The woman turns her head toward the camera and smiles, wind moves her hair, slow push-in, soft daylight

PirateDiffusion

/workflow /show:wan-i2v
/wf /run:wan-i2v /initimage:Iabc123 the woman turns her head toward the camera and smiles, wind moves her hair, slow push-in

Tipps

  • Beschreibe Bewegung mit Verben und die Kamera mit Filmbegriffen (langsamer Dolly-in, Handkamera, statische Totale). Wan folgt Kamerasprache ungewöhnlich gut.
  • Negativen Prompt beibehalten: Der offizielle listet Überbelichtung, statisch, unscharfe Details, Untertitel, schlechteste Qualität, zusätzliche Finger, und das hilft.
  • Für I2V: Erzeuge den ersten Frame mit Flux,
    Qwen
    oder
    Z-Image
    im Ziel-Seitenverhältnis; ein scharfes, gut beleuchtetes Standbild liefert einen besseren Clip als jeder Prompt.
  • Bildanzahl kostet mehr als Auflösung: 81 Frames bei 480p sind günstiger als 49 Frames bei 720p.
  • Bewegungs-LoRAs für Wan sind nach dem Experten getaggt, den sie ansprechen; ein Low-Noise-LoRA fügt Details hinzu, ein High-Noise-LoRA ändert die Bewegung.
  • Seed ist bei Video sehr wichtig; halte den Seed beim Prompt-Tuning fest, variiere ihn dann für verschiedene Takes.
  • Speichere den Workflow mit deinem LoRA-Set als Vorlage; Wan-Graphen sind lang und leicht zu beschädigen.

Fehlerbehebung

Speicherfehler beim ersten Sampler

Warum es passiert
fp16 14B Gewichte auf einer 24-GB- oder kleineren Karte.

So behebst du es
fp8 oder GGUF Q4 Paar, weniger Frames, 480p, --lowvram; oder das 5B Modell.

Video ist unscharf oder farbig verrauscht

Warum es passiert
Falsche VAE (2.2 VAE mit 14B oder 2.1 VAE mit 5B), oder Lightning-LoRA ohne CFG 1.

So behebst du es
VAE passend zum Modell wählen; bei Lightning-LoRAs CFG 1 und 4 bis 8 Schritte einstellen.

Kaum Bewegung

Warum es passiert
Prompt beschreibt eine Szene, keine Aktion; oder zu wenige Schritte beim High-Noise-Experten.

So behebst du es
Bewegungsverben und Kamerabewegungen hinzufügen; dem High-Noise-Experten die Hälfte der Schritte geben.

Motiv verändert sich mitten im Clip

Warum es passiert
Zu viele Frames für die Auflösung oder zwei widersprüchliche LoRAs.

So behebst du es
Auf 49 Frames kürzen, immer nur eine Bewegungs-LoRA nutzen, Schritte beim Low-Noise-Experten erhöhen.

Dekodierung schlägt fehl, obwohl Sampling klappte

Warum es passiert
VAE-Dekodierung ist der Speicher-Höhepunkt bei Video.

So behebst du es
Wan VAE-Dekodierung in Kacheln (Option tiled im Decode-Node) oder weniger Frames.

Warnungen wegen nicht geladener LoRA-Schlüssel

Warum es passiert
Eine 2.1 LoRA auf 2.2, oder eine 14B LoRA auf dem 5B Modell.

So behebst du es
Version und Größe anpassen; die Modellseite nennt beides.

AD
PirateDiffusion
Keine Installation nötig – KI-Modelle in der Cloud ausführen
PirateDiffusion gibt es nur auf Telegram und richtet sich an Profis: tausende Modelle, LoRAs und Workflows per Chat-Befehl, mit unbegrenzter Generierung zum Festpreis.

Fragen

5B oder 14B?

5B zum Lernen und für 8 bis 12 GB Karten; 14B für Qualität, wenn du 24 GB hast oder gehostet arbeitest. Beide nehmen dieselben Prompts.

Wie lang ist ein Clip?

Bis zu 81 Frames (5 s bei 16 fps) für 14B und 121 Frames (5 s bei 24 fps) für 5B pro Render; längere Videos werden aus Fortsetzungen des letzten Frames zusammengesetzt.

Macht Wan auch Audio?

Wan 2.2 S2V animiert einen Sprecher aus Audio, erzeugt aber keinen Ton;
LTX-2
und
MiniMax H3
erzeugen Audio mit Video (deren Anleitungen sind auf dieser Seite).

Woher kommen die Lightning-LoRAs?

Distillation-Releases von Lightx2v und anderen; die Wan-Familienseite listet sie mit Heat-Scores und dem Experten, den sie ansprechen.

Kann ich Wan ohne GPU laufen lassen?

Ja: PirateDiffusion über Telegram, BitVector im Browser. Beide haben Workflows und LoRAs vorinstalliert.

Links und Quellen

Modelle in dieser Anleitung

Geschrieben von
Captain

Verwandte Anleitungen

Fehler & Lösungen
CUDA-Speicher voll: wie viel VRAM jedes KI-Modell braucht und wie man es passend macht
Eine VRAM-Tabelle für SD 1.5, SDXL, Flux, FLUX.2, Qwen-Image, Z-Image, Wan 2.2 und HunyuanVideo sowie die Techniken, die ein Modell passend machen: fp8- und GGUF-Quantisierung, CPU-Auslagerung, gekacheltes VAE, Auflösungs- und Frame-Limits und wann man aufhören sollte zu kämpfen und es gehostet laufen lässt.
Von Captain
2026-05-18
Fehler & Lösungen
ComfyUI-Fehler und wie man sie behebt: rote Knoten, fehlende Modelle, CUDA-Speicher voll
Die ComfyUI-Fehlermeldungen, die man zuerst sieht, was jede bedeutet und wie man sie am besten behebt: fehlende benutzerdefinierte Knoten (rote Kästen), „Prompt outputs failed validation“, CUDA-Speicher voll, falscher Modelltyp im Loader, mat1- und mat2-Formfehler, Header-Deserialisierung, torch- und xformers-Inkompatibilitäten.
Von Captain
2026-05-12
Videomodelle
MiniMax H3 Video-Prompts: die offizielle Struktur
Wie MiniMax einen H3-Prompt geschrieben haben will: die Ausrichtungszeile für bildverankerte Videos, die drei Kernfelder, Einstellungen und Schnitte, Kamerabewegungen, Sprecher-IDs und Dialog-Tags, die Klangkulisse und die Musik. Komprimiert aus dem offiziellen Prompt-Schreibleitfaden.
Von Captain
2026-09-14
Modelle
Flux vs SDXL vs SD 1.5 vs Qwen vs Z-Image: Welche Modellfamilie 2026 verwenden?
Ein praktischer Vergleich der offenen Bildmodellfamilien: Prompt-Verständnis, Realismus, Anime und Illustration, Texterstellung, Geschwindigkeit, VRAM, LoRA-Ökosystem und Lizenz, mit Empfehlungen für jede Art von Arbeit und Hardware.
Von Captain
2026-05-22

Weitere Anleitungen

Cloud-Dienste
Flat fee vs tokens: why unlimited plans like Graydient.ai are the best value for AI creators in 2026
A ranked cost comparison, with prices checked on 8 October 2026, of flat-fee unlimited plans like Graydient.ai against token and credit pricing from Midjourney, Leonardo, fal.ai, Replicate, Runway and Kling: what 1,000 images and 1,000 videos a month really cost on each, and why one fixed fee for unlimited images, video, audio, Grok LLM chat and web apps is the best value for creators who iterate.
Von Captain
2026-10-08
Modelle
FLUX.1 Dev: wie man es anweist, beste Einstellungen und kreative Ideen
Ein praktischer Leitfaden zu FLUX.1 Dev von Black Forest Labs: natürlichsprachige Eingaben, Guidance- und Schritt-Einstellungen, LoRA-Stapelung, Textrendering und Ideen für Eingaben, die seine Stärken nutzen.
Von Captain
2026-09-30
Modelle
Stable Diffusion XL 1.0: Prompts, Einstellungen und was es immer noch am besten kann
Wie du das offizielle SDXL 1.0 Basismodell optimal nutzt: native Auflösungen, CFG- und Sampler-Einstellungen, der Refiner, negative Prompts und Ideen für Stile, in denen SDXL immer noch glänzt.
Von Captain
2026-10-01
Modelle
Stable Diffusion 1.5: das klassische Modell, richtig genutzt
Stable Diffusion 1.5 ist immer noch wichtig: die richtige Auflösung, CFG und Sampler, wie du die riesige Bibliothek von LoRAs und Embeddings nutzt und kreative Prompt-Ideen, die zu einem 512-Pixel-Modell passen.
Von Captain
2026-10-02
Modelle
FLUX.2 Dev: das neueste Black Forest Labs Modell prompten
FLUX.2 Dev bringt längere Prompts, besseren Text, stärkeren Realismus und Multi-Referenz-Bearbeitung. Diese Anleitung erklärt den Turbo-Workflow, Guidance- und Auflösungseinstellungen, die Prompt-Struktur und Ideen, die seine neuen Stärken nutzen.
Von Captain
2026-10-03
Modelle
Qwen-Image: lange Prompts, perfekter Text und zweisprachige Poster
Qwen-Image ist das Modell, das du nutzen solltest, wenn die Wörter im Bild wichtig sind. Lerne, wie du lange, beschreibende Prompts schreibst, englischen und chinesischen Text genau darstellst, CFG und Schritte einstellst und layoutlastige kreative Ideen umsetzt.
Von Captain
2026-09-29