← Laser Studios
Basics · 04

Der erste Workflow

Was Workflows und Nodes sind, wie ein modernes Modell wie Wan 2.1 aufgebaut ist – und wie du mit der eingebauten Vorlage dein erstes eigenes Video generierst.

Basics Videogenerierung Text-to-Video Wan 2.1

Was ist ein Workflow?

Ein Workflow ist der komplette Graph in ComfyUI: alle Bausteine plus ihre Verbindungen, die zusammen ein Ergebnis erzeugen. Du kannst ihn als .json-Datei speichern, teilen und jederzeit wieder laden. Für den Einstieg nutzen wir eine fertige Vorlage, die in ComfyUI bereits eingebaut ist – du musst also nichts selbst verdrahten.

Was sind Nodes?

Ein Node ist ein einzelner Baustein mit einer klaren Aufgabe. Links sitzen die Eingänge, rechts die Ausgänge. Du ziehst von einem Ausgang eine Verbindung zum Eingang des nächsten Nodes – so fließen die Daten durch den Graphen.

Die farbigen Punkte zeigen den Datentyp (z. B. MODEL, CLIP, LATENT, IMAGE). Verbinden lassen sich nur gleiche Typen – gleiche Farbe an gleiche Farbe. Mehr musst du fürs Erste nicht wissen.

Das Modell: Wan 2.1

Wir arbeiten mit Wan 2.1 – einem quelloffenen Videomodell von Alibaba (Februar 2025). Unter der Apache-2.0-Lizenz ist es auch kommerziell frei nutzbar. Wan 2.1 gibt es in zwei Größen, aus denen du je nach Hardware und Qualitätsanspruch wählst:

Zwei Größen – du wählst

1.3B – die leichte Variante: schnell, läuft schon ab ca. 8 GB VRAM, ideal zum Einstieg (Auflösung um 480p). · 14B – die große Variante: deutlich bessere Bewegung und Details, braucht mehr VRAM, dafür bis 720p. Für beste Ergebnisse jeweils die fp16-Version nehmen.

Wie bei modernen Modellen üblich kommt Wan 2.1 nicht als eine einzige Datei, sondern in drei Teilen – und jeder Teil hat seinen eigenen Loader-Node:

🧠 Diffusion Model – das Bild-Wissen

Das eigentliche trainierte Modell. Es rechnet aus Rauschen Schritt für Schritt die Bilder deines Videos. Node: Load Diffusion Model · Ordner: models/diffusion_models/

💬 Text Encoder (UMT5) – das Sprachverständnis

Übersetzt deinen Prompt in eine Form, mit der das Modell arbeiten kann. Node: Load CLIP · Ordner: models/text_encoders/

🎞️ VAE – der Bild-Dekoder

Wandelt das komprimierte (latente) Ergebnis am Ende in sichtbare Pixel um. Node: Load VAE · Ordner: models/vae/

Warum kein „Load Checkpoint“? Ältere Modelle wie Stable Diffusion packten alle drei Teile in eine einzige Datei – den Checkpoint. Moderne Modelle liefern sie getrennt aus: Das spart Speicher und ist flexibler, weil z. B. derselbe Text Encoder für mehrere Modelle genutzt werden kann. Merksatz: Ein Modell = Wissen + Sprachverständnis + Dekoder.

Das Beste: Du musst die Dateien nicht von Hand suchen. Die Vorlage erkennt, was fehlt, und ComfyUI bietet den Download direkt an. Für die leichte 1.3B-Variante sind das zusammen rund 8 GB (Modell + UMT5-Text-Encoder + VAE); die 14B-Variante ist deutlich größer.

Der Wan-2.1-Workflow

Dieser Workflow erzeugt aus einem Textprompt ein kurzes Video (Text-to-Video). Er besteht aus acht Nodes, die der Reihe nach durchlaufen werden:

Load Diffusion Model MODEL Load CLIP CLIP Load VAE VAE CLIP Text Encode (+) CLIP Text Encode (–) Empty Latent Video 832 × 480 · Länge KSampler steps · cfg · seed VAE Decode Save Video 🎬
Der komplette Text-to-Video-Workflow – links die drei Modell-Teile, rechts das fertige Video

So startest du

Abkürzung – unser fertiger Workflow: Lade die Laser-Studios-Version dieses Workflows. Sie enthält oben links eine Notiz mit allen Download-Links und dem Pfadbaum – du siehst sofort, welche Datei in welchen Ordner gehört.

→ Workflow herunterladen (.json)

In ComfyUI einfach per Drag & Drop ins Fenster ziehen – oder Workflow → Open.

Wan-Workflow mit Laser-Studios-Modell-Note
Unser Workflow: die Notiz „Laser Studios – Modelle" listet alle Links und den Pfadbaum direkt neben den Modell-Nodes.

Dieser Workflow basiert auf der offiziellen Vorlage „Wan 2.1 Text to Video" und wurde von uns nur leicht ergänzt – vor allem um die Modell-Note. Ziel ist, dass du hier die Grundlagen von Ordnerstruktur und Modellen verstehst; die Original-Vorlage findest du in ComfyUI jederzeit unter Workflow → Browse Templates.

  1. Lade oben im Laser-Studios-Workflow (Button oben) die .json herunter und öffne sie in ComfyUI: einfach per Drag & Drop ins Fenster ziehen – oder über Workflow → Open.
  2. ComfyUI erkennt die fehlenden Modelle und zeigt oben die Warnung „3 required models are missing“. Klick auf Show missing models und lade jede Datei über Download.
    Fehlende Modelle – Download
    Fehlt etwas, meldet ComfyUI es – über „Show missing models“ und „Download“ laden.
  3. Die geladenen Dateien müssen in die passenden Ordner deiner ComfyUI-Installation – danach ComfyUI neu starten (oder R drücken):
    • wan2.1_t2v_1.3B_fp16.safetensorsComfyUI/models/diffusion_models/
    • umt5_xxl_fp8_e4m3fn_scaled.safetensorsComfyUI/models/text_encoders/
    • wan_2.1_vae.safetensorsComfyUI/models/vae/
  4. umt5_xxl_fp8_e4m3fn_scaled.safetensorsComfyUI/models/text_encoders/
  5. wan_2.1_vae.safetensorsComfyUI/models/vae/
  6. Für bessere Ergebnisse wählst du im Node Load Diffusion Model die 14B-Datei (einmalig herunterladen) – optional, sonst bleibt es bei 1.3B.
  7. Beschreibe im positiven Prompt-Node in ganzen Sätzen, was passieren soll (der negative bleibt erstmal wie er ist).
  8. Klick oben auf Run (früher „Queue Prompt“) – die erste Generierung dauert ein paar Minuten (die Modelle werden erst geladen), danach geht es schneller. Dein Video erscheint im Save-Video-Node.

Hardware-Check: Die 1.3B-Variante läuft schon ab ca. 8 GB VRAM. Die 14B-Variante liefert bessere Ergebnisse, braucht aber deutlich mehr VRAM (16 GB+ empfohlen, für 720p mehr). Wenn eine Generierung sehr lange dauert oder abbricht, reduziere zuerst Auflösung und Länge im Latent-Node – oder bleib bei 1.3B.

Tipp – nur ein Bild statt Video? Stell im Latent-Node die Länge auf 1 Frame. Damit wird Wan zum Bildgenerator – perfekt zum schnellen Testen von Prompts.

Diese Ordner brauchst du immer wieder. ComfyUI sortiert Modelle nach Typ in feste Unterordner von ComfyUI/models/ – egal, welches Modell du später lädst, es kommt in einen davon: diffusion_models/ (bzw. checkpoints/) für das Hauptmodell, text_encoders/ für Text-Encoder, vae/ für VAEs, dazu z. B. loras/, clip_vision/, controlnet/ und upscale_models/. Wenn du dir diese Struktur einmal merkst, weißt du bei jedem neuen Modell sofort, wohin die Datei gehört – und die Modell-Note im Workflow zeigt dir den passenden Pfad immer direkt mit an.

Nächster Schritt