Text-zu-Video (T2V)

July 11, 2026
Text zu Video (T2V) ist eine KI-Technik, die deinen Prompt in einen bewegten Videoclip verwandelt. Erfahre, wie sie funktioniert und wie du richtig promptest.
AI Video

Text zu Video (T2V) ist eine generative KI-Technik, die eine geschriebene Beschreibung — einen Prompt — in einen bewegten Videoclip verwandelt, komplett mit Bewegung, Licht und (bei modernen Modellen) synchronem Audio. Du beschreibst die Szene; das Modell filmt sie.

So funktioniert es

Unter der Haube sind die meisten Text-zu-Video-Modelle Diffusionsmodelle, trainiert auf riesigen Bibliotheken aus Videos mit passenden Beschreibungen. Bei der Generierung startet das Modell mit reinem Rauschen und „entrauscht“ es Schritt für Schritt zu Frames — bei jedem Schritt von deinem Prompt geführt. Weil das Modell alle Frames in einem gemeinsamen zeitlichen Kontext generiert, bleibt das Ergebnis kohärent: Objekte bleiben bestehen, Bewegung fließt, und die Kamera verhält sich wie eine Kamera statt wie eine Diashow.

Was es am besten kann

Text zu Video glänzt, wenn du mit nichts als einer Idee startest:

  • Konzept-Exploration — visualisiere eine Szene, bevor du dich auf einen Dreh oder ein Storyboard festlegst.

  • Short-Form-Content — Hooks, B-Roll, Produkt-Teaser und Social Clips im Hoch- oder Breitformat.

  • Unmögliche Shots — ein Drohnenflug durch ein Schlüsselloch, eine Stadt aus Glas, ein Fuchs im Raumanzug. Wenn du es beschreiben kannst, kann das Modell es versuchen.

Was ein guter Prompt enthält

Die stärksten T2V-Prompts lesen sich wie die Shot-Notiz eines Regisseurs, nicht wie ein Wunschzettel. Deck vier Dinge ab: das Subjekt (wer oder was), die Aktion (was über die Zeit passiert), die Kamera (Framing und Bewegung) und die Atmosphäre (Licht, Farbpalette, Stimmung). Einen ausführlichen Einstieg findest du in unserem Guide zum Thema KI-Video-Prompts schreiben.

Text zu Video auf Molyin

Molyins Generator betreibt Seedance 2.0 im Text-zu-Video-Modus: Clips mit 5 oder 10 Sekunden, Auflösung bis 1080p, sechs Seitenverhältnisse von 21:9 Kinoformat bis 9:16 Hochformat, optionales KI-generiertes Audio und Seed-Kontrolle für reproduzierbare Ergebnisse.

Verwandte Begriffe

  • Bild zu Video — animiere ein vorhandenes Bild, statt nur von Text zu starten.

  • Referenz zu Video — steuere die Generierung mit Referenzbildern für konsistente Subjekte.

Probier es selbst mit dem KI-Video-Generator.

Text-zu-Video (T2V) | Molyin