Text zu Video (T2V) ist eine generative KI-Technik, die eine geschriebene Beschreibung — einen Prompt — in einen bewegten Videoclip verwandelt, komplett mit Bewegung, Licht und (bei modernen Modellen) synchronem Audio. Du beschreibst die Szene; das Modell filmt sie.
So funktioniert es
Unter der Haube sind die meisten Text-zu-Video-Modelle Diffusionsmodelle, trainiert auf riesigen Bibliotheken aus Videos mit passenden Beschreibungen. Bei der Generierung startet das Modell mit reinem Rauschen und „entrauscht“ es Schritt für Schritt zu Frames — bei jedem Schritt von deinem Prompt geführt. Weil das Modell alle Frames in einem gemeinsamen zeitlichen Kontext generiert, bleibt das Ergebnis kohärent: Objekte bleiben bestehen, Bewegung fließt, und die Kamera verhält sich wie eine Kamera statt wie eine Diashow.
Was es am besten kann
Text zu Video glänzt, wenn du mit nichts als einer Idee startest:
-
Konzept-Exploration — visualisiere eine Szene, bevor du dich auf einen Dreh oder ein Storyboard festlegst.
-
Short-Form-Content — Hooks, B-Roll, Produkt-Teaser und Social Clips im Hoch- oder Breitformat.
-
Unmögliche Shots — ein Drohnenflug durch ein Schlüsselloch, eine Stadt aus Glas, ein Fuchs im Raumanzug. Wenn du es beschreiben kannst, kann das Modell es versuchen.
Was ein guter Prompt enthält
Die stärksten T2V-Prompts lesen sich wie die Shot-Notiz eines Regisseurs, nicht wie ein Wunschzettel. Deck vier Dinge ab: das Subjekt (wer oder was), die Aktion (was über die Zeit passiert), die Kamera (Framing und Bewegung) und die Atmosphäre (Licht, Farbpalette, Stimmung). Einen ausführlichen Einstieg findest du in unserem Guide zum Thema KI-Video-Prompts schreiben.