Text-zu-Video (T2V)

Text zu Video (T2V) ist eine KI-Technik, die deinen Prompt in einen bewegten Videoclip verwandelt. Erfahre, wie sie funktioniert und wie du richtig promptest.

Vollständigen Generator öffnen

So sieht es in Aktion aus

Ein echter Prompt und das Ergebnis, das er auf Molyin erzeugt hat. Mit Remix startest du genau hier.

  • Wan 3.0
  • Text to video
  • 15s
  • 720P

Auf dem steinernen Innenhof hinter dem Shaolin-Tempel stehen junge kahlgeschorene Shaolin-Novizen in einer exakt ausgerichteten Formation. Auf das Kommando des Ausbilders beginnen alle gemeinsam mit wiederholten Tritt-Übungen: hohe Tritte, Seitwärtstritte und Drehtritte, die ohne Unterbrechung ineinander übergehen, vollkommen synchron und präzise. Die Kamera schneidet auf eine Nahaufnahme eines jungen Mönchs in der Stellung „Goldener Hahn steht auf einem Bein“. Er balanciert auf einem Fuß, die Hände vor der Brust zusammengelegt, und verharrt minutenlang vollkommen still und fest. Der Ausbilder tritt zu ihm und prüft seine Haltung genau. Die Spitze seines Stocks tippt sanft an den Ellenbogen des Mönchs, um die Position zu korrigieren und die Bewegung zu schärfen. Dann schneidet die Kamera auf eine Reihe hölzerner Übungspuppen an der Wand. Mehrere ältere Schüler trainieren an den Holzpuppen, ihre Arme fahren schnell und geschmeidig zwischen den Puppenarmen hindurch und führen rasche Blocks und Gegenangriffe aus. Im gesamten Übungshof sind nur das Klacken der Holzschläge, kraftvolle Kampfschreie und das Echo des Trainings zu hören, das über das Tempelgelände hallt.

Text zu Video (T2V) ist eine generative KI-Technik, die eine geschriebene Beschreibung — einen Prompt — in einen bewegten Videoclip verwandelt, komplett mit Bewegung, Licht und (bei modernen Modellen) synchronem Audio. Du beschreibst die Szene; das Modell filmt sie.

So funktioniert es

Unter der Haube sind die meisten Text-zu-Video-Modelle Diffusionsmodelle, trainiert auf riesigen Bibliotheken aus Videos mit passenden Beschreibungen. Bei der Generierung startet das Modell mit reinem Rauschen und „entrauscht“ es Schritt für Schritt zu Frames — bei jedem Schritt von deinem Prompt geführt. Weil das Modell alle Frames in einem gemeinsamen zeitlichen Kontext generiert, bleibt das Ergebnis kohärent: Objekte bleiben bestehen, Bewegung fließt, und die Kamera verhält sich wie eine Kamera statt wie eine Diashow.

Was es am besten kann

Text zu Video glänzt, wenn du mit nichts als einer Idee startest:

  • Konzept-Exploration — visualisiere eine Szene, bevor du dich auf einen Dreh oder ein Storyboard festlegst.

  • Short-Form-Content — Hooks, B-Roll, Produkt-Teaser und Social Clips im Hoch- oder Breitformat.

  • Unmögliche Shots — ein Drohnenflug durch ein Schlüsselloch, eine Stadt aus Glas, ein Fuchs im Raumanzug. Wenn du es beschreiben kannst, kann das Modell es versuchen.

Was ein guter Prompt enthält

Die stärksten T2V-Prompts lesen sich wie die Shot-Notiz eines Regisseurs, nicht wie ein Wunschzettel. Deck vier Dinge ab: das Subjekt (wer oder was), die Aktion (was über die Zeit passiert), die Kamera (Framing und Bewegung) und die Atmosphäre (Licht, Farbpalette, Stimmung). Einen ausführlichen Einstieg findest du in unserem Guide zum Thema KI-Video-Prompts schreiben.

Fragen zu Text-zu-Video (T2V)

Welche Modelle auf Molyin unterstützen Text-zu-Video?

Jedes live geschaltete Videomodell im Generator nimmt einen Text-Prompt an – aktuell 14. Wähl eines aus, und der Preis pro Sekunde aktualisiert sich vor der Generierung; neue Modelle kommen dazu, sobald sie erscheinen.

Was kostet ein Text-zu-Video-Clip?

Du zahlst pro Sekunde Ausgabe, der Satz hängt von Modell und Auflösung ab. Die Preise beginnen bei 3 Credits pro Sekunde; der Generator zeigt die genaue Summe, bevor du auf Generieren klickst, und fehlgeschlagene Generierungen werden automatisch erstattet.

Weiter in die Tiefe

Was ist Text-zu-Video (T2V)? | Molyin