Text zu Video KI

Schreib, was du sehen willst, und erhalte ein fertiges Video — kein Filmmaterial, keine Fotos, kein Schnitt. Seedance 2.5, Kling 3.0, MiniMax H3, HappyHorse, Wan, LTX, Veo und FLUX 3 verwandeln einen Prompt in filmische Clips mit nativem Audio, bis zu 30 Sekunden und 4K.

  • Fehlgeschlagene Generierungen werden automatisch erstattet
  • Credit-Pakete laufen nie ab
  • Der Preis jedes Modells ist öffentlich
  • Jederzeit mit einem Klick kündbar
14
Text-zu-Video-Modelle
30 s
Clip-Länge bis zu
4K
Ausgabe bis zu
6 Credits/s
Credits ab

Ein Prompt rein, ein echtes Video raus

Fertige Text-zu-Video-Clips, jeweils mit dem exakten Prompt, der sie erzeugt hat — nach der Formel Motiv, Aktion, Szene, Kamera, Ton. Übernimm einen davon direkt als deinen ersten Prompt. Mit Remix startest du mit denselben Einstellungen neu.

  • Seedance 2.5
  • Text to video
  • 8s
  • 720P

Realistischer Naturdoku-Stil, cineastisch lebensnahe Licht- und Schattensetzung, ein warmer Nachmittag an einem grasbewachsenen Waldhang, an dem ein rundes, pummeliges Pandajunges den Hügel hinunterpurzelt. Das schwarz-weiße Fell des Pandas ist flauschig und realistisch, sein Körper klein und mollig, seine Bewegungen ungeschickt und niedlich. Die Szene ist ein grüner Waldhang, der Boden bedeckt mit Gras, Moos, Klee, Erde, kleinen Steinen, toten Zweigen und ein paar kleinen gelben Blumen, mit hohen Baumstämmen und sanft unscharfem Wald im Hintergrund. Die Kamera ist eine Halbtotale aus tiefer Perspektive mit leichtem Handkamera-Gefühl, insgesamt im Wesentlichen fixiert, und hält den Panda jederzeit im Bild. 0s-3s: Ein Pandajunges liegt am grünen, grasbewachsenen Hang, sein Körper rund und mollig. Es hat gerade begonnen, langsam seitwärts den Hang hinunterzurollen, die Bewegungen ungeschickt, Grashalme biegen sich sanft unter seinem Körper. Eine leichte Brise zieht vorbei; Sonnenlicht fällt von oben links durch die Bäume und wirft gesprenkeltes Licht und Schatten. 3s-8s: Der Panda rollt nach unten rechts im Bild und kommt allmählich zum Stillstand, wechselt vom Liegen auf der Seite zum Ruhen auf dem Bauch. Sein rundes Gesicht dreht sich zur Kamera, die Vorderpfoten ins Gras gedrückt; im Vordergrundgras angekommen, richtet es sich in eine bequeme Position, hebt den Kopf leicht und senkt ihn wieder mit einem leisen, kleinen Grunzen. Tiefe Kameraposition, leichtes Handkamera-Gefühl, folgt dem Panda sanft nach unten rechts. Natürliche Schärfentiefe: Grashalme im Vordergrund leicht unscharf, der Panda selbst scharf, der Wald im Hintergrund sanft unscharf. Natürlicher Umgebungssound — Wind und das weiche, gedämpfte Poltern des rollenden Pandas. Insgesamt warm, echt, natürlich.

  • Wan 3.0
  • Text to video
  • 30s
  • 720P

Ein 30-sekündiges, horizontales 16:9-Spektakel im One-Take, filmisch und hochintensiv. Der Gesamtstil ist „West Coast Street Fantasy“, eine Bildsprache, die die Körnigkeit von Street-Skate-Videos der 90er mit dem Schliff eines modernen Werbeblockbusters verschmilzt. Grade das ganze Stück in extremer filmischer „California Sunshine“-Anmutung: ein hochgesättigt blauer Himmel gegen die harten Schatten von Palmen im direkten Sonnenlicht, dazu die Hitze des Asphalts, das metallische Rattern der Einkaufswagenräder und eine furchtlose jugendliche Aufsässigkeit, die in der Luft liegt. Die Perspektive dehnt sich fortlaufend, während der Protagonist nach vorn rast; die Kamera baut Wucht auf durch extreme Untersicht-Verfolgungen und hochdynamische physische Durchflüge. Der Protagonist ist ein street-cooler Teenager in einem Streifenshirt im Color-Blocking und mit schwarzem Baseballcap, dessen Ausdruck von lässig und träge in einen grenzsprengenden Rausch umschlägt. In der zweiten Szene ist der Protagonist derselbe Teenager, doch er tritt als Beobachter in der realen Dimension auf. Einstellung 1, 0-6s: Auftakt als Nahaufnahme: Der Teenager lümmelt in einem roten Einkaufswagen aus Stahl, im Rücken Kaliforniens typische schnurgerade Allee und turmhohe Palmen. Als die Musik einsetzt, zieht die Kamera in hohem Tempo zurück und sinkt auf Bodenhöhe, klebt in extremer Untersicht am Rad. Der Teenager stürzt die steile Straße hinunter, der Wagen bockt hart auf dem Belag, zu beiden Seiten fliegen Autos nach hinten weg, und die Kamera fängt eine fast rücksichtslose Beschleunigung ein. Einstellung 2, 7-15s: Kein Schnitt. Die Kamera bleibt wie ein verfolgender Skater am Boden kleben; in dem Moment, in dem der Teenager eine improvisierte Holzrampe überspringt, nimmt sie den Schwung mit und hebt in einer eleganten Parabel ab. Der Wagen fliegt, die Kamera passiert ihn von unten. Eine riesige Werbetafel flutet nun das gesamte Blickfeld, und die Kamera schiebt mit unwahrscheinlicher Fadenkreuz-Präzision auf ihre Mitte zu. Einstellung 3, 16-24s: Kein Schnitt. Der Teenager und der Wagen schlagen direkt in die riesige Werbetafel ein, als durchbrächen sie die Dimensionswand. Im Moment der Berührung mit dem Plakat flacht der dreidimensionale Körper in einer Materialverwandlung ab, echte Papierriss-Textur und farbige Glitch-Tinte erscheinen im Bild. Der Teenager hält seine Gleitpose, ist aber zu einem flachen Kunstwerk auf der Werbetafel geworden. Die Kamera vollführt hier eine 180-Grad-Horizontalumkreisung und stürzt dann aus der Höhe zurück auf den Boden. Einstellung 4, 25-30s: Kein Schnitt. Die Kamera landet sanft auf der Straße direkt unter der Werbetafel, wo ein weiterer „echter“ Teenager auftaucht. Er bleibt stehen, zieht langsam die Schirmmütze tiefer und blickt mit einem fein amüsierten Lächeln zu seiner eingefrorenen Version auf der Tafel hinauf. Die Kamera folgt seinem Blick in einen schnellen Zoom hinein und kommt schließlich an dem gerissenen Loch neben dem Schriftzug „WAN“ auf der Werbetafel zur Ruhe. Der Score verschmilzt energiegeladenen Hip-Hop mit dem physischen Geräusch von Film, der durch eine Spule läuft. Die Bildinformation ist hochverdichtet und voller stilsicherer Rebellion.

  • HappyHorse 1.1
  • Text to video
  • 10s
  • 1080P

Halbnahe Einstellung eines professionellen Nachrichtensprechers an einem eleganten Pult in einem modernen Sendestudio, kühles blaues Licht, sanft leuchtende Bildschirme im Hintergrund. 0–5 s: Er schaut in die Kamera und sagt mit klarer, ruhiger Stimme: "Good evening. Tonight: a breakthrough that could change the way millions of us work." 5–10 s: Er dreht sich leicht zu einer zweiten Kamera: "The full story — and what it means for you — right after this." Präzise Lippensynchronisation, dezenter Studio-Raumton, gestochen scharfe Broadcast-Qualität, geringe Tiefenschärfe.

  • MiniMax H3
  • Text to video
  • 15s
  • 2K

Erstelle eine 15-sekündige, leicht spannende Krimi-Introsequenz im 16:9-Breitbildformat. Der Gesamtstil sollte sich an der visuellen Sprache dieser Konzepte orientieren: Retro-Anime-Intros aus Japan, hartkantige Silhouetten, Collagen im Comic-Stil, asymmetrische Splitscreens, kräftige geometrische Farbblöcke, englische Titelsequenzen, minimale japanische Katakana als Dekoration und eine Jazz-Krimi-Atmosphäre. Die Stimmung soll zu 60 % Suspense und zu 40 % Jazz sein: mysteriös, cool, agil, mit urbanem Krimi-Flair — weder unheimlich noch schwer, und auf keinen Fall ein fröhliches Jazz-Musikvideo. Die Bewegungseffekte des Intros sollen sich wie animierte Grafik-Collagen anfühlen: Zuerst erscheint ein schwarz umrandeter Rahmen, Splitscreen-Ränder werden schnell gezeichnet, Farbblöcke und Rahmen werden Stück für Stück eingeklebt; Silhouetten von Figuren, Nahaufnahmen von Requisiten und englische Credits gleiten im Takt des Schlagzeugs hinein, springen heraus oder werden durch Maskierungen enthüllt. Vermeide realistische Erzählanimationen — das Ganze soll den polierten Look einer Introsequenz haben. Die englischen Credits sollen lesbar sein, animierte Effekte sind erlaubt: Dünne Linienrahmen können zuerst gezeichnet werden, Namen gleiten ins Bild, Buchstaben erscheinen einer nach dem anderen und werden von sich bewegenden Farbblöcken enthüllt, bevor am Ende eine kurze Pause eintritt. Keinen chinesischen Text hinzufügen, verstümmelten Text vermeiden und sicherstellen, dass keine englischen Namen falsch geschrieben werden. Regeln für die Sequenz: Jeder englische Credit und Titel darf nur einmal erscheinen. Wiederhole keinen Titel, wiederhole keinen Namen und weise derselben Person nicht mehrere Rollen zu. Übergänge müssen abwechslungsreich sein: kreisförmige Vinyl-Schallplatten-Masken, vertikale Schnitte durch Autotüren, Figurenschatten als Wischblenden, Rotlinien-Schnitte, Maskierungen mit großen englischen Buchstaben, Neuordnungen von Splitframe-Rändern, harte geometrische Farbblock-Schnitte und einzelne Collagen-Enthüllungen Bild für Bild. Alle Übergänge sollen im Takt des Schlagzeugs synchron sein — präzise, spannend, agil und mit Comic-Collagen-Vibe. Vermeide weiche Überblendungen und fließende Übergänge. BGM: Erstelle eine originale Hintergrundmusik.

  • FLUX 3
  • Text to video
  • 15s
  • 720P

Claymation-Geschichte über einen Mann, der immer wieder von einer riesigen Hand plattgemacht wird, die ins Bild kommt, sodass er sein Leben nicht normal leben kann

Was ist Text-zu-Video-KI?

Text-zu-Video-KI generiert ein Video allein aus einer schriftlichen Beschreibung. Du tippst Motiv, Aktion, Schauplatz, Kamerafahrt und Ton; das Modell erfindet daraus jedes Frame — und bei den meisten Modellen auch die Tonspur. Nichts wird gefilmt, hochgeladen oder geschnitten. Der Glossareintrag zu Text-zu-Video erklärt den Begriff selbst; auf dieser Seite erzeugst du dein Video.

Molyin vereint jedes führende Text-zu-Video-Modell in einem Studio, sodass ein einmal geschriebener Prompt von jedem Modell gerendert werden kann, das zur Einstellung passt. Seedance 2.5 und Wan 3.0 dehnen einen einzelnen Prompt zu 30-sekündigen Sequenzen; Kling 3.0 hält eine filmische Einstellung bei bis zu 4K mit Dialog und Lippensynchronisation; HappyHorse liefert Talking Heads mit präziser Mundbewegung; MiniMax H3 glänzt bei stilisiertem Motion Design und lesbarer Bildschirmtypografie in 2K; LTX 2.5 spielt Drehbuch-Szenen mit mehreren sprechenden Figuren bis zu 20 Sekunden ab; Veo 3.1 und FLUX 3 runden das Line-up ab. Jedes davon generiert Ton im selben Durchgang wie das Bild.

Text-zu-Video ist einer von vier Modi im KI-Videogenerator: Bild-zu-Video, Referenz-zu-Video und Video-Bearbeitung teilen sich Prompt-Feld und Credit-Guthaben, sodass du für einen Clip aus einem bestimmten Bild einfach den Modus wechselst statt das Tool. Jeder Clip wird pro Sekunde abgerechnet, fehlgeschlagene Generierungen werden erstattet, und jeder bezahlte Plan auf der Preisseite enthält kommerzielle Nutzungsrechte.

Welches Modell für welchen Prompt

Jedes Text-zu-Video-Modell auf Molyin, mit dem, was es allein aus Worten am besten kann. Wähle nach der Art der Einstellung, die du schreibst, dann nach Clip-Länge und Auflösung.

ModellAm besten fürClip-LängeAusgabe
Seedance 2.5Fotorealistische Bewegung und Multi-Shot-Storytelling aus einem Prompt, Sequenzen bis zu 30 Sekunden4–30 s480P / 720P / 1080P, Audio
Seedance 2.0 (Standard / Fast / Mini)Dieselbe Prompt-Formel in drei Stufen — Standard erreicht 4K, Fast und Mini tauschen Auflösung gegen Geschwindigkeit4–15 sBis zu 4K bei Standard, 480P / 720P bei Fast & Mini, Audio
Kling 3.0Lange filmische Takes mit gesprochenem Dialog und Lippensynchronisation; Bildschirmtext bleibt in der Bewegung lesbar3–15 s720P / 1080P / 4K, natives Audio & Lippensynchronisation
MiniMax H3Stilisiertes Motion Design, Titelsequenzen und lesbare Typografie mit Originalmusik, alles in einem Durchgang4–15 s768P / 2K, immer mit Audio
HappyHorse 1.1Talking-Head-Dialog mit präziser Lippensynchronisation; neun Seitenverhältnisse inklusive 4:5, 5:4 und 9:213–15 s720P / 1080P, immer mit Audio
Wan 3.030-sekündige One-Take-Aufnahmen, gesteuert über ein Skript mit Zeitstempeln, Audio optional2–30 s480P / 720P / 1080P, Audio optional
Wan 2.7Verlässliche Alltags-Clips mit Ton bei jedem Rendering2–15 s720P / 1080P, immer mit Audio
LTX 2.5 (Fast / Pro)Drehbuch-Szenen mit Kamerafahrten, Sounddesign und mehreren sprechenden Figuren bis zu 20 Sekunden; Fast erreicht 4K6–20 s (Pro: 6–10 s)Bis zu 4K bei Fast, 720P / 1080P bei Pro, Audio
Veo 3.1 (Standard / Fast)Ausgefeilte 8-Sekunden-Clips mit filmischem Ton in 16:9 oder 9:168 s720P / 1080P / 4K, immer mit Audio
FLUX 3Reichhaltige Ergebnisse aus sehr kurzen Prompts — Monologe, dokumentarische Sequenzen, Knetanimation — mit nativem Ton5–20 s720P / 1080P, Audio

Clip-Länge und Ausgabe gelten für Text-zu-Video. Dieselben Modelle akzeptieren in den anderen Modi des Studios auch ein Bild oder eine Referenz als Eingabe.

So generierst du ein Video aus Text

Drei Schritte von der schriftlichen Idee zur fertigen MP4-Datei — die meisten Clips rendern in wenigen Minuten.

Schreib den Prompt

Beschreibe eine Einstellung: das Motiv, was es tut, wo es sich befindet, eine Kamerafahrt und den Ton oder die Dialogzeile. Konkrete Substantive und ein einzelnes Geschehen schlagen jede Adjektivliste. Übernimm für einen erprobten Startpunkt einen Beispiel-Prompt aus der Galerie oben.

Wähle Modell und Einstellungen

Wähle das Modell, das zur Einstellung passt — lange Takes, Dialog, stilisierte Typografie oder fotorealistische Natur — und stelle dann Clip-Länge, Seitenverhältnis und Auflösung ein. Die Credit-Schätzung aktualisiert sich, bevor du absendest.

Generieren & herunterladen

Das Modell rendert in wenigen Minuten jedes Frame und die Tonspur. Sieh dir das Ergebnis in der Vorschau an, lade die wasserzeichenfreie MP4-Datei herunter oder nutze Remix mit angepasstem Prompt für eine weitere Version.

Text zu Video vs. Bild zu Video

Gleiche Modelle, anderer Startpunkt: das eine beginnt allein bei Worten, das andere bei einem Bild, das du schon hast.

Text zu VideoBild zu Video
StartpunktEine schriftliche Beschreibung — kein Bild, Filmmaterial oder Asset nötigEin Foto, Rendering oder eine Illustration, die zum ersten Frame wird
Was du steuerstAlles über Worte — Motiv, Szene, Stil, Bewegung, TonDas exakte erste Frame; der Prompt steuert Bewegung und Ton
KonsistenzJede Generierung interpretiert die Beschreibung neu — gut zum Erkunden, lockerer für wiederholte EinstellungenMotiv, Bildausschnitt und Farbpalette sind ab dem ersten Frame an dein Bild gebunden
Am besten fürKonzepte, noch nicht existierende Szenen, stilisierte Welten, Dialog und ErzählungProduktaufnahmen, Porträts, Markenmaterial, Storyboard-Frames

Viele Creator machen beides: die Szene mit Text-zu-Video entwerfen, ein Standbild des exakten gewünschten Frames generieren und es dann mit Bild-zu-Video animieren.

Text-zu-Video-Credits, pro Sekunde

Jedes Modell rechnet pro Sekunde in der gewählten Auflösung ab, und fehlgeschlagene Generierungen werden automatisch erstattet.

Credit-Tarife der KI-Videomodelle nach Auflösung — Credits pro Sekunde und Beispiele pro Clip
ModellAuflösungCredits/Sek.5s-Video5s-Video + 3s Referenz
480p25125 Credits170 Credits
720p56280 Credits381 Credits
1080p139695 Credits946 Credits
480p1155 Credits75 Credits
720p28140 Credits191 Credits
1080p65325 Credits442 Credits
4k135675 Credits918 Credits
480p945 Credits62 Credits
720p20100 Credits136 Credits
480p630 Credits41 Credits
720p1260 Credits82 Credits
768p1890 Credits144 Credits
2k29145 Credits232 Credits
720p1890 CreditsNur Referenzbilder
1080p24120 CreditsNur Referenzbilder
Wan 2.7
720p1890 Credits144 Credits
1080p30150 Credits240 Credits
480p1050 Credits80 Credits
720p1890 Credits144 Credits
1080p36180 Credits288 Credits
720p22110 CreditsNur Referenzbilder
1080p29145 CreditsNur Referenzbilder
4k71355 CreditsNur Referenzbilder
720p20100 Credits
1080p29145 Credits
1440p43215 Credits
4k67335 Credits
720p27135 Credits
1080p38190 Credits
Veo 3.1
720p41205 Credits
1080p42210 Credits
4k60300 Credits
Veo 3.1 Fast
720p1050 CreditsNur Referenzbilder
1080p1155 CreditsNur Referenzbilder
4k30150 CreditsNur Referenzbilder
720p38190 CreditsNur Referenzbilder
1080p65325 CreditsNur Referenzbilder
  • Hochgeladene Referenzvideos werden zu 60 % abgerechnet — eine 5-s-Generierung mit einem 10-s-Referenzvideo rechnet 11 Sekunden ab, nicht 15.
  • Ausnahme: Referenzvideo-Sekunden für MiniMax H3 / Wan 2.7 / Wan 3.0 werden zum vollen Sekundentarif abgerechnet.
  • MiniMax H3: Die ersten 5 Referenzbilder sind kostenlos, jedes weitere Bild kostet 9 Credits.

Abo-Pläne und einmalige Credit-Packs findest du im Vergleich auf der Preisseite.

Preise für jedes Modell auf der Credits-Seite ansehen

Text zu Video KI – FAQ

Alles rund um das Generieren von Videos aus Text auf Molyin.

Starte noch heute mit Molyin

Melde dich kostenlos an und verwandle deine erste Idee in Minuten in ein filmisches Video.