Text zu Video KI
Schreib, was du sehen willst, und erhalte ein fertiges Video — kein Filmmaterial, keine Fotos, kein Schnitt. Seedance 2.5, Kling 3.0, MiniMax H3, HappyHorse, Wan, LTX, Veo und FLUX 3 verwandeln einen Prompt in filmische Clips mit nativem Audio, bis zu 30 Sekunden und 4K.
- Fehlgeschlagene Generierungen werden automatisch erstattet
- Credit-Pakete laufen nie ab
- Der Preis jedes Modells ist öffentlich
- Jederzeit mit einem Klick kündbar
- 14
- Text-zu-Video-Modelle
- 30 s
- Clip-Länge bis zu
- 4K
- Ausgabe bis zu
- 6 Credits/s
- Credits ab
Ein Prompt rein, ein echtes Video raus
Fertige Text-zu-Video-Clips, jeweils mit dem exakten Prompt, der sie erzeugt hat — nach der Formel Motiv, Aktion, Szene, Kamera, Ton. Übernimm einen davon direkt als deinen ersten Prompt. Mit Remix startest du mit denselben Einstellungen neu.
- Seedance 2.5
- Text to video
- 8s
- 720P
Realistischer Naturdoku-Stil, cineastisch lebensnahe Licht- und Schattensetzung, ein warmer Nachmittag an einem grasbewachsenen Waldhang, an dem ein rundes, pummeliges Pandajunges den Hügel hinunterpurzelt. Das schwarz-weiße Fell des Pandas ist flauschig und realistisch, sein Körper klein und mollig, seine Bewegungen ungeschickt und niedlich. Die Szene ist ein grüner Waldhang, der Boden bedeckt mit Gras, Moos, Klee, Erde, kleinen Steinen, toten Zweigen und ein paar kleinen gelben Blumen, mit hohen Baumstämmen und sanft unscharfem Wald im Hintergrund. Die Kamera ist eine Halbtotale aus tiefer Perspektive mit leichtem Handkamera-Gefühl, insgesamt im Wesentlichen fixiert, und hält den Panda jederzeit im Bild. 0s-3s: Ein Pandajunges liegt am grünen, grasbewachsenen Hang, sein Körper rund und mollig. Es hat gerade begonnen, langsam seitwärts den Hang hinunterzurollen, die Bewegungen ungeschickt, Grashalme biegen sich sanft unter seinem Körper. Eine leichte Brise zieht vorbei; Sonnenlicht fällt von oben links durch die Bäume und wirft gesprenkeltes Licht und Schatten. 3s-8s: Der Panda rollt nach unten rechts im Bild und kommt allmählich zum Stillstand, wechselt vom Liegen auf der Seite zum Ruhen auf dem Bauch. Sein rundes Gesicht dreht sich zur Kamera, die Vorderpfoten ins Gras gedrückt; im Vordergrundgras angekommen, richtet es sich in eine bequeme Position, hebt den Kopf leicht und senkt ihn wieder mit einem leisen, kleinen Grunzen. Tiefe Kameraposition, leichtes Handkamera-Gefühl, folgt dem Panda sanft nach unten rechts. Natürliche Schärfentiefe: Grashalme im Vordergrund leicht unscharf, der Panda selbst scharf, der Wald im Hintergrund sanft unscharf. Natürlicher Umgebungssound — Wind und das weiche, gedämpfte Poltern des rollenden Pandas. Insgesamt warm, echt, natürlich.
- Wan 3.0
- Text to video
- 30s
- 720P
Ein 30-sekündiges, horizontales 16:9-Spektakel im One-Take, filmisch und hochintensiv. Der Gesamtstil ist „West Coast Street Fantasy“, eine Bildsprache, die die Körnigkeit von Street-Skate-Videos der 90er mit dem Schliff eines modernen Werbeblockbusters verschmilzt. Grade das ganze Stück in extremer filmischer „California Sunshine“-Anmutung: ein hochgesättigt blauer Himmel gegen die harten Schatten von Palmen im direkten Sonnenlicht, dazu die Hitze des Asphalts, das metallische Rattern der Einkaufswagenräder und eine furchtlose jugendliche Aufsässigkeit, die in der Luft liegt. Die Perspektive dehnt sich fortlaufend, während der Protagonist nach vorn rast; die Kamera baut Wucht auf durch extreme Untersicht-Verfolgungen und hochdynamische physische Durchflüge. Der Protagonist ist ein street-cooler Teenager in einem Streifenshirt im Color-Blocking und mit schwarzem Baseballcap, dessen Ausdruck von lässig und träge in einen grenzsprengenden Rausch umschlägt. In der zweiten Szene ist der Protagonist derselbe Teenager, doch er tritt als Beobachter in der realen Dimension auf. Einstellung 1, 0-6s: Auftakt als Nahaufnahme: Der Teenager lümmelt in einem roten Einkaufswagen aus Stahl, im Rücken Kaliforniens typische schnurgerade Allee und turmhohe Palmen. Als die Musik einsetzt, zieht die Kamera in hohem Tempo zurück und sinkt auf Bodenhöhe, klebt in extremer Untersicht am Rad. Der Teenager stürzt die steile Straße hinunter, der Wagen bockt hart auf dem Belag, zu beiden Seiten fliegen Autos nach hinten weg, und die Kamera fängt eine fast rücksichtslose Beschleunigung ein. Einstellung 2, 7-15s: Kein Schnitt. Die Kamera bleibt wie ein verfolgender Skater am Boden kleben; in dem Moment, in dem der Teenager eine improvisierte Holzrampe überspringt, nimmt sie den Schwung mit und hebt in einer eleganten Parabel ab. Der Wagen fliegt, die Kamera passiert ihn von unten. Eine riesige Werbetafel flutet nun das gesamte Blickfeld, und die Kamera schiebt mit unwahrscheinlicher Fadenkreuz-Präzision auf ihre Mitte zu. Einstellung 3, 16-24s: Kein Schnitt. Der Teenager und der Wagen schlagen direkt in die riesige Werbetafel ein, als durchbrächen sie die Dimensionswand. Im Moment der Berührung mit dem Plakat flacht der dreidimensionale Körper in einer Materialverwandlung ab, echte Papierriss-Textur und farbige Glitch-Tinte erscheinen im Bild. Der Teenager hält seine Gleitpose, ist aber zu einem flachen Kunstwerk auf der Werbetafel geworden. Die Kamera vollführt hier eine 180-Grad-Horizontalumkreisung und stürzt dann aus der Höhe zurück auf den Boden. Einstellung 4, 25-30s: Kein Schnitt. Die Kamera landet sanft auf der Straße direkt unter der Werbetafel, wo ein weiterer „echter“ Teenager auftaucht. Er bleibt stehen, zieht langsam die Schirmmütze tiefer und blickt mit einem fein amüsierten Lächeln zu seiner eingefrorenen Version auf der Tafel hinauf. Die Kamera folgt seinem Blick in einen schnellen Zoom hinein und kommt schließlich an dem gerissenen Loch neben dem Schriftzug „WAN“ auf der Werbetafel zur Ruhe. Der Score verschmilzt energiegeladenen Hip-Hop mit dem physischen Geräusch von Film, der durch eine Spule läuft. Die Bildinformation ist hochverdichtet und voller stilsicherer Rebellion.
- HappyHorse 1.1
- Text to video
- 10s
- 1080P
Halbnahe Einstellung eines professionellen Nachrichtensprechers an einem eleganten Pult in einem modernen Sendestudio, kühles blaues Licht, sanft leuchtende Bildschirme im Hintergrund. 0–5 s: Er schaut in die Kamera und sagt mit klarer, ruhiger Stimme: "Good evening. Tonight: a breakthrough that could change the way millions of us work." 5–10 s: Er dreht sich leicht zu einer zweiten Kamera: "The full story — and what it means for you — right after this." Präzise Lippensynchronisation, dezenter Studio-Raumton, gestochen scharfe Broadcast-Qualität, geringe Tiefenschärfe.
- MiniMax H3
- Text to video
- 15s
- 2K
Erstelle eine 15-sekündige, leicht spannende Krimi-Introsequenz im 16:9-Breitbildformat. Der Gesamtstil sollte sich an der visuellen Sprache dieser Konzepte orientieren: Retro-Anime-Intros aus Japan, hartkantige Silhouetten, Collagen im Comic-Stil, asymmetrische Splitscreens, kräftige geometrische Farbblöcke, englische Titelsequenzen, minimale japanische Katakana als Dekoration und eine Jazz-Krimi-Atmosphäre. Die Stimmung soll zu 60 % Suspense und zu 40 % Jazz sein: mysteriös, cool, agil, mit urbanem Krimi-Flair — weder unheimlich noch schwer, und auf keinen Fall ein fröhliches Jazz-Musikvideo. Die Bewegungseffekte des Intros sollen sich wie animierte Grafik-Collagen anfühlen: Zuerst erscheint ein schwarz umrandeter Rahmen, Splitscreen-Ränder werden schnell gezeichnet, Farbblöcke und Rahmen werden Stück für Stück eingeklebt; Silhouetten von Figuren, Nahaufnahmen von Requisiten und englische Credits gleiten im Takt des Schlagzeugs hinein, springen heraus oder werden durch Maskierungen enthüllt. Vermeide realistische Erzählanimationen — das Ganze soll den polierten Look einer Introsequenz haben. Die englischen Credits sollen lesbar sein, animierte Effekte sind erlaubt: Dünne Linienrahmen können zuerst gezeichnet werden, Namen gleiten ins Bild, Buchstaben erscheinen einer nach dem anderen und werden von sich bewegenden Farbblöcken enthüllt, bevor am Ende eine kurze Pause eintritt. Keinen chinesischen Text hinzufügen, verstümmelten Text vermeiden und sicherstellen, dass keine englischen Namen falsch geschrieben werden. Regeln für die Sequenz: Jeder englische Credit und Titel darf nur einmal erscheinen. Wiederhole keinen Titel, wiederhole keinen Namen und weise derselben Person nicht mehrere Rollen zu. Übergänge müssen abwechslungsreich sein: kreisförmige Vinyl-Schallplatten-Masken, vertikale Schnitte durch Autotüren, Figurenschatten als Wischblenden, Rotlinien-Schnitte, Maskierungen mit großen englischen Buchstaben, Neuordnungen von Splitframe-Rändern, harte geometrische Farbblock-Schnitte und einzelne Collagen-Enthüllungen Bild für Bild. Alle Übergänge sollen im Takt des Schlagzeugs synchron sein — präzise, spannend, agil und mit Comic-Collagen-Vibe. Vermeide weiche Überblendungen und fließende Übergänge. BGM: Erstelle eine originale Hintergrundmusik.
- FLUX 3
- Text to video
- 15s
- 720P
Claymation-Geschichte über einen Mann, der immer wieder von einer riesigen Hand plattgemacht wird, die ins Bild kommt, sodass er sein Leben nicht normal leben kann
Was ist Text-zu-Video-KI?
Text-zu-Video-KI generiert ein Video allein aus einer schriftlichen Beschreibung. Du tippst Motiv, Aktion, Schauplatz, Kamerafahrt und Ton; das Modell erfindet daraus jedes Frame — und bei den meisten Modellen auch die Tonspur. Nichts wird gefilmt, hochgeladen oder geschnitten. Der Glossareintrag zu Text-zu-Video erklärt den Begriff selbst; auf dieser Seite erzeugst du dein Video.
Molyin vereint jedes führende Text-zu-Video-Modell in einem Studio, sodass ein einmal geschriebener Prompt von jedem Modell gerendert werden kann, das zur Einstellung passt. Seedance 2.5 und Wan 3.0 dehnen einen einzelnen Prompt zu 30-sekündigen Sequenzen; Kling 3.0 hält eine filmische Einstellung bei bis zu 4K mit Dialog und Lippensynchronisation; HappyHorse liefert Talking Heads mit präziser Mundbewegung; MiniMax H3 glänzt bei stilisiertem Motion Design und lesbarer Bildschirmtypografie in 2K; LTX 2.5 spielt Drehbuch-Szenen mit mehreren sprechenden Figuren bis zu 20 Sekunden ab; Veo 3.1 und FLUX 3 runden das Line-up ab. Jedes davon generiert Ton im selben Durchgang wie das Bild.
Text-zu-Video ist einer von vier Modi im KI-Videogenerator: Bild-zu-Video, Referenz-zu-Video und Video-Bearbeitung teilen sich Prompt-Feld und Credit-Guthaben, sodass du für einen Clip aus einem bestimmten Bild einfach den Modus wechselst statt das Tool. Jeder Clip wird pro Sekunde abgerechnet, fehlgeschlagene Generierungen werden erstattet, und jeder bezahlte Plan auf der Preisseite enthält kommerzielle Nutzungsrechte.
Welches Modell für welchen Prompt
Jedes Text-zu-Video-Modell auf Molyin, mit dem, was es allein aus Worten am besten kann. Wähle nach der Art der Einstellung, die du schreibst, dann nach Clip-Länge und Auflösung.
| Modell | Am besten für | Clip-Länge | Ausgabe |
|---|---|---|---|
| Seedance 2.5 | Fotorealistische Bewegung und Multi-Shot-Storytelling aus einem Prompt, Sequenzen bis zu 30 Sekunden | 4–30 s | 480P / 720P / 1080P, Audio |
| Seedance 2.0 (Standard / Fast / Mini) | Dieselbe Prompt-Formel in drei Stufen — Standard erreicht 4K, Fast und Mini tauschen Auflösung gegen Geschwindigkeit | 4–15 s | Bis zu 4K bei Standard, 480P / 720P bei Fast & Mini, Audio |
| Kling 3.0 | Lange filmische Takes mit gesprochenem Dialog und Lippensynchronisation; Bildschirmtext bleibt in der Bewegung lesbar | 3–15 s | 720P / 1080P / 4K, natives Audio & Lippensynchronisation |
| MiniMax H3 | Stilisiertes Motion Design, Titelsequenzen und lesbare Typografie mit Originalmusik, alles in einem Durchgang | 4–15 s | 768P / 2K, immer mit Audio |
| HappyHorse 1.1 | Talking-Head-Dialog mit präziser Lippensynchronisation; neun Seitenverhältnisse inklusive 4:5, 5:4 und 9:21 | 3–15 s | 720P / 1080P, immer mit Audio |
| Wan 3.0 | 30-sekündige One-Take-Aufnahmen, gesteuert über ein Skript mit Zeitstempeln, Audio optional | 2–30 s | 480P / 720P / 1080P, Audio optional |
| Wan 2.7 | Verlässliche Alltags-Clips mit Ton bei jedem Rendering | 2–15 s | 720P / 1080P, immer mit Audio |
| LTX 2.5 (Fast / Pro) | Drehbuch-Szenen mit Kamerafahrten, Sounddesign und mehreren sprechenden Figuren bis zu 20 Sekunden; Fast erreicht 4K | 6–20 s (Pro: 6–10 s) | Bis zu 4K bei Fast, 720P / 1080P bei Pro, Audio |
| Veo 3.1 (Standard / Fast) | Ausgefeilte 8-Sekunden-Clips mit filmischem Ton in 16:9 oder 9:16 | 8 s | 720P / 1080P / 4K, immer mit Audio |
| FLUX 3 | Reichhaltige Ergebnisse aus sehr kurzen Prompts — Monologe, dokumentarische Sequenzen, Knetanimation — mit nativem Ton | 5–20 s | 720P / 1080P, Audio |
Clip-Länge und Ausgabe gelten für Text-zu-Video. Dieselben Modelle akzeptieren in den anderen Modi des Studios auch ein Bild oder eine Referenz als Eingabe.
So generierst du ein Video aus Text
Drei Schritte von der schriftlichen Idee zur fertigen MP4-Datei — die meisten Clips rendern in wenigen Minuten.
Schreib den Prompt
Beschreibe eine Einstellung: das Motiv, was es tut, wo es sich befindet, eine Kamerafahrt und den Ton oder die Dialogzeile. Konkrete Substantive und ein einzelnes Geschehen schlagen jede Adjektivliste. Übernimm für einen erprobten Startpunkt einen Beispiel-Prompt aus der Galerie oben.
Wähle Modell und Einstellungen
Wähle das Modell, das zur Einstellung passt — lange Takes, Dialog, stilisierte Typografie oder fotorealistische Natur — und stelle dann Clip-Länge, Seitenverhältnis und Auflösung ein. Die Credit-Schätzung aktualisiert sich, bevor du absendest.
Generieren & herunterladen
Das Modell rendert in wenigen Minuten jedes Frame und die Tonspur. Sieh dir das Ergebnis in der Vorschau an, lade die wasserzeichenfreie MP4-Datei herunter oder nutze Remix mit angepasstem Prompt für eine weitere Version.
Text zu Video vs. Bild zu Video
Gleiche Modelle, anderer Startpunkt: das eine beginnt allein bei Worten, das andere bei einem Bild, das du schon hast.
| Text zu Video | Bild zu Video | |
|---|---|---|
| Startpunkt | Eine schriftliche Beschreibung — kein Bild, Filmmaterial oder Asset nötig | Ein Foto, Rendering oder eine Illustration, die zum ersten Frame wird |
| Was du steuerst | Alles über Worte — Motiv, Szene, Stil, Bewegung, Ton | Das exakte erste Frame; der Prompt steuert Bewegung und Ton |
| Konsistenz | Jede Generierung interpretiert die Beschreibung neu — gut zum Erkunden, lockerer für wiederholte Einstellungen | Motiv, Bildausschnitt und Farbpalette sind ab dem ersten Frame an dein Bild gebunden |
| Am besten für | Konzepte, noch nicht existierende Szenen, stilisierte Welten, Dialog und Erzählung | Produktaufnahmen, Porträts, Markenmaterial, Storyboard-Frames |
Viele Creator machen beides: die Szene mit Text-zu-Video entwerfen, ein Standbild des exakten gewünschten Frames generieren und es dann mit Bild-zu-Video animieren.
Text-zu-Video-Credits, pro Sekunde
Jedes Modell rechnet pro Sekunde in der gewählten Auflösung ab, und fehlgeschlagene Generierungen werden automatisch erstattet.
| Modell | Auflösung | Credits/Sek. | 5s-Video | 5s-Video + 3s Referenz |
|---|---|---|---|---|
| 480p | 25 | 125 Credits | 170 Credits | |
| 720p | 56 | 280 Credits | 381 Credits | |
| 1080p | 139 | 695 Credits | 946 Credits | |
| 480p | 11 | 55 Credits | 75 Credits | |
| 720p | 28 | 140 Credits | 191 Credits | |
| 1080p | 65 | 325 Credits | 442 Credits | |
| 4k | 135 | 675 Credits | 918 Credits | |
| 480p | 9 | 45 Credits | 62 Credits | |
| 720p | 20 | 100 Credits | 136 Credits | |
| 480p | 6 | 30 Credits | 41 Credits | |
| 720p | 12 | 60 Credits | 82 Credits | |
| 768p | 18 | 90 Credits | 144 Credits | |
| 2k | 29 | 145 Credits | 232 Credits | |
| 720p | 18 | 90 Credits | Nur Referenzbilder | |
| 1080p | 24 | 120 Credits | Nur Referenzbilder | |
Wan 2.7 | 720p | 18 | 90 Credits | 144 Credits |
| 1080p | 30 | 150 Credits | 240 Credits | |
| 480p | 10 | 50 Credits | 80 Credits | |
| 720p | 18 | 90 Credits | 144 Credits | |
| 1080p | 36 | 180 Credits | 288 Credits | |
| 720p | 22 | 110 Credits | Nur Referenzbilder | |
| 1080p | 29 | 145 Credits | Nur Referenzbilder | |
| 4k | 71 | 355 Credits | Nur Referenzbilder | |
| 720p | 20 | 100 Credits | — | |
| 1080p | 29 | 145 Credits | — | |
| 1440p | 43 | 215 Credits | — | |
| 4k | 67 | 335 Credits | — | |
| 720p | 27 | 135 Credits | — | |
| 1080p | 38 | 190 Credits | — | |
Veo 3.1 | 720p | 41 | 205 Credits | — |
| 1080p | 42 | 210 Credits | — | |
| 4k | 60 | 300 Credits | — | |
Veo 3.1 Fast | 720p | 10 | 50 Credits | Nur Referenzbilder |
| 1080p | 11 | 55 Credits | Nur Referenzbilder | |
| 4k | 30 | 150 Credits | Nur Referenzbilder | |
| 720p | 38 | 190 Credits | Nur Referenzbilder | |
| 1080p | 65 | 325 Credits | Nur Referenzbilder |
- Hochgeladene Referenzvideos werden zu 60 % abgerechnet — eine 5-s-Generierung mit einem 10-s-Referenzvideo rechnet 11 Sekunden ab, nicht 15.
- Ausnahme: Referenzvideo-Sekunden für MiniMax H3 / Wan 2.7 / Wan 3.0 werden zum vollen Sekundentarif abgerechnet.
- MiniMax H3: Die ersten 5 Referenzbilder sind kostenlos, jedes weitere Bild kostet 9 Credits.
Abo-Pläne und einmalige Credit-Packs findest du im Vergleich auf der Preisseite.
Text zu Video KI – FAQ
Alles rund um das Generieren von Videos aus Text auf Molyin.
Starte noch heute mit Molyin
Melde dich kostenlos an und verwandle deine erste Idee in Minuten in ein filmisches Video.