Bild zu Video (I2V) ist eine generative KI-Technik, die ein Standbild zum Leben erweckt. Du lieferst ein Bild — ein Produktfoto, ein Porträt, eine Illustration — und das Modell generiert ein Video, das exakt mit diesem Bild beginnt und es in Bewegung setzt, optional geführt von einem Text-Prompt.
So funktioniert es
Bei der Bild-zu-Video-Generierung dient dein Bild als erstes Frame — ein visueller Anker, den das Modell respektieren muss. Von dort sagt ein Video-Diffusionsmodell voraus, wie sich die Szene entwickeln soll: Haare wehen im Wind, Dampf steigt aus der Tasse, die Kamera fährt langsam heran. Der Text-Prompt muss nicht mehr beschreiben, wie die Dinge aussehen (das sagt das Bild bereits); er beschreibt, was als Nächstes passiert.
Warum mit einem Bild starten?
Verglichen mit Text zu Video gibt dir der Start von einem Bild etwas Kostbares: Kontrolle über den exakten Look. Komposition, Farben, Gesicht, Produktetikett — alles ab Frame eins fixiert. Das macht I2V zum Modus der Wahl, wenn:
-
du Brand-Assets hast — animiere ein Produktfoto, ohne dass das Modell dein Packaging neu erfindet.
-
das Subjekt exakt stimmen muss — eine reale Person, ein realer Ort, bestehende Artworks oder Illustrationen.
-
du Vorhersagbarkeit willst — das erste Frame steht fest, Iterationen variieren also nur die Bewegung.
Prompt-Tipps
Da das Bild das „Was“ übernimmt, investiere deinen Prompt ins „Wie“: Beschreib die Bewegung (subtil, dramatisch, loopend), die Kamera (statisch, langsamer Push-in, Orbit) und die Atmosphäre, die sich entwickeln soll. Kurze, bewegungsfokussierte Prompts schlagen hier meist lange Szenenbeschreibungen. Mehr Techniken in unserem Prompt-Guide.
Bild zu Video auf Molyin
Molyins Seedance-2.0-Generator unterstützt Bild zu Video mit Clips von 5 oder 10 Sekunden, bis zu 1080p Auflösung, sechs Seitenverhältnissen, optionalem Audio und Seed-Kontrolle — Bild hochladen, Bewegung beschreiben, generieren.
Verwandte Begriffe
-
Text zu Video — generiere Video allein aus einem geschriebenen Prompt.
-
Referenz zu Video — nutze Bilder als Identitätsreferenz statt als wörtliches erstes Frame.
Probier es jetzt mit dem KI-Video-Generator.