Bild zu Video (I2V) ist eine generative KI-Technik, die ein Standbild zum Leben erweckt. Du lieferst ein Bild — ein Produktfoto, ein Porträt, eine Illustration — und das Modell generiert ein Video, das exakt mit diesem Bild beginnt und es in Bewegung setzt, optional geführt von einem Text-Prompt.
So funktioniert es
Bei der Bild-zu-Video-Generierung dient dein Bild als erstes Frame — ein visueller Anker, den das Modell respektieren muss. Von dort sagt ein Video-Diffusionsmodell voraus, wie sich die Szene entwickeln soll: Haare wehen im Wind, Dampf steigt aus der Tasse, die Kamera fährt langsam heran. Der Text-Prompt muss nicht mehr beschreiben, wie die Dinge aussehen (das sagt das Bild bereits); er beschreibt, was als Nächstes passiert.
Warum mit einem Bild starten?
Verglichen mit Text zu Video gibt dir der Start von einem Bild etwas Kostbares: Kontrolle über den exakten Look. Komposition, Farben, Gesicht, Produktetikett — alles ab Frame eins fixiert. Das macht I2V zum Modus der Wahl, wenn:
-
du Brand-Assets hast — animiere ein Produktfoto, ohne dass das Modell dein Packaging neu erfindet.
-
das Subjekt exakt stimmen muss — eine reale Person, ein realer Ort, bestehende Artworks oder Illustrationen.
-
du Vorhersagbarkeit willst — das erste Frame steht fest, Iterationen variieren also nur die Bewegung.
Prompt-Tipps
Da das Bild das „Was“ übernimmt, investiere deinen Prompt ins „Wie“: Beschreib die Bewegung (subtil, dramatisch, loopend), die Kamera (statisch, langsamer Push-in, Orbit) und die Atmosphäre, die sich entwickeln soll. Kurze, bewegungsfokussierte Prompts schlagen hier meist lange Szenenbeschreibungen. Mehr Techniken in unserem Prompt-Guide.