Bild-zu-Video (I2V)

Bild zu Video (I2V) ist eine KI-Technik, die ein Standbild als erstes Frame zu einem Videoclip animiert. Erfahre, wie es funktioniert und wann du es einsetzt.

Vollständigen Generator öffnen

So sieht es in Aktion aus

Ein echter Prompt und das Ergebnis, das er auf Molyin erzeugt hat. Mit Remix startest du genau hier.

  • Kling 3.0
  • Image to video
  • 15s
  • 1080P

Eröffnung mit einer horizontal fahrenden Ultraweitwinkel-Halbtotalen, der Stabilisator bewegt sich dicht über dem Boden, mit einem stark kontrastierenden romantischen Kino-Look aus kalter blauer Nacht und silbrig-weißem Sternenhimmel, der einen starken poetischen Realismus und ein klassisch-episches Temperament ausstrahlt. Die Protagonistin ist eine junge Frau in einem dunkelgrünen langen Kleid, die mit aller Kraft über den vom Mondlicht erhellten Gartenrasen rennt; ihr Rock bläht sich im Wind zu wogenden dynamischen Kurven, sie umklammert eine kleine weiße Blume in der rechten Hand und hebt mit der linken den Saum ihres Kleides, atmet schnell und blickt dennoch entschlossen. In der 4. Sekunde beschleunigt die Kamera mit ihr nach vorn, und mehrere Männer und Frauen in Ballkleidern alter Zeiten brechen im Hintergrund nacheinander von links und rechts ins Bild und rennen neben ihr her — manche versuchen sich zu nähern, manche drehen sich rufend um, doch keiner berührt sie wirklich, was Verfolgung und Flucht andeutet. In der 8. Sekunde zoomt die Kamera allmählich auf eine Halbnahe heran, schwenkt, um vor der Protagonistin vorwärts zu verfolgen, und hebt sich leicht; sie wirft einen kurzen Blick zurück auf einen jungen männlichen Charakter hinter ihr, ihre Blicke treffen sich für einen Sekundenbruchteil, die Emotionen brechen mitten im Lauf hervor, und die Frau und der Mann fassen sich an den Händen, um gemeinsam zu rennen. In der 12. Sekunde erreichen Musik und Bewegung ihren Höhepunkt; die Kamera bewegt sich dicht an ihrem Seitenprofil und wehenden Haar vorwärts, sie lässt die weiße Blume los und wirft sie in die Luft, die Blume schwebt in Zeitlupe herab, während die Menge dahinter an ihr vorbeistreift. In den letzten 3 Sekunden fährt die Kamera weiter vorwärts, die Frau und der Mann durchbrechen die Menge und stürmen auf den Sternenhimmel am Ende des Gartens zu, ihre Gestalten nehmen allmählich die Bildmitte ein. Die Gesamtatmosphäre ist feurig, romantisch und entschlossen, ein erzählerischer Ausbruch über Schicksal, Entscheidung und Freiheit.

Bild zu Video (I2V) ist eine generative KI-Technik, die ein Standbild zum Leben erweckt. Du lieferst ein Bild — ein Produktfoto, ein Porträt, eine Illustration — und das Modell generiert ein Video, das exakt mit diesem Bild beginnt und es in Bewegung setzt, optional geführt von einem Text-Prompt.

So funktioniert es

Bei der Bild-zu-Video-Generierung dient dein Bild als erstes Frame — ein visueller Anker, den das Modell respektieren muss. Von dort sagt ein Video-Diffusionsmodell voraus, wie sich die Szene entwickeln soll: Haare wehen im Wind, Dampf steigt aus der Tasse, die Kamera fährt langsam heran. Der Text-Prompt muss nicht mehr beschreiben, wie die Dinge aussehen (das sagt das Bild bereits); er beschreibt, was als Nächstes passiert.

Warum mit einem Bild starten?

Verglichen mit Text zu Video gibt dir der Start von einem Bild etwas Kostbares: Kontrolle über den exakten Look. Komposition, Farben, Gesicht, Produktetikett — alles ab Frame eins fixiert. Das macht I2V zum Modus der Wahl, wenn:

  • du Brand-Assets hast — animiere ein Produktfoto, ohne dass das Modell dein Packaging neu erfindet.

  • das Subjekt exakt stimmen muss — eine reale Person, ein realer Ort, bestehende Artworks oder Illustrationen.

  • du Vorhersagbarkeit willst — das erste Frame steht fest, Iterationen variieren also nur die Bewegung.

Prompt-Tipps

Da das Bild das „Was“ übernimmt, investiere deinen Prompt ins „Wie“: Beschreib die Bewegung (subtil, dramatisch, loopend), die Kamera (statisch, langsamer Push-in, Orbit) und die Atmosphäre, die sich entwickeln soll. Kurze, bewegungsfokussierte Prompts schlagen hier meist lange Szenenbeschreibungen. Mehr Techniken in unserem Prompt-Guide.

Fragen zu Bild-zu-Video (I2V)

Welches Bild sollte ich für Bild-zu-Video hochladen?

Nimm die schärfste Version, die du hast, im Seitenverhältnis, das das Video haben soll. Die meisten Modelle übernehmen das erste Bild exakt wie hochgeladen – alles, was unscharf oder beschnitten ist, bleibt es in jedem Frame.

Kann ich steuern, was nach dem ersten Bild passiert?

Ja. Der Prompt beschreibt Bewegung, Kamerafahrt und Ton; manche Modelle nehmen zusätzlich ein letztes Bild oder eine steuernde Tonspur an. Lass die Beschreibung des Motivs weg – das Bild sagt es schon – und investiere die Worte in die Bewegung.

Weiter in die Tiefe

Was ist Bild-zu-Video (I2V)? | Molyin