Lippensynchronisation (Lip Sync) bezeichnet die präzise Übereinstimmung der Mundbewegungen einer Figur mit gesprochenem Audio. In der KI-Videogenerierung gibt es zwei Wege: native Sprachgenerierung, bei der das Modell Stimme und passende Lippenbewegung gemeinsam aus dem Dialog erzeugt, den du in den Prompt schreibst, und audiogesteuerte Animation, bei der du eine Sprachaufnahme hochlädst und das Modell ein Gesicht dazu sprechen lässt.
So funktioniert es
Sprache besteht aus Phonemen, und jedes Phonem entspricht einer sichtbaren Mundform, einem sogenannten Visem. Moderne Videomodelle lernen diese Zuordnung direkt aus riesigen Mengen an Sprechvideos — sie klappen den Mund also nicht bloß im Takt, sondern formen Lippen, Kiefer und Gesichtsmuskeln passend zu jeder Silbe, samt natürlichem Blinzeln und Kopfbewegungen. Modelle mit nativem Audio erzeugen Tonspur und Frames in einem einzigen Durchgang, wodurch das Timing perfekt ausgerichtet bleibt.
Was es am besten kann
- Talking-Head-Inhalte — Sprecher-Clips, Ads im UGC-Stil und Produkterklärungen ohne Kamerateam.
- Dialogszenen — Figuren, die geschriebene Zeilen mit passender Mimik vortragen.
- Mehrsprachige Umsetzung — dieselbe Figur spricht verschiedene Sprachen, jeweils mit korrekten Mundformen.
- Standbilder zum Leben erwecken — ein Porträtfoto, das dein Skript spricht.
Was eine gute Eingabe enthält
Schreibe Dialog in Anführungszeichen in den Prompt und halte die Zeilen kurz — ein bis zwei Sätze pro Einstellung wirken am natürlichsten. Benenne den Ton („warm, im Gesprächston“) und verwende für audiogesteuerte Generierung eine saubere Sprachaufnahme ohne Hintergrundmusik.
Lip Sync auf Molyin
Kling 3.0 lässt Figuren deine geschriebenen Zeilen mit synchronen Lippenbewegungen sprechen — in mehreren Sprachen, regionale Dialekte inklusive. MiniMax H3 erzeugt zu seinem Material nativen Stereo-Ton, und der Bild-zu-Video-Modus von Wan 2.7 akzeptiert eine steuernde Tonspur: Lade eine Sprachaufnahme hoch, und dein Porträt beginnt zu sprechen.
Verwandte Begriffe
- Text-zu-Video — die ganze Szene samt Dialog aus einem Prompt erzeugen.
- Bild-zu-Video — der Ausgangspunkt, um ein Foto sprechen zu lassen.
Probiere es selbst mit dem KI-Video-Generator.