La synchronisation labiale (Lip Sync) est la correspondance précise entre les mouvements de bouche d’un personnage et une voix parlée. En génération vidéo IA, elle existe sous deux formes : la génération vocale native, où le modèle crée la voix et le mouvement des lèvres ensemble à partir du dialogue écrit dans le prompt, et l’animation pilotée par l’audio, où vous téléversez un enregistrement vocal et le modèle anime un visage pour le prononcer.
Comment ça marche
La parole est faite de phonèmes, et chaque phonème correspond à une forme de bouche visible appelée visème. Les modèles vidéo modernes apprennent cette correspondance directement dans d’énormes volumes de vidéos parlées : ils ne font pas claquer la bouche au rythme, ils modèlent les lèvres, la mâchoire et les muscles du visage sur chaque syllabe, avec des clignements et des mouvements de tête naturels. Les modèles à audio natif génèrent la piste vocale et les images en une seule passe, ce qui garde un timing parfaitement aligné.
Ce qu’elle fait de mieux
- Contenus face caméra — clips de porte-parole, publicités façon UGC et explications produit sans équipe de tournage.
- Scènes de dialogue — des personnages qui livrent vos répliques écrites avec les expressions assorties.
- Diffusion multilingue — le même personnage parle plusieurs langues, chacune avec les bonnes formes de bouche.
- Donner vie aux photos — un portrait qui prononce votre texte.
Ce qu’une bonne entrée contient
Écrivez le dialogue entre guillemets dans le prompt et gardez des répliques courtes : une ou deux phrases par plan sonnent le plus naturel. Nommez le ton (« chaleureux, conversationnel ») et, pour l’animation pilotée par l’audio, utilisez un enregistrement vocal propre, sans musique de fond.