Le texte vers vidéo (Text-to-Video, ou T2V) est une technique d’IA générative qui transforme une description écrite — un prompt — en clip vidéo animé, avec mouvement, lumière et, sur les modèles récents, audio synchronisé. Vous décrivez la scène ; le modèle la filme.
Comment ça fonctionne
Sous le capot, la plupart des modèles texte vers vidéo sont des modèles de diffusion entraînés sur d’immenses bibliothèques de vidéos associées à leurs légendes. Pendant la génération, le modèle part d’un bruit pur et le « débruite » progressivement en images, guidé à chaque étape par votre prompt. Comme toutes les images sont générées dans un même contexte temporel, le résultat reste cohérent : les objets persistent, le mouvement coule, et la caméra se comporte comme une caméra plutôt que comme un diaporama.
Ce qu’il réussit le mieux
Le texte vers vidéo brille quand vous partez d’une simple idée :
- Exploration de concept — visualisez une scène avant de vous engager sur un tournage ou un storyboard.
- Contenus courts — accroches, B-roll, teasers produit et clips sociaux en vertical ou en 16:9.
- Plans impossibles — un drone qui traverse une serrure, une ville de verre, un renard en combinaison spatiale. Si vous pouvez le décrire, le modèle peut le tenter.
Ce que contient un bon prompt
Les meilleurs prompts T2V se lisent comme la note de plan d’un réalisateur, pas comme un vœu. Couvrez quatre points : le sujet (qui ou quoi), l’action (ce qui se passe dans le temps), la caméra (cadrage et mouvement) et l’atmosphère (lumière, palette, ambiance). Pour aller plus loin, lisez notre guide comment écrire des prompts vidéo IA.