Texte vers vidéo (Text-to-Video)

Le texte vers vidéo (T2V) transforme un prompt écrit en clip vidéo animé. Découvrez comment il fonctionne, ce qu’il réussit le mieux et comment le prompter.

Ouvrir le générateur complet

Voyez-le à l’œuvre

Un prompt réel et le résultat qu’il a produit sur Molyin. Cliquez sur Remix pour partir de là.

  • Wan 3.0
  • Text to video
  • 15s
  • 720P

Dans la cour pavée de pierre derrière le temple Shaolin, un groupe de jeunes moines novices chauves du Shaolin se tient en formation parfaitement alignée. Sur l’ordre de l’instructeur, ils commencent tous à répéter ensemble des exercices de coups de pied : coups de pied hauts, coups de pied latéraux et coups de pied tournants, s’enchaînant continuellement avec une synchronisation et une précision totales. La caméra coupe sur un gros plan d’un jeune moine exécutant la posture du Coq d’or dressé sur une patte. Il tient en équilibre sur un pied, les mains jointes en geste de prière, restant parfaitement immobile et stable pendant plusieurs minutes. L’instructeur s’approche de lui, observant attentivement sa posture. Le bout de son bâton tapote doucement le coude du moine pour corriger la position et affiner le mouvement. La caméra coupe ensuite sur une rangée de mannequins d’entraînement en bois le long du mur. Plusieurs disciples seniors s’entraînent contre les mannequins de bois, leurs bras se déplaçant rapidement et fluidement entre les bras des mannequins, exécutant des blocages défensifs rapides et des contre-attaques. Toute la cour d’entraînement n’est remplie que des bruits d’impacts de bois, de cris puissants et d’échos de pratique martiale réverbérant à travers les terres du temple.

Le texte vers vidéo (Text-to-Video, ou T2V) est une technique d’IA générative qui transforme une description écrite — un prompt — en clip vidéo animé, avec mouvement, lumière et, sur les modèles récents, audio synchronisé. Vous décrivez la scène ; le modèle la filme.

Comment ça fonctionne

Sous le capot, la plupart des modèles texte vers vidéo sont des modèles de diffusion entraînés sur d’immenses bibliothèques de vidéos associées à leurs légendes. Pendant la génération, le modèle part d’un bruit pur et le « débruite » progressivement en images, guidé à chaque étape par votre prompt. Comme toutes les images sont générées dans un même contexte temporel, le résultat reste cohérent : les objets persistent, le mouvement coule, et la caméra se comporte comme une caméra plutôt que comme un diaporama.

Ce qu’il réussit le mieux

Le texte vers vidéo brille quand vous partez d’une simple idée :

  • Exploration de concept — visualisez une scène avant de vous engager sur un tournage ou un storyboard.
  • Contenus courts — accroches, B-roll, teasers produit et clips sociaux en vertical ou en 16:9.
  • Plans impossibles — un drone qui traverse une serrure, une ville de verre, un renard en combinaison spatiale. Si vous pouvez le décrire, le modèle peut le tenter.

Ce que contient un bon prompt

Les meilleurs prompts T2V se lisent comme la note de plan d’un réalisateur, pas comme un vœu. Couvrez quatre points : le sujet (qui ou quoi), l’action (ce qui se passe dans le temps), la caméra (cadrage et mouvement) et l’atmosphère (lumière, palette, ambiance). Pour aller plus loin, lisez notre guide comment écrire des prompts vidéo IA.

Questions sur Texte vers vidéo (Text-to-Video)

Quels modèles Molyin prennent en charge le texte vers vidéo ?

Tous les modèles vidéo en ligne dans le générateur acceptent un prompt texte — 14 en ce moment. Choisissez-en un et le prix par seconde se met à jour avant la génération ; les nouveaux modèles sont ajoutés dès leur sortie.

Combien coûte un clip texte vers vidéo ?

Vous payez à la seconde produite, et le tarif dépend du modèle et de la résolution. Les prix commencent à 6 crédits par seconde ; le générateur affiche le total exact avant que vous cliquiez sur Générer, et les générations échouées sont remboursées automatiquement.

Aller plus loin

Texte vers vidéo (Text-to-Video) | Molyin