IA Texte vers Vidéo

Écrivez ce que vous voulez voir et obtenez une vidéo aboutie — sans rushes, sans photos, sans montage. Seedance 2.5, Kling 3.0, MiniMax H3, HappyHorse, Wan, LTX, Veo et FLUX 3 transforment un prompt en clips cinématographiques avec audio natif, jusqu’à 30 secondes et jusqu’à la 4K.

  • Générations échouées remboursées automatiquement
  • Les packs de crédits n’expirent jamais
  • Le prix de chaque modèle est public
  • Annulez à tout moment en un clic
14
Modèles texte vers vidéo
30 s
Durée du clip jusqu’à
4K
Sortie jusqu’à
6 cr/s
Crédits dès

Un prompt en entrée, une vraie vidéo en sortie

Des clips texte vers vidéo aboutis, chacun assorti du prompt exact qui l’a produit — la formule sujet, action, scène, caméra et son. Copiez-le directement comme votre premier prompt, puis utilisez Remix pour repartir des mêmes réglages.

  • Seedance 2.5
  • Text to video
  • 8s
  • 720P

Style documentaire nature réaliste, lumière et ombre cinématiques et authentiques, un chaud après-midi sur une pente forestière herbeuse où un bébé panda rondouillard dégringole la colline. La fourrure noire et blanche du panda est duveteuse et réaliste, son corps petit et potelé, ses mouvements maladroits et adorables. La scène est une pente forestière verte, le sol couvert d’herbe, de mousse, de trèfle, de terre, de petites pierres, de brindilles mortes et de quelques petites fleurs jaunes, avec de hauts troncs d’arbres et un sous-bois doucement flous en arrière-plan. La caméra est en plan moyen-large en contre-plongée avec une légère sensation portée, globalement verrouillée, gardant le panda dans le cadre en permanence. 0 s-3 s : un bébé panda est allongé sur la pente herbeuse verte, le corps rond et potelé. Il vient de commencer à rouler lentement de côté le long de la pente, mouvements maladroits, brins d’herbe se pliant doucement sous son corps. Une brise légère passe ; la lumière du soleil tombe à travers les arbres depuis le haut à gauche, projetant une lumière et une ombre tachetées. 3 s-8 s : le panda roule vers le bas à droite du cadre et s’arrête progressivement, passant de couché sur le côté à reposé sur le ventre. Son visage rond se tourne vers la caméra, pattes avant appuyées dans l’herbe ; installé dans l’herbe du premier plan, il s’ajuste dans une position confortable, levant légèrement la tête et la baissant à nouveau avec un petit grognement doux. Position de caméra basse, légère sensation portée, suivant doucement le panda vers le bas à droite. Profondeur de champ naturelle : brins d’herbe du premier plan légèrement flous, panda net, sous-bois d’arrière-plan doucement hors focus. Son ambiant naturel — vent et le bruit sourd et doux du panda qui roule. Dans l’ensemble chaleureux, réel, naturel.

  • Wan 3.0
  • Text to video
  • 30s
  • 720P

Un spectacle visuel cinématographique de 30 secondes en 16:9 horizontal, en One-Take intense. Le style général est « West Coast street fantasy », un langage visuel qui fusionne le grain des vidéos de skate de rue des années 90 avec le poli d’un blockbuster publicitaire moderne. Étalonnez l’ensemble dans un « California sunshine » cinématographique extrême : un ciel bleu très saturé contre les ombres dures des palmiers en plein soleil, avec la chaleur de l’asphalte, le cliquetis métallique des roues de chariot de supermarché et une insouciance adolescente intrépide suspendue dans l’air. La perspective s’étire continuellement pendant que le protagoniste fonce vers l’avant ; la caméra construit son élan à travers des suivis en contre-plongée extrême et des traversées physiques à haute dynamique. Le protagoniste est un adolescent street-cool en chemise à rayures bicolores et casquette de baseball noire, dont l’expression passe de décontractée et nonchalante à une exaltation qui repousse les limites. Dans la deuxième scène, le protagoniste est le même adolescent, mais il apparaît dans la dimension réelle comme observateur. Shot 1, 0-6 s : Ouvrir sur un gros plan : l’adolescent est avachi dans un chariot de supermarché en acier rouge, adossé au boulevard rectiligne emblématique de Californie et à ses palmiers imposants. Quand la musique entre, la caméra recule à grande vitesse et descend au niveau du sol, collant à la roue dans une contre-plongée extrême. L’adolescent commence à dévaler la route en pente raide, le chariot cahotant violemment sur la surface, les voitures filant en arrière des deux côtés, la caméra captant un sentiment d’accélération presque téméraire. Shot 2, 7-15 s : Pas de coupe. La caméra reste collée au sol comme un skateur en poursuite ; à l’instant où l’adolescent franchit une rampe en bois improvisée, elle épouse l’élan dans une élévation parabolique gracieuse. Le chariot décolle et la caméra passe en dessous. Un immense panneau publicitaire commercial inonde maintenant tout le champ de vision, et la caméra pousse vers son centre avec une précision de réticule improbable. Shot 3, 16-24 s : Pas de coupe. L’adolescent et le chariot s’enfoncent tout droit dans l’immense panneau publicitaire comme s’ils brisaient le mur de la dimension. Au contact de l’affiche, le corps tridimensionnel s’aplatit dans une transformation matérielle, avec une vraie texture de déchirure de papier et de l’encre glitchée colorée apparaissant dans le cadre. L’adolescent conserve sa pose de glisse mais est devenu une œuvre plate sur le panneau. La caméra exécute ici une orbite horizontale de 180 degrés, puis plonge de la hauteur vers le sol. Shot 4, 25-30 s : Pas de coupe. La caméra atterrit en douceur sur la rue directement sous le panneau, où apparaît un autre adolescent « réel ». Il s’arrête, tire lentement la visière de sa casquette vers le bas et lève les yeux vers la version figée de lui-même sur le panneau avec un sourire faiblement amusé. La caméra suit son regard dans un zoom avant rapide, se fixant finalement sur le trou déchiré à côté du lettrage « WAN » sur le panneau. La musique fusionne un hip-hop très énergique avec le son physique de la pellicule qui défile dans une bobine. L’information visuelle est hautement condensée et pleine de rébellion stylée.

  • HappyHorse 1.1
  • Text to video
  • 10s
  • 1080P

Plan moyen d’un présentateur de journal professionnel à un bureau élégant dans un studio de télévision moderne, éclairage bleu froid, écrans doucement lumineux derrière lui. 0-5 s : il regarde la caméra et dit d’une voix claire et posée, "Good evening. Tonight, a breakthrough that could change how millions of us work." 5-10 s : il se tourne légèrement vers une seconde caméra, "We’ll have the full story, and what it means for you, right after this." Lip-sync précis, résonance subtile du studio, qualité broadcast nette, faible profondeur de champ.

  • MiniMax H3
  • Text to video
  • 15s
  • 2K

Générez une séquence d’ouverture de film policier à suspense léger de 15 secondes en 16:9 cinémascope. Le style général doit référencer le langage visuel de ces concepts : openings d’anime japonais rétro, silhouettes aux bords tranchants, collage façon comics, écrans partagés asymétriques, forts blocs de couleur géométriques, générique de titre en anglais, un minimum de katakana japonais décoratif et une ambiance jazz-crime. L’atmosphère doit être 60 % suspense et 40 % jazz : mystérieuse, cool, agile, avec un sentiment de crime urbain — ni effrayante ni lourde, et certainement pas un clip musical jazz joyeux. Les effets de mouvement de l’ouverture doivent ressembler à des collages graphiques animés : un cadre à lignes noires apparaît d’abord, les bordures d’écran partagé sont tracées rapidement, des blocs de couleur et des cadres sont collés pièce par pièce ; des silhouettes de personnages, des gros plans d’accessoires et des titres de générique anglais glissent, rebondissent ou se révèlent par masquage au rythme des coups de batterie. Évitez les animations narratives réalistes — cela doit avoir le fini poli d’une séquence d’ouverture. Les crédits anglais doivent être lisibles, avec des effets animés autorisés : de fins cadres en ligne peuvent d’abord être tracés, les noms glissent dans le cadre, les lettres apparaissant une à une et révélées par des blocs de couleur en mouvement, avant une brève pause à la fin. N’ajoutez pas de texte chinois, évitez le texte illisible et assurez-vous qu’aucun nom anglais n’est mal orthographié. Règles de la séquence : chaque crédit et titre anglais ne doit apparaître qu’une seule fois. Ne répétez pas le même titre, ne répétez pas le même nom et n’attribuez pas plusieurs rôles à la même personne. Les transitions doivent être variées : masques circulaires de disque vinyle, coupes verticales à travers des portes de voiture, ombres de personnages servant de volets, coupes à ligne rouge, masquage par grandes lettres anglaises, réorganisations de bordures d’écrans partagés, coupes dures en blocs de couleur géométriques et révélations de collages image par image. Toutes les transitions doivent être synchronisées avec les coups de batterie — précises, suspensives, agiles et avec une ambiance de collage façon comics. Évitez les fondus doux et les transitions fluides. BGM : créez un BGM original.

  • FLUX 3
  • Text to video
  • 15s
  • 720P

histoire en claymation d’un homme sans cesse écrasé par une main géante qui entre dans le décor, l’empêchant de vivre sa vie

Qu’est-ce que le texte vers vidéo par IA ?

Le texte vers vidéo par IA génère une vidéo à partir d’une seule description écrite. Vous tapez le sujet, l’action, le décor, le déplacement de caméra et le son ; le modèle invente chaque image à partir de ces mots — et, sur la plupart des modèles, la piste audio aussi. Rien n’est filmé, importé ni monté. L’entrée du glossaire sur le texte vers vidéo couvre le terme lui-même ; cette page sert à générer une vidéo.

Molyin réunit tous les grands modèles texte vers vidéo dans un seul studio, si bien qu’un prompt écrit une fois peut être rendu par le modèle qui convient le mieux au plan. Seedance 2.5 et Wan 3.0 étirent un seul prompt en séquences de 30 secondes ; Kling 3.0 tient un plan cinématographique jusqu’en 4K avec dialogue et synchronisation labiale ; HappyHorse livre des têtes parlantes au mouvement de bouche précis ; MiniMax H3 excelle en motion design stylisé et en typographie lisible à l’écran en 2K ; LTX 2.5 exécute des scènes scénarisées jusqu’à 20 secondes avec plusieurs personnages qui parlent ; Veo 3.1 et FLUX 3 complètent la gamme. Chacun génère le son dans la même passe que l’image.

Le texte vers vidéo est l’un des quatre modes du générateur vidéo IA : l’image vers vidéo, la référence vers vidéo et l’édition vidéo partagent la même zone de prompt et le même solde de crédits, donc pour un clip qui doit partir d’une image précise, vous changez de mode plutôt que d’outil. Chaque clip est facturé à la seconde, les générations échouées sont remboursées, et chaque forfait payant sur la page de tarifs inclut les droits d’usage commercial.

Quel modèle pour quel prompt

Tous les modèles texte vers vidéo de Molyin, avec ce qu’ils font de mieux à partir des mots seuls. Choisissez selon le type de plan que vous écrivez, puis selon la durée du clip et la résolution.

ModèlePoint fortDurée du clipSortie
Seedance 2.5Mouvement photoréaliste et récit multi-plans à partir d’un seul prompt, séquences jusqu’à 30 secondes4–30 s480P / 720P / 1080P, audio
Seedance 2.0 (Standard / Fast / Mini)La même formule de prompt en trois niveaux — Standard atteint la 4K, Fast et Mini échangent la résolution contre la vitesse4–15 sJusqu’à la 4K sur Standard, 480P / 720P sur Fast et Mini, audio
Kling 3.0Longs plans cinématographiques avec dialogue parlé et synchronisation labiale ; le texte à l’écran reste lisible en mouvement3–15 s720P / 1080P / 4K, audio natif et synchronisation labiale
MiniMax H3Motion design stylisé, génériques et typographie lisible avec musique originale, le tout en une seule passe4–15 s768P / 2K, toujours avec audio
HappyHorse 1.1Dialogue de tête parlante avec synchronisation labiale précise ; neuf ratios dont 4:5, 5:4 et 9:213–15 s720P / 1080P, toujours avec audio
Wan 3.0Plans-séquences de 30 secondes dirigés depuis un script horodaté, audio en option2–30 s480P / 720P / 1080P, audio en option
Wan 2.7Clips du quotidien fiables, avec du son sur chaque rendu2–15 s720P / 1080P, toujours avec audio
LTX 2.5 (Fast / Pro)Scènes scénarisées jusqu’à 20 secondes, avec déplacements de caméra, sound design et plusieurs personnages qui parlent ; Fast atteint la 4K6–20 s (Pro : 6–10 s)Jusqu’à la 4K sur Fast, 720P / 1080P sur Pro, audio
Veo 3.1 (Standard / Fast)Clips de 8 secondes soignés, avec un son cinématographique en 16:9 ou 9:168 s720P / 1080P / 4K, toujours avec audio
FLUX 3Résultats riches à partir de prompts très courts — monologues, séquences façon documentaire, animation en pâte à modeler — avec son natif5–20 s720P / 1080P, audio

La durée du clip et la sortie indiquées concernent le texte vers vidéo. Ces mêmes modèles acceptent aussi une image ou une référence en entrée dans les autres modes du studio.

Comment générer une vidéo à partir d’un texte

Trois étapes d’une idée écrite à un MP4 terminé — la plupart des clips sont rendus en quelques minutes.

Écrivez le prompt

Décrivez un plan : le sujet, ce qu’il fait, où il se trouve, un déplacement de caméra, et le son ou la ligne de dialogue. Des noms concrets et une seule action l’emportent toujours sur les adjectifs. Copiez un prompt d’exemple dans la galerie ci-dessus si vous voulez un point de départ déjà éprouvé.

Choisissez le modèle et les réglages

Choisissez le modèle adapté au plan — longs plans, dialogue, typographie stylisée, ou nature photoréaliste — puis réglez la durée du clip, le format et la résolution. L’estimation de crédits se met à jour avant l’envoi.

Générez et téléchargez

Le modèle rend chaque image et la piste audio en quelques minutes. Prévisualisez le résultat, téléchargez le MP4 sans filigrane, ou utilisez Remix avec un prompt ajusté pour tenter une autre prise.

Texte vers vidéo ou image vers vidéo

Mêmes modèles, point de départ différent : l’un part uniquement de mots, l’autre d’une image que vous avez déjà.

Texte vers vidéoImage vers vidéo
Point de départUne description écrite, uniquement — aucune image, aucun rush, aucun fichier requisUne photo, un rendu ou une illustration qui devient la première image
Ce que vous contrôlezTout passe par les mots — sujet, scène, style, mouvement, sonLa première image exacte ; le prompt dirige le mouvement et le son
CohérenceChaque génération réinterprète la description — idéal pour explorer, moins précis pour répéter le même planSujet, cadrage et palette fixés sur votre photo dès la première image du clip
Idéal pourConcepts, scènes qui n’existent pas encore, univers stylisés, dialogue et narrationPhotos produit, portraits, visuels de marque, images de storyboard

De nombreux créateurs font les deux : d’abord esquisser la scène avec le texte vers vidéo, générer une image fixe du plan exact souhaité, puis l’animer avec l’image vers vidéo.

Crédits texte vers vidéo, à la seconde

Chaque modèle facture à la seconde, à la résolution choisie, et les générations échouées sont remboursées automatiquement.

Tarifs en crédits des modèles de vidéo IA par résolution — crédits par seconde et exemples par clip
ModèleRésolutionCrédits/sVidéo de 5sVidéo de 5s + référence de 3s
480p25125 crédits170 crédits
720p56280 crédits381 crédits
1080p139695 crédits946 crédits
480p1155 crédits75 crédits
720p28140 crédits191 crédits
1080p65325 crédits442 crédits
4k135675 crédits918 crédits
480p945 crédits62 crédits
720p20100 crédits136 crédits
480p630 crédits41 crédits
720p1260 crédits82 crédits
768p1890 crédits144 crédits
2k29145 crédits232 crédits
720p1890 créditsImages de référence uniquement
1080p24120 créditsImages de référence uniquement
Wan 2.7
720p1890 crédits144 crédits
1080p30150 crédits240 crédits
480p1050 crédits80 crédits
720p1890 crédits144 crédits
1080p36180 crédits288 crédits
720p22110 créditsImages de référence uniquement
1080p29145 créditsImages de référence uniquement
4k71355 créditsImages de référence uniquement
720p20100 crédits
1080p29145 crédits
1440p43215 crédits
4k67335 crédits
720p27135 crédits
1080p38190 crédits
Veo 3.1
720p41205 crédits
1080p42210 crédits
4k60300 crédits
Veo 3.1 Fast
720p1050 créditsImages de référence uniquement
1080p1155 créditsImages de référence uniquement
4k30150 créditsImages de référence uniquement
720p38190 créditsImages de référence uniquement
1080p65325 créditsImages de référence uniquement
  • Les vidéos de référence téléversées sont facturées à 60 % — une génération de 5 s avec une vidéo de référence de 10 s facture 11 secondes, et non 15.
  • Exception : les secondes de vidéo de référence de MiniMax H3 / Wan 2.7 / Wan 3.0 sont facturées au tarif plein par seconde.
  • MiniMax H3 : les 5 premières images de référence sont gratuites, chaque image supplémentaire ajoute 9 crédits.

Les offres d’abonnement et les packs de crédits à l’achat unique sont comparés côte à côte sur la page de tarifs.

Voir les tarifs de tous les modèles sur la page des crédits

FAQ Texte vers vidéo par IA

Tout savoir sur la génération de vidéos à partir de texte sur Molyin.

Commencez à créer avec Molyin dès aujourd’hui

Inscrivez-vous gratuitement et transformez votre première idée en vidéo cinématique en quelques minutes.