IA Texte vers Vidéo
Écrivez ce que vous voulez voir et obtenez une vidéo aboutie — sans rushes, sans photos, sans montage. Seedance 2.5, Kling 3.0, MiniMax H3, HappyHorse, Wan, LTX, Veo et FLUX 3 transforment un prompt en clips cinématographiques avec audio natif, jusqu’à 30 secondes et jusqu’à la 4K.
- Générations échouées remboursées automatiquement
- Les packs de crédits n’expirent jamais
- Le prix de chaque modèle est public
- Annulez à tout moment en un clic
- 14
- Modèles texte vers vidéo
- 30 s
- Durée du clip jusqu’à
- 4K
- Sortie jusqu’à
- 6 cr/s
- Crédits dès
Un prompt en entrée, une vraie vidéo en sortie
Des clips texte vers vidéo aboutis, chacun assorti du prompt exact qui l’a produit — la formule sujet, action, scène, caméra et son. Copiez-le directement comme votre premier prompt, puis utilisez Remix pour repartir des mêmes réglages.
- Seedance 2.5
- Text to video
- 8s
- 720P
Style documentaire nature réaliste, lumière et ombre cinématiques et authentiques, un chaud après-midi sur une pente forestière herbeuse où un bébé panda rondouillard dégringole la colline. La fourrure noire et blanche du panda est duveteuse et réaliste, son corps petit et potelé, ses mouvements maladroits et adorables. La scène est une pente forestière verte, le sol couvert d’herbe, de mousse, de trèfle, de terre, de petites pierres, de brindilles mortes et de quelques petites fleurs jaunes, avec de hauts troncs d’arbres et un sous-bois doucement flous en arrière-plan. La caméra est en plan moyen-large en contre-plongée avec une légère sensation portée, globalement verrouillée, gardant le panda dans le cadre en permanence. 0 s-3 s : un bébé panda est allongé sur la pente herbeuse verte, le corps rond et potelé. Il vient de commencer à rouler lentement de côté le long de la pente, mouvements maladroits, brins d’herbe se pliant doucement sous son corps. Une brise légère passe ; la lumière du soleil tombe à travers les arbres depuis le haut à gauche, projetant une lumière et une ombre tachetées. 3 s-8 s : le panda roule vers le bas à droite du cadre et s’arrête progressivement, passant de couché sur le côté à reposé sur le ventre. Son visage rond se tourne vers la caméra, pattes avant appuyées dans l’herbe ; installé dans l’herbe du premier plan, il s’ajuste dans une position confortable, levant légèrement la tête et la baissant à nouveau avec un petit grognement doux. Position de caméra basse, légère sensation portée, suivant doucement le panda vers le bas à droite. Profondeur de champ naturelle : brins d’herbe du premier plan légèrement flous, panda net, sous-bois d’arrière-plan doucement hors focus. Son ambiant naturel — vent et le bruit sourd et doux du panda qui roule. Dans l’ensemble chaleureux, réel, naturel.
- Wan 3.0
- Text to video
- 30s
- 720P
Un spectacle visuel cinématographique de 30 secondes en 16:9 horizontal, en One-Take intense. Le style général est « West Coast street fantasy », un langage visuel qui fusionne le grain des vidéos de skate de rue des années 90 avec le poli d’un blockbuster publicitaire moderne. Étalonnez l’ensemble dans un « California sunshine » cinématographique extrême : un ciel bleu très saturé contre les ombres dures des palmiers en plein soleil, avec la chaleur de l’asphalte, le cliquetis métallique des roues de chariot de supermarché et une insouciance adolescente intrépide suspendue dans l’air. La perspective s’étire continuellement pendant que le protagoniste fonce vers l’avant ; la caméra construit son élan à travers des suivis en contre-plongée extrême et des traversées physiques à haute dynamique. Le protagoniste est un adolescent street-cool en chemise à rayures bicolores et casquette de baseball noire, dont l’expression passe de décontractée et nonchalante à une exaltation qui repousse les limites. Dans la deuxième scène, le protagoniste est le même adolescent, mais il apparaît dans la dimension réelle comme observateur. Shot 1, 0-6 s : Ouvrir sur un gros plan : l’adolescent est avachi dans un chariot de supermarché en acier rouge, adossé au boulevard rectiligne emblématique de Californie et à ses palmiers imposants. Quand la musique entre, la caméra recule à grande vitesse et descend au niveau du sol, collant à la roue dans une contre-plongée extrême. L’adolescent commence à dévaler la route en pente raide, le chariot cahotant violemment sur la surface, les voitures filant en arrière des deux côtés, la caméra captant un sentiment d’accélération presque téméraire. Shot 2, 7-15 s : Pas de coupe. La caméra reste collée au sol comme un skateur en poursuite ; à l’instant où l’adolescent franchit une rampe en bois improvisée, elle épouse l’élan dans une élévation parabolique gracieuse. Le chariot décolle et la caméra passe en dessous. Un immense panneau publicitaire commercial inonde maintenant tout le champ de vision, et la caméra pousse vers son centre avec une précision de réticule improbable. Shot 3, 16-24 s : Pas de coupe. L’adolescent et le chariot s’enfoncent tout droit dans l’immense panneau publicitaire comme s’ils brisaient le mur de la dimension. Au contact de l’affiche, le corps tridimensionnel s’aplatit dans une transformation matérielle, avec une vraie texture de déchirure de papier et de l’encre glitchée colorée apparaissant dans le cadre. L’adolescent conserve sa pose de glisse mais est devenu une œuvre plate sur le panneau. La caméra exécute ici une orbite horizontale de 180 degrés, puis plonge de la hauteur vers le sol. Shot 4, 25-30 s : Pas de coupe. La caméra atterrit en douceur sur la rue directement sous le panneau, où apparaît un autre adolescent « réel ». Il s’arrête, tire lentement la visière de sa casquette vers le bas et lève les yeux vers la version figée de lui-même sur le panneau avec un sourire faiblement amusé. La caméra suit son regard dans un zoom avant rapide, se fixant finalement sur le trou déchiré à côté du lettrage « WAN » sur le panneau. La musique fusionne un hip-hop très énergique avec le son physique de la pellicule qui défile dans une bobine. L’information visuelle est hautement condensée et pleine de rébellion stylée.
- HappyHorse 1.1
- Text to video
- 10s
- 1080P
Plan moyen d’un présentateur de journal professionnel à un bureau élégant dans un studio de télévision moderne, éclairage bleu froid, écrans doucement lumineux derrière lui. 0-5 s : il regarde la caméra et dit d’une voix claire et posée, "Good evening. Tonight, a breakthrough that could change how millions of us work." 5-10 s : il se tourne légèrement vers une seconde caméra, "We’ll have the full story, and what it means for you, right after this." Lip-sync précis, résonance subtile du studio, qualité broadcast nette, faible profondeur de champ.
- MiniMax H3
- Text to video
- 15s
- 2K
Générez une séquence d’ouverture de film policier à suspense léger de 15 secondes en 16:9 cinémascope. Le style général doit référencer le langage visuel de ces concepts : openings d’anime japonais rétro, silhouettes aux bords tranchants, collage façon comics, écrans partagés asymétriques, forts blocs de couleur géométriques, générique de titre en anglais, un minimum de katakana japonais décoratif et une ambiance jazz-crime. L’atmosphère doit être 60 % suspense et 40 % jazz : mystérieuse, cool, agile, avec un sentiment de crime urbain — ni effrayante ni lourde, et certainement pas un clip musical jazz joyeux. Les effets de mouvement de l’ouverture doivent ressembler à des collages graphiques animés : un cadre à lignes noires apparaît d’abord, les bordures d’écran partagé sont tracées rapidement, des blocs de couleur et des cadres sont collés pièce par pièce ; des silhouettes de personnages, des gros plans d’accessoires et des titres de générique anglais glissent, rebondissent ou se révèlent par masquage au rythme des coups de batterie. Évitez les animations narratives réalistes — cela doit avoir le fini poli d’une séquence d’ouverture. Les crédits anglais doivent être lisibles, avec des effets animés autorisés : de fins cadres en ligne peuvent d’abord être tracés, les noms glissent dans le cadre, les lettres apparaissant une à une et révélées par des blocs de couleur en mouvement, avant une brève pause à la fin. N’ajoutez pas de texte chinois, évitez le texte illisible et assurez-vous qu’aucun nom anglais n’est mal orthographié. Règles de la séquence : chaque crédit et titre anglais ne doit apparaître qu’une seule fois. Ne répétez pas le même titre, ne répétez pas le même nom et n’attribuez pas plusieurs rôles à la même personne. Les transitions doivent être variées : masques circulaires de disque vinyle, coupes verticales à travers des portes de voiture, ombres de personnages servant de volets, coupes à ligne rouge, masquage par grandes lettres anglaises, réorganisations de bordures d’écrans partagés, coupes dures en blocs de couleur géométriques et révélations de collages image par image. Toutes les transitions doivent être synchronisées avec les coups de batterie — précises, suspensives, agiles et avec une ambiance de collage façon comics. Évitez les fondus doux et les transitions fluides. BGM : créez un BGM original.
- FLUX 3
- Text to video
- 15s
- 720P
histoire en claymation d’un homme sans cesse écrasé par une main géante qui entre dans le décor, l’empêchant de vivre sa vie
Qu’est-ce que le texte vers vidéo par IA ?
Le texte vers vidéo par IA génère une vidéo à partir d’une seule description écrite. Vous tapez le sujet, l’action, le décor, le déplacement de caméra et le son ; le modèle invente chaque image à partir de ces mots — et, sur la plupart des modèles, la piste audio aussi. Rien n’est filmé, importé ni monté. L’entrée du glossaire sur le texte vers vidéo couvre le terme lui-même ; cette page sert à générer une vidéo.
Molyin réunit tous les grands modèles texte vers vidéo dans un seul studio, si bien qu’un prompt écrit une fois peut être rendu par le modèle qui convient le mieux au plan. Seedance 2.5 et Wan 3.0 étirent un seul prompt en séquences de 30 secondes ; Kling 3.0 tient un plan cinématographique jusqu’en 4K avec dialogue et synchronisation labiale ; HappyHorse livre des têtes parlantes au mouvement de bouche précis ; MiniMax H3 excelle en motion design stylisé et en typographie lisible à l’écran en 2K ; LTX 2.5 exécute des scènes scénarisées jusqu’à 20 secondes avec plusieurs personnages qui parlent ; Veo 3.1 et FLUX 3 complètent la gamme. Chacun génère le son dans la même passe que l’image.
Le texte vers vidéo est l’un des quatre modes du générateur vidéo IA : l’image vers vidéo, la référence vers vidéo et l’édition vidéo partagent la même zone de prompt et le même solde de crédits, donc pour un clip qui doit partir d’une image précise, vous changez de mode plutôt que d’outil. Chaque clip est facturé à la seconde, les générations échouées sont remboursées, et chaque forfait payant sur la page de tarifs inclut les droits d’usage commercial.
Quel modèle pour quel prompt
Tous les modèles texte vers vidéo de Molyin, avec ce qu’ils font de mieux à partir des mots seuls. Choisissez selon le type de plan que vous écrivez, puis selon la durée du clip et la résolution.
| Modèle | Point fort | Durée du clip | Sortie |
|---|---|---|---|
| Seedance 2.5 | Mouvement photoréaliste et récit multi-plans à partir d’un seul prompt, séquences jusqu’à 30 secondes | 4–30 s | 480P / 720P / 1080P, audio |
| Seedance 2.0 (Standard / Fast / Mini) | La même formule de prompt en trois niveaux — Standard atteint la 4K, Fast et Mini échangent la résolution contre la vitesse | 4–15 s | Jusqu’à la 4K sur Standard, 480P / 720P sur Fast et Mini, audio |
| Kling 3.0 | Longs plans cinématographiques avec dialogue parlé et synchronisation labiale ; le texte à l’écran reste lisible en mouvement | 3–15 s | 720P / 1080P / 4K, audio natif et synchronisation labiale |
| MiniMax H3 | Motion design stylisé, génériques et typographie lisible avec musique originale, le tout en une seule passe | 4–15 s | 768P / 2K, toujours avec audio |
| HappyHorse 1.1 | Dialogue de tête parlante avec synchronisation labiale précise ; neuf ratios dont 4:5, 5:4 et 9:21 | 3–15 s | 720P / 1080P, toujours avec audio |
| Wan 3.0 | Plans-séquences de 30 secondes dirigés depuis un script horodaté, audio en option | 2–30 s | 480P / 720P / 1080P, audio en option |
| Wan 2.7 | Clips du quotidien fiables, avec du son sur chaque rendu | 2–15 s | 720P / 1080P, toujours avec audio |
| LTX 2.5 (Fast / Pro) | Scènes scénarisées jusqu’à 20 secondes, avec déplacements de caméra, sound design et plusieurs personnages qui parlent ; Fast atteint la 4K | 6–20 s (Pro : 6–10 s) | Jusqu’à la 4K sur Fast, 720P / 1080P sur Pro, audio |
| Veo 3.1 (Standard / Fast) | Clips de 8 secondes soignés, avec un son cinématographique en 16:9 ou 9:16 | 8 s | 720P / 1080P / 4K, toujours avec audio |
| FLUX 3 | Résultats riches à partir de prompts très courts — monologues, séquences façon documentaire, animation en pâte à modeler — avec son natif | 5–20 s | 720P / 1080P, audio |
La durée du clip et la sortie indiquées concernent le texte vers vidéo. Ces mêmes modèles acceptent aussi une image ou une référence en entrée dans les autres modes du studio.
Comment générer une vidéo à partir d’un texte
Trois étapes d’une idée écrite à un MP4 terminé — la plupart des clips sont rendus en quelques minutes.
Écrivez le prompt
Décrivez un plan : le sujet, ce qu’il fait, où il se trouve, un déplacement de caméra, et le son ou la ligne de dialogue. Des noms concrets et une seule action l’emportent toujours sur les adjectifs. Copiez un prompt d’exemple dans la galerie ci-dessus si vous voulez un point de départ déjà éprouvé.
Choisissez le modèle et les réglages
Choisissez le modèle adapté au plan — longs plans, dialogue, typographie stylisée, ou nature photoréaliste — puis réglez la durée du clip, le format et la résolution. L’estimation de crédits se met à jour avant l’envoi.
Générez et téléchargez
Le modèle rend chaque image et la piste audio en quelques minutes. Prévisualisez le résultat, téléchargez le MP4 sans filigrane, ou utilisez Remix avec un prompt ajusté pour tenter une autre prise.
Texte vers vidéo ou image vers vidéo
Mêmes modèles, point de départ différent : l’un part uniquement de mots, l’autre d’une image que vous avez déjà.
| Texte vers vidéo | Image vers vidéo | |
|---|---|---|
| Point de départ | Une description écrite, uniquement — aucune image, aucun rush, aucun fichier requis | Une photo, un rendu ou une illustration qui devient la première image |
| Ce que vous contrôlez | Tout passe par les mots — sujet, scène, style, mouvement, son | La première image exacte ; le prompt dirige le mouvement et le son |
| Cohérence | Chaque génération réinterprète la description — idéal pour explorer, moins précis pour répéter le même plan | Sujet, cadrage et palette fixés sur votre photo dès la première image du clip |
| Idéal pour | Concepts, scènes qui n’existent pas encore, univers stylisés, dialogue et narration | Photos produit, portraits, visuels de marque, images de storyboard |
De nombreux créateurs font les deux : d’abord esquisser la scène avec le texte vers vidéo, générer une image fixe du plan exact souhaité, puis l’animer avec l’image vers vidéo.
Crédits texte vers vidéo, à la seconde
Chaque modèle facture à la seconde, à la résolution choisie, et les générations échouées sont remboursées automatiquement.
| Modèle | Résolution | Crédits/s | Vidéo de 5s | Vidéo de 5s + référence de 3s |
|---|---|---|---|---|
| 480p | 25 | 125 crédits | 170 crédits | |
| 720p | 56 | 280 crédits | 381 crédits | |
| 1080p | 139 | 695 crédits | 946 crédits | |
| 480p | 11 | 55 crédits | 75 crédits | |
| 720p | 28 | 140 crédits | 191 crédits | |
| 1080p | 65 | 325 crédits | 442 crédits | |
| 4k | 135 | 675 crédits | 918 crédits | |
| 480p | 9 | 45 crédits | 62 crédits | |
| 720p | 20 | 100 crédits | 136 crédits | |
| 480p | 6 | 30 crédits | 41 crédits | |
| 720p | 12 | 60 crédits | 82 crédits | |
| 768p | 18 | 90 crédits | 144 crédits | |
| 2k | 29 | 145 crédits | 232 crédits | |
| 720p | 18 | 90 crédits | Images de référence uniquement | |
| 1080p | 24 | 120 crédits | Images de référence uniquement | |
Wan 2.7 | 720p | 18 | 90 crédits | 144 crédits |
| 1080p | 30 | 150 crédits | 240 crédits | |
| 480p | 10 | 50 crédits | 80 crédits | |
| 720p | 18 | 90 crédits | 144 crédits | |
| 1080p | 36 | 180 crédits | 288 crédits | |
| 720p | 22 | 110 crédits | Images de référence uniquement | |
| 1080p | 29 | 145 crédits | Images de référence uniquement | |
| 4k | 71 | 355 crédits | Images de référence uniquement | |
| 720p | 20 | 100 crédits | — | |
| 1080p | 29 | 145 crédits | — | |
| 1440p | 43 | 215 crédits | — | |
| 4k | 67 | 335 crédits | — | |
| 720p | 27 | 135 crédits | — | |
| 1080p | 38 | 190 crédits | — | |
Veo 3.1 | 720p | 41 | 205 crédits | — |
| 1080p | 42 | 210 crédits | — | |
| 4k | 60 | 300 crédits | — | |
Veo 3.1 Fast | 720p | 10 | 50 crédits | Images de référence uniquement |
| 1080p | 11 | 55 crédits | Images de référence uniquement | |
| 4k | 30 | 150 crédits | Images de référence uniquement | |
| 720p | 38 | 190 crédits | Images de référence uniquement | |
| 1080p | 65 | 325 crédits | Images de référence uniquement |
- Les vidéos de référence téléversées sont facturées à 60 % — une génération de 5 s avec une vidéo de référence de 10 s facture 11 secondes, et non 15.
- Exception : les secondes de vidéo de référence de MiniMax H3 / Wan 2.7 / Wan 3.0 sont facturées au tarif plein par seconde.
- MiniMax H3 : les 5 premières images de référence sont gratuites, chaque image supplémentaire ajoute 9 crédits.
Les offres d’abonnement et les packs de crédits à l’achat unique sont comparés côte à côte sur la page de tarifs.
FAQ Texte vers vidéo par IA
Tout savoir sur la génération de vidéos à partir de texte sur Molyin.
Commencez à créer avec Molyin dès aujourd’hui
Inscrivez-vous gratuitement et transformez votre première idée en vidéo cinématique en quelques minutes.