01 Formule de base
Wan 2.7 comprend les instructions structurées : qui, ce qu’il fait, comment la caméra bouge, où, et dans quelle tonalité. Ce chapitre découpe un bon prompt en cinq briques réutilisables, puis présente deux outils pratiques — les cinq ratios et la seed. Posez d’abord le squelette ; chaque chapitre suivant n’en est qu’une extension.
1.1 La formule de base du prompt
Tout commence par une phrase : le sujet et le mouvement sont les deux éléments obligatoires ; la caméra, l’environnement et l’esthétique s’ajoutent à la demande. Tournez d’abord le plan dans votre tête, puis écrivez-le avec la formule. La durée est un curseur continu de 2 à 15 secondes — prévoyez exactement ce que les secondes peuvent contenir. Un bonus : Wan 2.7 enrichit automatiquement les prompts courts par une réécriture intelligente, mais un prompt original bien structuré vaut toujours mieux que ses suppositions.
[Sujet] + [Mouvement] + optionnel [Caméra] [Environnement] [Esthétique]
Sujet
Le protagoniste — une personne, un animal ou un produit. Plus la description est précise, mieux c’est.
Mouvement
Ce que fait le sujet, membres et rythme explicités. Les petits mouvements lents et cohérents sont les plus fiables.
Caméra
Taille du plan et mouvement : gros plan, zoom avant, panoramique. Pour les récits multi-plans, écrivez directement le storyboard, p. ex. « Shot 1 [0-3s] wide shot ».
Environnement
Décor et ambiance : lieu, moment, lumière, météo.
Esthétique
Direction artistique et qualité : dominante de couleur, texture, netteté.
La cavalière sous la pluie néon
Prompt
Dans une rue de Tokyo sous la pluie, la nuit, une cavalière en blouson de cuir noir chevauche une grosse moto ; elle retire son casque et secoue ses cheveux trempés de pluie, les enseignes néon projetant des reflets roses et bleus sur l’asphalte mouillé. La caméra effectue un lent push-in depuis un low angle jusqu’à un close-up mi-corps, la bruine nettement visible à contre-jour. Rendu cinématographique, étalonnage cyberpunk, détails riches.
Deux phrases pour le sujet et le mouvement, une pour la caméra, une pour l’environnement, et des mots de style pour finir — voilà un prompt de base Wan 2.7 solide. Suggestion : 1080p, 16:9.
1.2 Choisir parmi cinq ratios
Wan 2.7 propose cinq ratios d’image : 16:9, 9:16, 1:1, 4:3 et 3:4. Une seule règle — raisonnez à rebours depuis la plateforme de publication : 16:9 pour les vidéos paysage, 9:16 pour les fils mobiles, 1:1 pour les fils carrés, 4:3 ou 3:4 pour les portraits et les natures mortes. Définissez le ratio avant de générer ; recadrer ensuite ne fait que jeter de la qualité. À noter : l’image vers vidéo n’a pas de sélecteur de ratio — la sortie suit votre première image.
Le trench-coat au coin de la rue
Prompt
Dans une vieille rue baignée de soleil d’après-midi, un mannequin en trench beige tourne le coin à un rythme tranquille, l’ourlet de son manteau ondulant à chaque pas, puis s’arrête devant une vitrine avec un sourire de côté. La caméra effectue un tracking en medium shot puis un lent push-in. Texture pellicule vintage chaude, détails de rue riches.
Prérempli en 9:16 vertical — le format standard des fils mobiles, une composition en pied qui remplit le cadre.
1.3 Reproduire et itérer avec la seed
La seed est le curseur d’aléatoire de Wan 2.7 : fixez-la, et le même prompt régénère des résultats très proches — modifiez un mot pour voir exactement ce que ce mot fait ; changez la seed, et le même prompt donne une fournée inédite. Deux habitudes à prendre : notez la seed quand un résultat vous plaît, et verrouillez la seed pour tester A/B vos descriptions. La génération est probabiliste — la même seed ne garantit pas un rendu identique au pixel près, mais la stabilité de la composition et du sujet dépasse largement le tirage au sort.
La grue en papier sur le rebord
Prompt
Une grue en origami est posée sur un rebord de fenêtre réchauffé par le soleil, une brise s’infiltre par la fente de la fenêtre, ses ailes tremblent doucement avant que le vent ne la soulève du rebord et la fasse tourbillonner à travers la pièce vers la bibliothèque. La caméra suit lentement, la lumière et l’ombre mouchetant le plancher de bois, de fines poussières flottant dans l’air.
Prérempli avec la seed 42 — changez les mots, gardez la seed, et comparez chaque itération ajustée.
1.4 Référence musicale : laisser l’image suivre la musique
Le champ audio du texte vers vidéo signifie « musique de fond » — téléversez un morceau et le modèle le traite comme une bande-son, laissant le rythme, les mouvements et les plans de caméra épouser l’émotion de la musique. Dans le prompt, il suffit de le nommer : « utiliser Audio 1 comme musique de fond », puis d’ajouter une ligne sur la façon dont l’image doit répondre à la musique (mise en rythme, montée émotionnelle, adéquation de l’ambiance). C’est différent de « chaque vidéo a du son » : le champ musical est votre direction délibérée — sans lui, le modèle compose quand même sa propre musique.
La virée au crépuscule sur la route côtière
Prompt
Un cabriolet vintage roule sur une route côtière au crépuscule, la jeune fille sur le siège passager fredonnant doucement dans le vent, ses cheveux au vent, les palmiers défilant au bord de la route, la mer reflétant le coucher de soleil comme de l’or éparpillé. La caméra effectue un tracking le long de la voiture puis un lent orbit vers l’avant, tons dorés chauds, texture pellicule. Utiliser Audio 1 comme musique de fond — le rythme et les mouvements de caméra suivent l’émotion de la musique, et l’orbit accélère au refrain.
Téléversez 1 morceau de musique dans le champ audio (le champ audio t2v désigne la musique de fond) ; prérempli avec 10 secondes — assez d’espace pour la montée émotionnelle et la mise en rythme.
02 Image vers vidéo
Une image de première image plus une description de mouvement, et Wan 2.7 donne vie à la photo — le centre de gravité du prompt passe de la description de la scène à la description du mouvement, car la scène existe déjà. Une règle ferme d’abord : le ratio de sortie de l’image vers vidéo suit automatiquement votre première image — il n’y a pas de sélecteur de ratio. Vous voulez un résultat 9:16 ? Téléversez une image en 9:16.
2.1 Donner vie aux photos
Un prompt d’image vers vidéo ne couvre que trois choses : ce qui bouge, comment ça bouge, et si la caméra bouge. N’imposez pas ce qui n’est pas dans l’image ; « réveillez » ce qui s’y trouve — un tissu qui flotte, une eau qui coule, une lampe qui vacille : de petits mouvements à fort taux de réussite. Ajoutez « conserver la texture d’origine » et le style ne dérive pas.
Le crépuscule au port de pêche
Prompt
Donner vie à cette photo : le soleil couchant teinte le port de pêche d’or rouge, des reflets scintillants ondulent lentement à la surface de l’eau, les bateaux amarrés se balancent doucement sur les petites vagues, les drapeaux des mâts claquent dans la brise marine, et quelques mouettes frôlent la jetée au loin. La caméra reste fixe, en conservant toute la durée la texture pellicule chaude du crépuscule de la photo d’origine.
Téléversez 1 image de première image ; décrivez uniquement le mouvement sans reformuler la scène, et laissez « conserver la texture d’origine » tenir le style. Le ratio de sortie suit la première image.
2.2 Première et dernière image : maîtriser le début et la fin
Wan 2.7 fait partie des quatre familles de modèles de Molyin prenant en charge la première et la dernière image (avec la famille Seedance, Kling 3.0 et Veo 3.1) — téléversez une première et une dernière image, et le modèle génère tout ce qui se trouve entre les deux. Cela change la façon d’écrire le prompt : sautez le début et la fin (ils sont dans les images) et décrivez seulement « comment passer de A à B » — le rythme du changement et la façon dont la caméra l’accompagne. Gardez les deux images au même ratio ; plus l’écart visuel est grand, plus vous devez décrire le processus.
La goutte d’encre qui devient montagnes
Prompt
Une goutte d’encre épaisse tombe dans une eau claire, s’étale et s’étire lentement, des filaments d’encre s’enroulent et coulent dans l’eau, formant peu à peu un paysage d’encre lavée aux montagnes superposées, des nuages dérivant dans les espaces vides. La caméra pousse lentement vers le cœur de la masse d’encre, fluide d’un bout à l’autre, avec une texture de papier de riz et une qualité d’encre lavée du début à la fin.
Activez l’interrupteur « Ajouter une dernière image » dans le mode image vers vidéo et téléversez les deux images (goutte d’encre → paysage) ; le prompt ne décrit que la transformation, et 8 secondes laissent le temps à l’éclosion de respirer.
2.3 Audio pilote : faire parler la photo
Le champ audio de l’image vers vidéo signifie « audio pilote » — téléversez un enregistrement vocal et la personne sur la photo parle en même temps, lèvres, expressions et mouvements de tête pilotés par le rythme de la parole. Les plans de tête parlante, les pitchs produit et les monologues de personnages reposent tous dessus. Dans le prompt, une ligne suffit : « mouvements des lèvres strictement synchronisés avec la parole d’Audio 1 », puis décrivez la caméra et l’ambiance comme d’habitude.
L’animateur de podcast au micro
Prompt
Donner vie à cette photo : l’animateur de podcast parle naturellement au micro avec une expression vive, de légers hochements de tête et des gestes des mains, les mouvements des lèvres strictement synchronisés avec la parole d’Audio 1, les inflexions émotionnelles de la voix entraînant les expressions du visage. La lampe de bureau chaude sur l’étagère derrière lui brille en silence ; la caméra tient un medium shot fixe, en conservant la texture de photographie documentaire de la photo d’origine.
Téléversez 1 photo de portrait + 1 enregistrement vocal (le champ audio i2v désigne l’audio pilote) ; une voix claire et sans bruit offre le meilleur taux de réussite du lip-sync.
2.4 Suite vidéo : continuer le tournage, sans refaire
L’image vers vidéo accepte aussi une vidéo de 2 à 10 secondes comme « base de continuation » (first_clip) — le modèle reprend là où la vidéo s’arrête et continue le tournage, en reportant naturellement mouvement, style et lumière. Le prompt ne décrit que le nouveau segment ; pas besoin de récapituler ce qui précède. Trois limites à retenir : la base de continuation est exclusive avec une image de première image (choisissez-en une) ; elle peut être couplée à une dernière image pour verrouiller la fin ; mais elle ne peut pas être combinée avec l’audio pilote. Le curseur de durée définit la longueur totale après continuation, et la facturation suit le total.
Continuation : [description du nouveau contenu] + optionnel [exigence de continuité]
Nouveau contenu
Décrivez uniquement ce qui se passe après la fin de la vidéo de base : nouvelle action, nouvelle scène, nouveau travail de caméra.
Continuité
Une ligne — « action fluide, style et lumière reportés de la vidéo d’origine » — évite les sauts à la jonction.
Le deuxième saut du skateur
Prompt
Continuer la vidéo téléversée : après l’atterrissage, le skateur roule en avant avec fluidité, la caméra continue de le suivre en low angle pendant qu’il accélère vers l’escalier devant lui, saute, fait tourner sa planche, atterrit avec assurance sur le sol plat en contrebas, salue la caméra et sort du cadre. L’action s’enchaîne sans couture, style et lumière reportés de la vidéo d’origine.
Téléversez 1 clip de 2 à 10 secondes comme base de continuation (exclusive avec l’image de première image ; ne peut pas être couplée à l’audio pilote) ; prérempli avec 10 s au total — le curseur définit la longueur complète après continuation.
03 Référence vers vidéo
Les apparences et les gestes signature que les mots ne captent pas — personnages, produits, attitudes — confiez-les à des médias de référence. La référence vers vidéo de Wan 2.7 accepte un mélange d’images et de vidéos : jusqu’à 5 images, jusqu’à 5 vidéos, et 5 éléments au total maximum. Nommez-les dans votre prompt « Image 1 », « Image 2 », « Vidéo 1 » dans l’ordre de téléversement (images et vidéos sont numérotées indépendamment), et le modèle verrouille l’apparence et le mouvement de vos médias, tandis que la scène et l’histoire restent entièrement vôtres. L’audio passe par un champ audio unique séparé (référence vocale, voir 3.3) et ne compte pas dans le quota de références. À noter : la limite de durée r2v est toujours de 10 secondes — avec ou sans vidéos de référence.
3.1 La formule de référence de personnage
Un prompt de référence vers vidéo tient en trois temps : faites entrer les médias avec « Image N », décrivez ce qui se passe dans la nouvelle scène, puis terminez par « garder la cohérence ». L’ordre de téléversement est l’ordre de numérotation — la première image est Image 1, la deuxième vidéo est Vidéo 2. Les vues multiples du même personnage fonctionnent le mieux ; mettez un seul personnage par élément de référence, sinon le modèle ne sait plus qui est qui.
[Références : Image 1…] + [Description de la scène] + garder [Sujet] cohérent
Références
Images ou vidéos — jusqu’à 5 images, jusqu’à 5 vidéos, 5 au total — citées comme « Image N » et « Vidéo N » dans leurs propres séquences.
Description de la scène
Ce qui se passe dans la nouvelle scène : action, environnement, caméra — le cadre est généré de zéro, entièrement piloté par vos mots.
Cohérence
Une phrase de fin — « garder la cohérence avec les références » — renforce le verrouillage de l’apparence.
Le resto de minuit du Chef Panda
Prompt
Le grand panda de l’Image 1, portant un tablier bleu foncé, fait sauter et remue des aliments dans un wok dans une petite cuisine à la lumière jaune chaleureuse, la vapeur s’élevant, et il goûte une cuillerée de bouillon avec un air satisfait puis hoche la tête. La caméra fait un demi-cercle autour de la cuisinière et se fixe sur un close-up de son visage. Détails de cuisine riches, ambiance quotidienne chaleureuse et réconfortante. L’apparence du panda reste cohérente avec l’image de référence, qualité d’animation 3D.
Téléversez 1+ image(s) de référence ; « Image 1 » désigne votre personnage téléversé, et la phrase de fin « rester cohérent » est la formule standard de verrouillage de l’apparence.
3.2 Mélanger références d’images et de vidéos
La signature de Wan 2.7 : les images verrouillent l’apparence, les vidéos verrouillent le mouvement, et les deux peuvent partager la scène — « la danseuse de la Vidéo 1 monte sur la scène de l’Image 1 », et le modèle prend ce dont il a besoin de chacun. Trois règles fermes : jusqu’à 5 images, jusqu’à 5 vidéos, et pas plus de 5 éléments au total ; la limite de durée est toujours de 10 secondes (avec ou sans vidéos de référence) ; et chaque élément de référence doit contenir un seul personnage.
Le marionnettiste monte sur scène
Prompt
Le marionnettiste de l’Image 1 monte sur la scène du théâtre vintage de l’Image 2, ses fils en main, un projecteur l’attrape au moment où il salue le public avec le geste de la Vidéo 1, puis il soulève sa marionnette et commence le spectacle tandis que le rideau se referme lentement derrière lui. La caméra fait un lent push-in depuis un medium shot depuis le public, l’atmosphère du théâtre solennelle et mystérieuse. Les apparences restent cohérentes avec les médias de référence.
Téléversez 2 images de référence + 1 vidéo de référence (3 éléments au total, dans la limite de 5) ; « Image 1 », « Image 2 » et « Vidéo 1 » nomment chacun leur rôle ; la limite de durée r2v est toujours de 10 s — prérempli avec 8.
3.3 Référence vocale : faire parler le personnage avec votre voix
Le champ audio de la référence vers vidéo signifie « référence vocale » — téléversez un enregistrement de la voix cible et le personnage généré parle avec cette voix, en reproduisant fidèlement l’accent, le ton et la tension émotionnelle. Les voix off de marque, les clips de présentateur virtuel et les dialogues multi-personnages reposent tous dessus. Dans le prompt, nommez-le : « prononcer la réplique avec la voix d’Audio 1 » — écrivez la réplique directement dans le prompt, et les mouvements des lèvres se synchronisent automatiquement avec la prononciation.
Le nouveau slogan de l’ambassadrice de marque
Prompt
L’ambassadrice de marque de l’Image 1 se tient dans le studio minimaliste de l’Image 2, face à la caméra, et prononce le slogan de la marque avec la voix d’Audio 1 : « Faites de chaque départ un paysage. » Le ton est chaleureux et résolu, les mouvements des lèvres strictement synchronisés avec la prononciation, avec un léger sourire sur le mot « paysage ». La caméra fait un lent push-in vers un close-up mi-corps. L’apparence reste cohérente avec les images de référence, éclairage de studio doux, rendu propre et premium.
Téléversez une image de portrait + une image de scène + 1 piste de référence vocale (le champ audio r2v désigne la référence vocale) ; écrivez la réplique dans le prompt et laissez l’audio reproduire la voix.
3.4 Ancrage de première image : maîtriser la composition d’ouverture
La référence vers vidéo accepte un téléversement supplémentaire de « première image » pour ancrer le plan d’ouverture — la composition, la position de caméra et l’éclairage de la première image sont sous votre contrôle précis, et le modèle se déploie selon le prompt à partir de la deuxième image. Un effet secondaire à connaître : une fois la première image fournie, le ratio de sortie la suit et le sélecteur de ratio cesse de s’appliquer (le paramètre de ratio est ignoré dans ce cas).
L’ouverture du nouveau produit du barista
Prompt
Utiliser la première image téléversée comme plan d’ouverture : le barista de l’Image 1 se retourne derrière le comptoir pour faire face à la caméra, lève le nouveau breuvage signature de l’Image 2, la vapeur s’élevant de la tasse, et sourit en le présentant vers l’objectif. La composition d’ouverture est strictement ancrée à la première image, puis la caméra fait un lent push-in vers un close-up du breuvage. Les apparences de la personne et du produit restent cohérentes avec les images de référence, dans une ambiance chaleureuse de café aux tons boisés.
En mode r2v, téléversez une image de première image + 1 à 2 images de référence ; une fois la première image fournie, le ratio la suit — le sélecteur de ratio qui devient inerte est un comportement attendu.
04 Édition vidéo
Éditez une vidéo en langage naturel — téléversez une vidéo source de 2 à 10 secondes et écrivez une instruction simple : changez le style, la tenue, l’accessoire, et tout le reste reste tel quel. La durée de sortie suit automatiquement la vidéo source (pas de sélecteur de durée) ; le ratio propose six options — auto suit la source par défaut, ou forcez un ratio explicite comme 16:9 ou 9:16. Joignez aussi 1 image de référence pour montrer au modèle « en quoi se changer ». Le contrôle audio est votre deuxième plume : l’interrupteur « conserver l’audio d’origine » décide du sort de la piste source, et la boîte de dialogue des paramètres a un interrupteur « réécriture intelligente » (prompt_extend, activé par défaut) qui enrichit automatiquement les instructions courtes avec des détails.
4.1 Transfert de style
Donnez à tout le clip une nouvelle peau artistique : animation en pâte à modeler, aquarelle, pixel art, néon cyber — une phrase suffit. Nommez trois traits du style cible — trait, matériau, dominante de couleur — puis ajoutez « conserver le mouvement de caméra et le rythme tels quels », et le modèle change l’apparence sans toucher à l’histoire.
La rue en pâte à modeler
Prompt
Convertir cette vidéo en style animation en pâte à modeler : formes arrondies sculptées à la main avec une texture de traces de doigts visible et un matériau argileux, éclairage doux de décor miniature, personnages et bâtiments façonnés comme de l’argile moulée, mouvement de caméra et rythme conservés exactement comme dans l’original.
Téléversez une vidéo source de 2 à 10 secondes ; elle route automatiquement vers Wan 2.7 Video Edit, la durée suit la source et le ratio est par défaut sur auto (suivre la source). Nommer le trio « forme + matériau + éclairage » est la recette de style la plus fiable.
4.2 Remplacement d’éléments
Échangez tenues, accessoires et produits sans toucher au reste du plan : énoncez clairement « remplacer A par B », puis ajoutez « conserver tout le reste inchangé ». Les remplacements sont les plus précis avec une image de référence — « le blouson en cuir de l’Image 1 » vaut mieux que cent adjectifs.
Échanger contre un blouson en cuir
Prompt
Remplacer la veste du personnage dans la vidéo par le blouson en cuir marron de l’Image 1, le tissu se froissant naturellement au fil des mouvements, sa texture et la direction de l’éclairage correspondant à la scène d’origine, tout le reste inchangé.
Téléversez une vidéo source, éventuellement avec 1 image de référence ; « remplacer A par B + conserver le reste » est la formulation de remplacement la plus fiable.