01 La formule de base
Wan 3.0 comprend les instructions structurées qui, ce qu’il fait, comment la caméra bouge, où, et dans quel ton. Ce chapitre pose d’abord le squelette du prompt, puis présente deux nouveaux réglages de la 3.0 — l’interrupteur audio et le format adaptatif intelligent.
1.1 La formule de base du prompt
Tout commence par une phrase le sujet et le mouvement sont les deux parties obligatoires caméra, environnement et style s’ajoutent à la demande. La durée est un réglage continu de 2 à 30 s — prévoyez exactement ce que les secondes peuvent contenir pour l’écriture de formats longs de 30 secondes, voir le chapitre 4.
[Sujet] + [Mouvement] + facultatif [Caméra] [Environnement] [Esthétique]
Sujet
Le protagoniste — une personne, un animal ou un produit. Plus c’est précis, mieux c’est.
Mouvement
Ce que fait le sujet, avec les parties du corps et le rythme précisés. Les petits mouvements lents et cohérents sont les plus fiables.
Caméra
Taille de plan et mouvement close-up, push-in, pan. Pour les narrations multi-plans, écrivez directement le storyboard, p. ex. « Shot 1 [0-3s] wide shot ».
Environnement
Scène et ambiance lieu, moment, lumière, météo.
Esthétique
Direction artistique et qualité tonalité des couleurs, texture, netteté.
La librairie au coin d’une rue pluvieuse
Prompt
Par une nuit de pluie, au coin d’une rue, une petite librairie brille encore d’une lumière jaune chaleureuse. La propriétaire, en pull beige, porte une pile de livres jusqu’au rebord de la vitrine, lève les yeux vers la pluie dehors et sourit en accrochant une enseigne en bois « Ouvert ». La caméra effectue un lent push-in depuis l’autre côté de la rue jusqu’à un close-up de la vitrine, des gouttes de pluie glissant sur la vitre, des enseignes au néon se reflétant sur le trottoir mouillé. Qualité cinématographique, étalonnage au contraste chaud-froid, riches détails.
Deux phrases pour le sujet et le mouvement, une pour la caméra, une pour l’environnement, et des mots de style pour conclure — voilà un prompt de base solide pour Wan 3.0.
1.2 L’interrupteur audio montage final ou piste vierge
L’audio de la famille Wan a enfin son interrupteur (même prix dans les deux cas) activé, l’ambiance, les effets sonores et la musique sont générés en même temps que l’image — vous obtenez un montage final désactivé, vous obtenez une piste vierge, sans bande audio, prête pour votre propre musique et votre post-production. Vous voulez un « montage final » Activez-le. Vous voulez de la « matière brute » Désactivez-le — pour les projets commerciaux qui exigent une voix off, des sous-titres ou une musique de remplacement, la désactivation est le chemin le plus propre.
Des images B-roll silencieuses
Prompt
Une forêt de bambous au petit matin, une brume fine dérivant lentement entre les troncs, la lumière du soleil traversant les feuilles en rais de lumière, quelques feuilles de bambou tombant dans le vent. La caméra effectue un lent pan à basse hauteur, le cadre calme et éthéré, qualité documentaire, tons vert d’eau.
L’interrupteur audio est désactivé pour vous — prenez ce plan comme image de fond et posez votre propre musique et narration par-dessus, sans BGM imposé par le modèle qui viendrait tout couvrir.
1.3 Le format adaptatif intelligent
Le sélecteur de format gagne un nouveau réglage adaptatif par défaut laissez-le vide et le modèle choisit le cadre à partir de vos médias de référence et de l’intention du contenu — un matériau vertical donne une sortie verticale, un texte cinématographique donne un format paysage, et la plupart du temps il choisit mieux qu’une estimation humaine. Besoin d’un contrôle précis (par exemple un 9:16 verrouillé pour un placement en fil d’actualité) Les cinq formats explicites sont toujours là. En cas de doute, confiez-le à l’adaptatif s’il y a une exigence stricte, définissez-le explicitement.
Teaser d’une bougie parfumée
Prompt
Une bougie parfumée artisanale brûle en silence sur une table en bois brut, la flamme vacillant doucement, la cire ambrée luisant délicatement, avec un linge de lin flou et des fleurs séchées en arrière-plan. La caméra orbite lentement autour de la bougie sur un demi-tour, des taches de lumière se déplaçant sur la surface de la table. Sensation minimaliste haut de gamme, tons chaleureux, qualité publicitaire commerciale.
Pré-rempli avec le mode adaptatif — le modèle choisit le bon cadre à partir de l’intention « qualité publicitaire commerciale » passez à un format explicite dès que vous devez le verrouiller.
02 Image vers vidéo
Une première image plus une description de mouvement, et Wan 3.0 donne vie à l’image — le centre de gravité du prompt passe de la description de la scène à la description du mouvement, car la scène existe déjà. Une première image fixe l’ouverture la première et la dernière image fixent les deux extrémités. Ce chapitre couvre les deux approches.
2.1 Donner vie aux photos
Un prompt image-to-video ne couvre que trois choses ce qui bouge, comment ça bouge, et si la caméra bouge. N’imposez pas ce qui n’est pas dans l’image « réveillez » ce qui s’y trouve — un tissu qui ondule, de l’eau qui coule, une lampe qui vacille sont tous de petits mouvements à fort taux de réussite. Ajoutez « conserver la texture d’origine » et le style ne dérivera pas.
Les lumières du port de pêche
Prompt
Donnez vie à cette photo dans le port de pêche sous le ciel nocturne, les lampes des bateaux de pêche s’allument les unes après les autres, leurs reflets se balançant sur l’eau, les drapeaux des mâts ondulant doucement dans la brise marine, et le faisceau du phare lointain balayant lentement le paysage. La caméra reste fixe, en conservant tout du long la texture argentique aux tons bleus de la photo d’origine.
Téléversez 1 image de première frame écrivez uniquement le mouvement sans redécrire la scène, et laissez « conserver la texture d’origine » tenir le style.
2.2 Première et dernière image maîtrisez le début et la fin
Téléversez une première image et une dernière image, et le modèle génère tout ce qui se trouve entre les deux. Cela change votre façon d’écrire le prompt sautez le début et la fin (ils sont dans les images) et écrivez seulement « comment passer de A à B » — le rythme du changement et la manière dont la caméra l’accompagne. Gardez les deux images au même format, et plus l’écart visuel est grand, plus vous devez fournir de description du processus.
Un arbre, quatre saisons
Prompt
Le même arbre se transforme lentement depuis une canopée printanière en pleine floraison les pétales s’envolent dans le vent, les feuilles vertes deviennent denses en ombre, puis virent au jaune et au rouge, jusqu’à ce qu’il ne reste que des branches couvertes de neige. La caméra effectue un lent pull back, la lumière et les ombres des quatre saisons s’écoulant naturellement, la position de l’arbre et le cadrage suivant strictement la première et la dernière image.
En mode image-to-video, téléversez une première image (printemps) + une dernière image (hiver) 8 secondes laissent aux quatre saisons le temps de tourner.
03 Références omni
La capacité phare de Wan 3.0 mélangez trois canaux de médias de référence — jusqu’à 10 images + 5 vidéos + 5 pistes audio. Les images possèdent l’apparence, les vidéos possèdent le mouvement, l’audio possède la voix. Nommez-les dans votre prompt « Image 1 », « Vidéo 1 », « Audio 1 » dans l’ordre d’upload pour assigner leurs rôles (les trois types de médias sont numérotés indépendamment).
3.1 La formule de référence multi-images
Un prompt reference-to-video se déroule en trois temps faites entrer les médias en scène avec « Image N », décrivez ce qui se passe dans la nouvelle scène, puis concluez par « garder la cohérence ». Plusieurs angles du même sujet donnent les meilleurs résultats mettez un seul sujet par image de référence — les collages laissent le modèle incapable de dire qui est qui.
[Références Image 1…] + [description de la scène] + gardez le [sujet] cohérent
Références
Jusqu’à 10 images de référence, citées comme « Image N » dans l’ordre d’upload.
Description de la scène
Ce qui se passe dans la nouvelle scène action, environnement, caméra — le cadre est généré de zéro, entièrement piloté par vos mots.
Cohérence
Une phrase conclusive « rester cohérent avec les images de référence » renforce le verrouillage de l’apparence.
Le jour du nouveau produit du barista
Prompt
Le barista de l’Image 1, portant le tablier vert foncé de l’Image 2, se tient derrière le comptoir de café minimaliste de l’Image 3 et pousse doucement un café versé (pour-over) vers la caméra, le latte art sur la mousse clairement visible, puis lève les yeux avec un sourire. La caméra effectue un lent pull back, d’un close-up de la tasse à un medium shot, lumière matinale aux tons chaleureux, ambiance quotidienne douce et réconfortante. La personne, la tenue et le décor restent cohérents avec les images de référence.
Téléversez 3 images de référence (personne / tenue / décor) « Image 1 », « Image 2 » et « Image 3 » nomment chacune leur rôle, et la conclusion « rester cohérent » verrouille l’apparence.
3.2 Vidéos de référence migrer le mouvement et le travail de caméra
Les vidéos de référence possèdent « la façon dont les choses bougent » le modèle apprend le rythme d’action du personnage et le langage de mouvement de la caméra à partir de votre vidéo et les applique à votre nouvelle scène. Trois règles strictes à retenir jusqu’à 5 vidéos de référence pour une durée totale de 15 secondes maximum les secondes totales des vidéos de référence comptent dans le budget de génération de 30 secondes (10 secondes de référence laissent environ 20 secondes de sortie) et lorsqu’elle sert de référence de sujet, gardez un seul sujet par clip.
Emprunter le travail de caméra d’un film
Prompt
Suivez le mouvement de caméra et le rythme des plans de la Vidéo 1 la caméra s’élève depuis un low angle au niveau du bureau, orbite à demi autour du sujet, puis effectue un pull back et se stabilise. Remplacez par la machine à écrire vintage de l’Image 1, frappée par une paire de mains invisibles sur un bureau tard dans la nuit, le papier tremblant doucement à chaque frappe, la lampe de bureau luisant d’une lumière chaude. Le travail de caméra suit strictement la Vidéo 1, l’apparence du sujet reste cohérente avec l’Image 1, qualité cinématographique.
Téléversez 1 vidéo de référence + 1 image du sujet « suivre le mouvement de caméra et le rythme des plans de la Vidéo 1 » est la formulation standard pour migrer le langage de caméra.
3.3 Audio de référence faites parler le personnage avec votre voix
L’audio de référence est le nouveau canal de la famille Wan téléversez un enregistrement vocal propre (jusqu’à 5 pistes, 15 secondes maximum au total) et le modèle en clone le timbre, laissant le personnage à l’écran prononcer vos répliques écrites avec cette voix. Nommez « Audio 1 » dans le prompt et ajoutez une ligne d’indication de ton les mouvements des lèvres se synchronisent automatiquement avec la prononciation.
La phrase d’ouverture de la fondatrice
Prompt
La fondatrice de la marque de l’Image 1 est assise dans le studio en bois brut de l’Image 2, quelques objets en cuir artisanal disposés devant elle. Elle regarde la caméra et dit naturellement avec la voix de l’Audio 1 « Huit ans d’artisanat, et ce que je veux encore dire par-dessus tout, c’est prenez votre temps, et vous irez plus vite. » Gardez le ton chaleureux et posé ainsi que le rythme des pauses de l’Audio 1, les mouvements des lèvres strictement synchronisés avec la prononciation, et son apparence cohérente avec les images de référence.
Téléversez 1 portrait + 1 image de scène + 1 enregistrement vocal « garder le ton et le rythme des pauses de l’Audio 1 » est la formulation clé pour une reproduction vocale haute fidélité.
04 Vidéos longues de 30 secondes et flux de travail terrain
30 secondes, c’est le saut générationnel de Wan 3.0 — un seul clip peut désormais raconter une histoire complète. Ce chapitre vous donne la méthode d’écriture segmentée pour les vidéos longues, ainsi que le flux de travail économique des vétérans prévisualisez en 480p, puis passez à un niveau supérieur pour le montage final.
4.1 Le script segmenté de 30 secondes
La façon d’écrire les vidéos longues est de découper le clip en segments temporels chaque segment indique ses secondes de début et de fin, son contenu visuel et son travail de caméra, et un paragraphe de réglage global en tête verrouille le style et l’ambiance. Adaptez la charge d’action à la longueur du segment — entasser 10 actions en 3 secondes ne fait que forcer le modèle à accélérer si vous voulez une coupe, nommez la transition à l’intérieur du segment.
[Réglage global] + [secondes de début-fin] + [contenu visuel et caméra] + facultatif [Transition]
Tranche temporelle
Des secondes de début et de fin explicites (p. ex. 0-5s, 5-12s). Découper 30 secondes en 3 à 5 segments est la solution la plus stable.
Image et caméra
Ce qui se passe dans cette tranche et comment la caméra bouge — la charge d’action correspond à la longueur de la tranche.
Réglage global
Un paragraphe d’ouverture qui verrouille le style, la tonalité des couleurs, l’ambiance et les interdits stricts pour tout le clip.
Transition
Comment les tranches se rejoignent coupe naturelle, fondu enchaîné, volet — nommez-le simplement.
Une ville s’éveille en 30 secondes
Prompt
[Réglage global] Style aérien documentaire, dégradé de couleurs du bleu froid de l’avant-aube à l’or chaud, éclairage physique réel, pas de sous-titres, pas de musique (son d’ambiance pur). 0-6s La skyline de la ville avant l’aube, des lumières éparpillées comme des étoiles, des nuages bas, la caméra effectuant un lent push-in depuis la haute altitude. 6-14s L’horizon pâlit dans l’aube la caméra descend à travers la couche nuageuse tandis que le contour de la ville s’affine progressivement, et un train léger de première heure glisse entre les bâtiments, traînant une traînée de lumière. 14-22s La caméra descend au niveau de la rue et suit le long de celle-ci un magasin de petit-déjeuner remonte son volet, de la vapeur s’élève des paniers en bambou, un cycliste traverse la lumière du matin — la ville commence à s’éveiller. 22-30s Le soleil jaillit au-dessus de l’horizon la caméra remonte rapidement à haute altitude, toute la ville baignée de lumière dorée matinale, et le cadre se fige sur un magnifique wide shot.
Le réglage global pose le ton et quatre tranches possèdent chacune un segment — écrivez d’abord le squelette d’un clip de 30 secondes, puis remplissez la chair, et le rythme ne s’effondrera pas.
4.2 Le flux de travail de prévisualisation en 480p
Le flux de travail des vétérans prévisualisez en 480p pendant la phase créative — pour environ un quart du coût du 1080p — et une fois la composition, le mouvement et le rythme validés, passez le même prompt en 1080p pour le montage final. Dix révisions à l’étape de prévisualisation ne font pas mal le passage final se fait d’un coup.
Le skateur (version de prévisualisation)
Prompt
Dans un skatepark au crépuscule, un adolescent en hoodie oversize descend de la rampe, saute, fait retourner la planche, atterrit stable, roule vers la caméra et freine sec devant elle, la poussière soulevée clairement visible contre le contre-jour. La caméra suit à un low angle, puis orbite à demi et se stabilise sur son visage souriant. Caméra rapide avec une sensation de vitesse, style documentaire de rue, tons dorés chaleureux.
Pré-rempli en 480p — validez d’abord l’action et le travail de caméra avec celui-ci une fois satisfait, passez la résolution en 1080p, allongez la durée et relancez le même prompt pour le montage final.