Guide

Guide Wan 3.0

Wan 3.0 réunit la text-to-video, l’image-to-video et la reference-to-video dans un seul modèle — jusqu’à 30 secondes par clip, avec des images, des vidéos et de l’audio mélangés comme bon vous semble. Ce guide est organisé autour de vraies tâches créatives  de la formule de base, l’interrupteur audio et le format adaptatif, aux références omni et à l’écriture de vidéos longues de 30 secondes — chaque exemple se pré-charge dans le générateur Molyin d’un seul clic.

Mis à jour le 2026-08-06

01 La formule de base

Wan 3.0 comprend les instructions structurées  qui, ce qu’il fait, comment la caméra bouge, où, et dans quel ton. Ce chapitre pose d’abord le squelette du prompt, puis présente deux nouveaux réglages de la 3.0 — l’interrupteur audio et le format adaptatif intelligent.

1.1 La formule de base du prompt

Tout commence par une phrase  le sujet et le mouvement sont les deux parties obligatoires  caméra, environnement et style s’ajoutent à la demande. La durée est un réglage continu de 2 à 30 s — prévoyez exactement ce que les secondes peuvent contenir  pour l’écriture de formats longs de 30 secondes, voir le chapitre 4.

[Sujet] + [Mouvement] + facultatif [Caméra] [Environnement] [Esthétique]

Requis

Sujet

Le protagoniste — une personne, un animal ou un produit. Plus c’est précis, mieux c’est.

Requis

Mouvement

Ce que fait le sujet, avec les parties du corps et le rythme précisés. Les petits mouvements lents et cohérents sont les plus fiables.

Facultatif

Caméra

Taille de plan et mouvement  close-up, push-in, pan. Pour les narrations multi-plans, écrivez directement le storyboard, p. ex. « Shot 1 [0-3s] wide shot ».

Facultatif

Environnement

Scène et ambiance  lieu, moment, lumière, météo.

Facultatif

Esthétique

Direction artistique et qualité  tonalité des couleurs, texture, netteté.

La librairie au coin d’une rue pluvieuse

Prompt

Par une nuit de pluie, au coin d’une rue, une petite librairie brille encore d’une lumière jaune chaleureuse. La propriétaire, en pull beige, porte une pile de livres jusqu’au rebord de la vitrine, lève les yeux vers la pluie dehors et sourit en accrochant une enseigne en bois « Ouvert ». La caméra effectue un lent push-in depuis l’autre côté de la rue jusqu’à un close-up de la vitrine, des gouttes de pluie glissant sur la vitre, des enseignes au néon se reflétant sur le trottoir mouillé. Qualité cinématographique, étalonnage au contraste chaud-froid, riches détails.

Deux phrases pour le sujet et le mouvement, une pour la caméra, une pour l’environnement, et des mots de style pour conclure — voilà un prompt de base solide pour Wan 3.0.

1.2 L’interrupteur audio  montage final ou piste vierge

L’audio de la famille Wan a enfin son interrupteur (même prix dans les deux cas)  activé, l’ambiance, les effets sonores et la musique sont générés en même temps que l’image — vous obtenez un montage final  désactivé, vous obtenez une piste vierge, sans bande audio, prête pour votre propre musique et votre post-production. Vous voulez un « montage final »  Activez-le. Vous voulez de la « matière brute »  Désactivez-le — pour les projets commerciaux qui exigent une voix off, des sous-titres ou une musique de remplacement, la désactivation est le chemin le plus propre.

Des images B-roll silencieuses

Prompt

Une forêt de bambous au petit matin, une brume fine dérivant lentement entre les troncs, la lumière du soleil traversant les feuilles en rais de lumière, quelques feuilles de bambou tombant dans le vent. La caméra effectue un lent pan à basse hauteur, le cadre calme et éthéré, qualité documentaire, tons vert d’eau.

L’interrupteur audio est désactivé pour vous — prenez ce plan comme image de fond et posez votre propre musique et narration par-dessus, sans BGM imposé par le modèle qui viendrait tout couvrir.

1.3 Le format adaptatif intelligent

Le sélecteur de format gagne un nouveau réglage adaptatif par défaut  laissez-le vide et le modèle choisit le cadre à partir de vos médias de référence et de l’intention du contenu — un matériau vertical donne une sortie verticale, un texte cinématographique donne un format paysage, et la plupart du temps il choisit mieux qu’une estimation humaine. Besoin d’un contrôle précis (par exemple un 9:16 verrouillé pour un placement en fil d’actualité)  Les cinq formats explicites sont toujours là. En cas de doute, confiez-le à l’adaptatif  s’il y a une exigence stricte, définissez-le explicitement.

Teaser d’une bougie parfumée

Prompt

Une bougie parfumée artisanale brûle en silence sur une table en bois brut, la flamme vacillant doucement, la cire ambrée luisant délicatement, avec un linge de lin flou et des fleurs séchées en arrière-plan. La caméra orbite lentement autour de la bougie sur un demi-tour, des taches de lumière se déplaçant sur la surface de la table. Sensation minimaliste haut de gamme, tons chaleureux, qualité publicitaire commerciale.

Pré-rempli avec le mode adaptatif — le modèle choisit le bon cadre à partir de l’intention « qualité publicitaire commerciale »  passez à un format explicite dès que vous devez le verrouiller.

02 Image vers vidéo

Une première image plus une description de mouvement, et Wan 3.0 donne vie à l’image — le centre de gravité du prompt passe de la description de la scène à la description du mouvement, car la scène existe déjà. Une première image fixe l’ouverture  la première et la dernière image fixent les deux extrémités. Ce chapitre couvre les deux approches.

2.1 Donner vie aux photos

Un prompt image-to-video ne couvre que trois choses  ce qui bouge, comment ça bouge, et si la caméra bouge. N’imposez pas ce qui n’est pas dans l’image  « réveillez » ce qui s’y trouve — un tissu qui ondule, de l’eau qui coule, une lampe qui vacille sont tous de petits mouvements à fort taux de réussite. Ajoutez « conserver la texture d’origine » et le style ne dérivera pas.

Les lumières du port de pêche

Prompt

Donnez vie à cette photo  dans le port de pêche sous le ciel nocturne, les lampes des bateaux de pêche s’allument les unes après les autres, leurs reflets se balançant sur l’eau, les drapeaux des mâts ondulant doucement dans la brise marine, et le faisceau du phare lointain balayant lentement le paysage. La caméra reste fixe, en conservant tout du long la texture argentique aux tons bleus de la photo d’origine.

Téléversez 1 image de première frame  écrivez uniquement le mouvement sans redécrire la scène, et laissez « conserver la texture d’origine » tenir le style.

2.2 Première et dernière image  maîtrisez le début et la fin

Téléversez une première image et une dernière image, et le modèle génère tout ce qui se trouve entre les deux. Cela change votre façon d’écrire le prompt  sautez le début et la fin (ils sont dans les images) et écrivez seulement « comment passer de A à B » — le rythme du changement et la manière dont la caméra l’accompagne. Gardez les deux images au même format, et plus l’écart visuel est grand, plus vous devez fournir de description du processus.

Un arbre, quatre saisons

Prompt

Le même arbre se transforme lentement depuis une canopée printanière en pleine floraison  les pétales s’envolent dans le vent, les feuilles vertes deviennent denses en ombre, puis virent au jaune et au rouge, jusqu’à ce qu’il ne reste que des branches couvertes de neige. La caméra effectue un lent pull back, la lumière et les ombres des quatre saisons s’écoulant naturellement, la position de l’arbre et le cadrage suivant strictement la première et la dernière image.

En mode image-to-video, téléversez une première image (printemps) + une dernière image (hiver)  8 secondes laissent aux quatre saisons le temps de tourner.

03 Références omni

La capacité phare de Wan 3.0  mélangez trois canaux de médias de référence — jusqu’à 10 images + 5 vidéos + 5 pistes audio. Les images possèdent l’apparence, les vidéos possèdent le mouvement, l’audio possède la voix. Nommez-les dans votre prompt « Image 1 », « Vidéo 1 », « Audio 1 » dans l’ordre d’upload pour assigner leurs rôles (les trois types de médias sont numérotés indépendamment).

3.1 La formule de référence multi-images

Un prompt reference-to-video se déroule en trois temps  faites entrer les médias en scène avec « Image N », décrivez ce qui se passe dans la nouvelle scène, puis concluez par « garder la cohérence ». Plusieurs angles du même sujet donnent les meilleurs résultats  mettez un seul sujet par image de référence — les collages laissent le modèle incapable de dire qui est qui.

[Références  Image 1…] + [description de la scène] + gardez le [sujet] cohérent

Requis

Références

Jusqu’à 10 images de référence, citées comme « Image N » dans l’ordre d’upload.

Facultatif

Description de la scène

Ce qui se passe dans la nouvelle scène  action, environnement, caméra — le cadre est généré de zéro, entièrement piloté par vos mots.

Facultatif

Cohérence

Une phrase conclusive « rester cohérent avec les images de référence » renforce le verrouillage de l’apparence.

Le jour du nouveau produit du barista

Prompt

Le barista de l’Image 1, portant le tablier vert foncé de l’Image 2, se tient derrière le comptoir de café minimaliste de l’Image 3 et pousse doucement un café versé (pour-over) vers la caméra, le latte art sur la mousse clairement visible, puis lève les yeux avec un sourire. La caméra effectue un lent pull back, d’un close-up de la tasse à un medium shot, lumière matinale aux tons chaleureux, ambiance quotidienne douce et réconfortante. La personne, la tenue et le décor restent cohérents avec les images de référence.

Téléversez 3 images de référence (personne / tenue / décor)  « Image 1 », « Image 2 » et « Image 3 » nomment chacune leur rôle, et la conclusion « rester cohérent » verrouille l’apparence.

3.2 Vidéos de référence  migrer le mouvement et le travail de caméra

Les vidéos de référence possèdent « la façon dont les choses bougent »  le modèle apprend le rythme d’action du personnage et le langage de mouvement de la caméra à partir de votre vidéo et les applique à votre nouvelle scène. Trois règles strictes à retenir  jusqu’à 5 vidéos de référence pour une durée totale de 15 secondes maximum  les secondes totales des vidéos de référence comptent dans le budget de génération de 30 secondes (10 secondes de référence laissent environ 20 secondes de sortie)  et lorsqu’elle sert de référence de sujet, gardez un seul sujet par clip.

Emprunter le travail de caméra d’un film

Prompt

Suivez le mouvement de caméra et le rythme des plans de la Vidéo 1  la caméra s’élève depuis un low angle au niveau du bureau, orbite à demi autour du sujet, puis effectue un pull back et se stabilise. Remplacez par la machine à écrire vintage de l’Image 1, frappée par une paire de mains invisibles sur un bureau tard dans la nuit, le papier tremblant doucement à chaque frappe, la lampe de bureau luisant d’une lumière chaude. Le travail de caméra suit strictement la Vidéo 1, l’apparence du sujet reste cohérente avec l’Image 1, qualité cinématographique.

Téléversez 1 vidéo de référence + 1 image du sujet  « suivre le mouvement de caméra et le rythme des plans de la Vidéo 1 » est la formulation standard pour migrer le langage de caméra.

3.3 Audio de référence  faites parler le personnage avec votre voix

L’audio de référence est le nouveau canal de la famille Wan  téléversez un enregistrement vocal propre (jusqu’à 5 pistes, 15 secondes maximum au total) et le modèle en clone le timbre, laissant le personnage à l’écran prononcer vos répliques écrites avec cette voix. Nommez « Audio 1 » dans le prompt et ajoutez une ligne d’indication de ton  les mouvements des lèvres se synchronisent automatiquement avec la prononciation.

La phrase d’ouverture de la fondatrice

Prompt

La fondatrice de la marque de l’Image 1 est assise dans le studio en bois brut de l’Image 2, quelques objets en cuir artisanal disposés devant elle. Elle regarde la caméra et dit naturellement avec la voix de l’Audio 1  « Huit ans d’artisanat, et ce que je veux encore dire par-dessus tout, c’est  prenez votre temps, et vous irez plus vite. » Gardez le ton chaleureux et posé ainsi que le rythme des pauses de l’Audio 1, les mouvements des lèvres strictement synchronisés avec la prononciation, et son apparence cohérente avec les images de référence.

Téléversez 1 portrait + 1 image de scène + 1 enregistrement vocal  « garder le ton et le rythme des pauses de l’Audio 1 » est la formulation clé pour une reproduction vocale haute fidélité.

04 Vidéos longues de 30 secondes et flux de travail terrain

30 secondes, c’est le saut générationnel de Wan 3.0 — un seul clip peut désormais raconter une histoire complète. Ce chapitre vous donne la méthode d’écriture segmentée pour les vidéos longues, ainsi que le flux de travail économique des vétérans  prévisualisez en 480p, puis passez à un niveau supérieur pour le montage final.

4.1 Le script segmenté de 30 secondes

La façon d’écrire les vidéos longues est de découper le clip en segments temporels  chaque segment indique ses secondes de début et de fin, son contenu visuel et son travail de caméra, et un paragraphe de réglage global en tête verrouille le style et l’ambiance. Adaptez la charge d’action à la longueur du segment — entasser 10 actions en 3 secondes ne fait que forcer le modèle à accélérer  si vous voulez une coupe, nommez la transition à l’intérieur du segment.

[Réglage global] + [secondes de début-fin] + [contenu visuel et caméra] + facultatif [Transition]

Requis

Tranche temporelle

Des secondes de début et de fin explicites (p. ex. 0-5s, 5-12s). Découper 30 secondes en 3 à 5 segments est la solution la plus stable.

Requis

Image et caméra

Ce qui se passe dans cette tranche et comment la caméra bouge — la charge d’action correspond à la longueur de la tranche.

Facultatif

Réglage global

Un paragraphe d’ouverture qui verrouille le style, la tonalité des couleurs, l’ambiance et les interdits stricts pour tout le clip.

Facultatif

Transition

Comment les tranches se rejoignent  coupe naturelle, fondu enchaîné, volet — nommez-le simplement.

Une ville s’éveille en 30 secondes

Prompt

[Réglage global] Style aérien documentaire, dégradé de couleurs du bleu froid de l’avant-aube à l’or chaud, éclairage physique réel, pas de sous-titres, pas de musique (son d’ambiance pur). 0-6s  La skyline de la ville avant l’aube, des lumières éparpillées comme des étoiles, des nuages bas, la caméra effectuant un lent push-in depuis la haute altitude. 6-14s  L’horizon pâlit dans l’aube  la caméra descend à travers la couche nuageuse tandis que le contour de la ville s’affine progressivement, et un train léger de première heure glisse entre les bâtiments, traînant une traînée de lumière. 14-22s  La caméra descend au niveau de la rue et suit le long de celle-ci  un magasin de petit-déjeuner remonte son volet, de la vapeur s’élève des paniers en bambou, un cycliste traverse la lumière du matin — la ville commence à s’éveiller. 22-30s  Le soleil jaillit au-dessus de l’horizon  la caméra remonte rapidement à haute altitude, toute la ville baignée de lumière dorée matinale, et le cadre se fige sur un magnifique wide shot.

Le réglage global pose le ton et quatre tranches possèdent chacune un segment — écrivez d’abord le squelette d’un clip de 30 secondes, puis remplissez la chair, et le rythme ne s’effondrera pas.

4.2 Le flux de travail de prévisualisation en 480p

Le flux de travail des vétérans  prévisualisez en 480p pendant la phase créative — pour environ un quart du coût du 1080p — et une fois la composition, le mouvement et le rythme validés, passez le même prompt en 1080p pour le montage final. Dix révisions à l’étape de prévisualisation ne font pas mal  le passage final se fait d’un coup.

Le skateur (version de prévisualisation)

Prompt

Dans un skatepark au crépuscule, un adolescent en hoodie oversize descend de la rampe, saute, fait retourner la planche, atterrit stable, roule vers la caméra et freine sec devant elle, la poussière soulevée clairement visible contre le contre-jour. La caméra suit à un low angle, puis orbite à demi et se stabilise sur son visage souriant. Caméra rapide avec une sensation de vitesse, style documentaire de rue, tons dorés chaleureux.

Pré-rempli en 480p — validez d’abord l’action et le travail de caméra avec celui-ci  une fois satisfait, passez la résolution en 1080p, allongez la durée et relancez le même prompt pour le montage final.

Aide-mémoire des paramètres Wan 3.0 (vs 2.7)

Tous les niveaux réellement exposés par le générateur Molyin pour Wan 3.0, comparés côte à côte avec Wan 2.7.

Wan 3.0Wan 2.7
ModesTexte vers vidéo / Image vers vidéo / Référence vers vidéoTexte vers vidéo / Image vers vidéo / Référence vers vidéo
Résolution480p / 720p / 1080p720p / 1080p
Durée2–30 s2–15 s
Formatauto / 16:9 / 9:16 / 1:1 / 4:3 / 3:416:9 / 9:16 / 1:1 / 4:3 / 3:4
AudioOuiAudio activé par défaut, sans paramètre de contrôle
Première/dernière imageOuiOui
Images de référence1–101–5
Vidéos de référenceJusqu’à 3Jusqu’à 3
Audio de référenceJusqu’à 5Non
Renvoyer la dernière imageNonNon

FAQ

Les huit questions les plus fréquentes, avec des réponses que nous avons nous-mêmes vérifiées.