Guide

Guide Seedance 2.5

Seedance 2.5 étire une seule génération jusqu’à 30 secondes et supporte nativement les scripts à timecodes à la seconde — l’ère de la précision point-and-shoot est arrivée. Ce guide réorganise le manuel d’utilisation officiel autour de vraies tâches créatives  de la formule de base et de l’écriture pour personnes réelles aux prises longues à timecodes, en passant par les références multimodales et l’édition locale — chaque exemple pré-remplit le générateur Molyin en un clic.

Mis à jour le 2026-08-06

01 La formule de base

La maîtrise des instructions structurées de Seedance 2.5 monte encore d’un cran  un prompt complet se construit en quatre couches — descriptions des assets, résumé en une ligne, intrigue détaillée et récapitulatif global. Ce chapitre pose d’abord le squelette, puis vous donne la formule personne réelle validée officiellement — conçue pour soigner le « visage IA » et la peau plastique.

1.1 La formule complète du prompt

Un prompt Seedance 2.5 complet = descriptions des assets + résumé en une ligne + intrigue détaillée + récapitulatif global. Sautez la première couche si vous n’avez uploadé aucun asset  découpez l’intrigue en segments le long d’une timeline ou d’un arc narratif  et placez le récapitulatif global à la fin, en réaffirmant ce qui traverse tout le film et ce qui ne doit pas apparaître (sous-titres, BGM).

[Descriptions des assets] + [Résumé en une ligne] + [Intrigue détaillée] + [Récapitulatif global]

Requis

Résumé en une ligne

Sujet + lieu + événement + genre/style + tout mouvement de caméra spécial — une phrase qui pose le ton du film.

Requis

Intrigue détaillée

Écrivez le long d’une timeline ou d’un arc narratif  chaque plan porte son contenu visuel, son mouvement de caméra, ses actions, son dialogue et ses effets sonores — plus ce que vous ne voulez pas (descriptions négatives).

Facultatif

Descriptions des assets

Numérotez vos assets dans l’ordre d’upload et dites à quoi sert chacun  l’apparence d’un personnage, une voix, un mouvement ou une scène. Sans asset de référence, toute cette couche peut être omise.

Facultatif

Récapitulatif global

À la fin, renforcez les détails qui traversent tout le film  position de la caméra, traits d’environnement, lumière et atmosphère — ou les interdits globaux (sous-titres, BGM).

Un documentaire sur la grue à couronne rouge

Prompt

Documentaire nature photoréaliste, éclairage cinématographique fidèle à la réalité. Dans la brume matinale, au milieu d’une vaste roselière (la scène référence l’Image 1), une élégante grue à couronne rouge (l’apparence référence l’Image 2) déploie ses ailes dans une danse — plumes blanches comme neige, couronne rouge éclatante, silhouette haute et fine. Le décor est un marais automnal peu profond, l’eau scintillante, entouré de roseaux dorés, de lentilles d’eau et de plantes aquatiques, avec la brume matinale au loin et le soleil levant légèrement flou en arrière-plan. Medium shot en contre-plongée avec une légère sensation caméra à l’épaule, globalement fixe, gardant la grue centrée en permanence. 0 s-3 s  la grue reste immobile dans l’eau peu profonde et déploie lentement ses larges ailes noires et blanches, le mouvement doux, l’air poussé par ses battements ondulant la surface. Une brise matinale souffle  la lumière du soleil oblique depuis l’horizon, perçant la brume en un effet Tyndall. 3 s-8 s  la grue sautille légèrement sur l’eau, ses pattes effleurant la surface à tour de rôle et soulevant des éclaboussures cristallines. Son long cou s’arque en arrière, le bec pointé vers le ciel  puis elle atterrit doucement, replie ses ailes, balaie son regard avec grâce et lance un appel clair et sonore. La caméra basse suit doucement les sautillements de la grue, de bas en haut, avec une profondeur de champ naturelle et les roseaux du premier plan légèrement flous. Uniquement des sons naturels ambiants  eau qui coule, battements d’ailes vigoureux et cri de la grue — serein, aérien, magnifique.

Nécessite 2 images de référence (scène + sujet)  ouvrez par une phrase qui pose le ton, découpez l’intrigue le long d’une timeline au milieu, et clôturez par l’ambiance globale — la structure en quatre couches se lit d’un coup d’œil.

1.2 La formule personne réelle (soigner le visage IA)

La 2.5 a fortement réduit le « look IA », mais votre façon d’écrire reste le facteur décisif pour des personnes photoréalistes. La formule en sept dimensions validée officiellement découpe une personne en âge/ethnie, texture de peau, détails du visage, yeux, cheveux, garde-robe et silhouette/présence — les yeux sont l’âme, et le suffixe de fidélité « préserver les vrais pores fins et la texture de la peau » est quasi obligatoire.

[Âge/ethnie] + [Ton/texture de peau] + [Détails du visage] + [Yeux/âme] + [Cheveux] [Garde-robe] [Silhouette/présence] facultatifs

Requis

Âge/ethnie

Âge exact + nationalité/ethnie + un adjectif de style + un nom de forme de visage, ex. « une femme est-asiatique de 22 ans au visage classique, froid et sculpté. »

Requis

Ton/texture de peau

Ton chaud/froid + nom de teint + adjectif de texture + le suffixe de fidélité « préserver les vrais pores fins et la texture de la peau » (ajouter des taches de rousseur ou des imperfections rend encore plus réel).

Requis

Détails du visage

Forme des yeux + arcade sourcilière + arête du nez + forme des lèvres + mâchoire — écrivez au moins 3-4 de ces éléments ensemble  ils décident de la reconnaissance du visage.

Requis

Yeux/âme

Un adjectif pour le regard + le message ou la métaphore que les yeux portent + l’émotion sous-jacente — c’est ce qui décide de la gamme émotionnelle du personnage.

Facultatif

Coiffure/couleur

Couleur exacte des cheveux + état/texture + un nom de coiffure + l’interaction avec l’environnement (soulevés par la brise, etc.).

Facultatif

Garde-robe/texture

Coupe et tailoring + couleur + nom du vêtement + matière du tissu et état d’usure + la façon dont il est porté — la garde-robe construit le personnage de côté.

Facultatif

Silhouette/présence

Caractéristiques de la carrure et des épaules + exigence de cadrage + posture et ligne de regard + un mot d’ambiance global.

Close-up d’une beauté classique

Prompt

Une femme est-asiatique de 22 ans au visage doux et classique fait pour le cinéma. Peau claire aux tons froids, texture fine et souple, préservant les vrais pores fins et la texture de la peau. Des yeux effilés en fleur de pêcher (le bord des paupières légèrement humide), un sourcil doucement détendu, un petit nez droit, des lèvres pleines avec un sourire tendre à peine esquissé, et une mâchoire au tracé doux. Son regard est profondément affectueux et chargé d’émotion, une source d’eau de source derrière ses yeux — tendre, concentré, portant un attachement profond et une trace de retenue. Des cheveux noirs de jais relevés en un chignon classique bas et élégant, tenu par une simple épingle en jade, quelques fines mèches libres le long des joues, remuées par la brise. Elle porte une robe classique à col croisé, blanche et minimaliste, en soie doucement lustrée et discrète, le col légèrement entrouvert. Sa silhouette est fine, ses épaules étroites, dégageant un air romantique classique, doux et mélancolique. Cadrage en close-up, regard droit dans l’objectif, lumière naturelle douce, faible profondeur de champ.

Fonctionne en pur texte vers vidéo  la même écriture s’applique aux personnages animés — remplacez simplement le langage « peau photoréaliste » par le style artistique cible.

02 Les timecodes et la prise longue de 30 secondes

La grande nouveauté de Seedance 2.5  une seule génération double de 15 à 30 secondes, et les timecodes à la seconde sont supportés nativement — spécifiez exactement ce qui se passe à quelle seconde et où tombe chaque coupe, pour une précision au niveau du script. Ce chapitre enseigne la structure en trois couches des vidéos longues et la formule de transition.

2.1 Les scripts de plans à timecodes

Le cœur de la formule vidéo longue est de découper le film en segments temporels  chaque tranche énonce « secondes de début-fin + thème de l’étape + directions physiques pour l’action/l’expression + sous-texte émotionnel ». Le sous-texte explique à l’IA pourquoi vous avez conçu cela ainsi — écrivez-le et la nuance de jeu est le jour et la nuit. Avant les tranches, n’oubliez pas le bloc « [Configuration globale] »  environnement et texture, style visuel, langage caméra, design du personnage, cœur de jeu et interdits.

[Seconde de début–seconde de fin] + [Thème de l’étape] + [Directions action/expression] + [Sous-texte émotionnel] facultatif

Requis

Tranche temporelle

Secondes de début et de fin explicites (ex. 0-3 s, 00:08-00:15) — la 2.5 exécute à la seconde près.

Requis

Directions action/physiques

Taille de plan + composition + les mouvements détaillés du personnage — tout ce que l’image doit suivre strictement dans cette tranche.

Facultatif

Thème de l’étape

Nommez la tranche (ex. « Insistance », « Résignation ») pour aider le modèle à verrouiller la clé émotionnelle du paragraphe.

Facultatif

Sous-texte émotionnel

Expliquez à l’IA l’intention derrière les directions physiques, ex. « elle ne se plaint pas — elle attend une réponse. »

Prise unique de 29 secondes  un adieu au bord de la rivière

Prompt

Prise unique de 29 secondes (une femme en costume d’époque dit adieu au bord de la rivière) [Configuration globale de la scène] Environnement de base  une rive au lever du jour, une petite barque floue en arrière-plan — une scène d’adieu solitaire. L’ambiance est calme et retenue. Style visuel  cinématographique, faible profondeur de champ (arrière-plan net et flou), lumière naturelle douce. Langage caméra  garder un close-up serré sur la femme en permanence, comme depuis le point de vue subjectif de l’homme qui lui fait face. Une légère sensation de respiration caméra à l’épaule, pas de coupes rapides. Design du personnage  une femme est-asiatique de 22 ans au visage doux et classique fait pour le cinéma. Peau claire aux tons froids, texture fine et souple, préservant les vrais pores fins et la texture de la peau. Des yeux effilés en fleur de pêcher (le bord des paupières légèrement humide), un petit nez droit, des lèvres pleines avec un tendre sourire à peine esquissé. Un regard profondément affectueux et chargé d’émotion, une source d’eau de source derrière les yeux. Des cheveux noirs de jais relevés en un chignon classique bas, tenu par une simple épingle en jade. Elle porte une robe classique à col croisé, blanche et minimaliste, en soie douce et lustrée. Une silhouette fine dégageant une grâce classique et romantique. Cœur de jeu  retenu et ciselé. Mettre l’accent sur le regard qui se déplace, le souffle qui se soulève et retombe, le léger tremblement des lèvres, le front qui se contracte et se relâche, la déglutition dans la gorge et les larmes qui coulent naturellement. Interdits  pas de sanglots exagérés, pas de coupes rapides, pas de grands mouvements du corps, pas de dialogue ou de BGM supplémentaire, et les larmes ne doivent pas couler trop tôt. [Storyboard émotion et action (montant de 0 à 29 secondes)] Étape 1, 0-3 s [Insistance]  elle regarde droit dans l’objectif, pas encore de larmes dans les yeux, le front à peine plissé, les lèvres s’entrouvrant tandis qu’elle murmure doucement  « Vous devez vraiment partir  » Sous-texte  elle ne se plaint pas — elle attend qu’il prononce à voix haute une réponse qu’elle a devinée depuis longtemps. Étape 2, 3-10 s [Résignation]  son regard dérive lentement vers l’espace vide à côté d’elle, les paupières s’abaissent, le coin de ses lèvres tire un bref sourire amer qui retombe aussitôt  ses narines se pincent légèrement, elle prend la plus discrète des respirations contenues, sa poitrine se soulève une fois. Sous-texte  par ce geste, elle refoule la peine et l’amertume. Étape 3, 11-17 s [Souvenir]  la caméra se rapproche légèrement. Elle ramène son regard et balaie lentement, soigneusement, son visage. Le bord de ses yeux rougit, mais les larmes sont retenues de force — pas une ne tombe. Au milieu, une pause de 0,5 seconde de silence absolu  ses lèvres frémissent une fois puis se serrent, son menton se contracte, sa gorge roule imperceptiblement. Sous-texte  ce regard n’est pas un adieu — elle grave son visage dans sa mémoire une dernière fois, pour la vie. Étape 4, 18-23 s [Regret]  elle baisse les yeux et, sans prévenir, une larme unique tombe droit sur son col. Elle ne l’essuie pas  quand elle relève la tête, la supplique de son regard s’est muée en une profonde tristesse. Le front plissé commence à se détendre, et elle secoue la tête — à peine — une fois. Sous-texte  le front qui se détend signale une libération intérieure  l’infime mouvement de tête est un dernier refus opposé au destin. Étape 5, 24-29 s [Lâcher prise]  la caméra avance jusqu’à un close-up extrême. Elle force un doux sourire sur son visage (aucune auto-moquerie dedans), et au moment où il atteint le coin de ses lèvres, une seconde larme glisse du coin de son œil, passe le long de son nez et s’arrête sur sa lèvre. D’une voix presque inaudible, qu’elle s’efforce de garder stable, elle dit  « Partez. » Le sourire reste figé sur son visage tandis que les larmes continuent de couler, son regard ne quittant jamais le sien. La caméra s’arrête enfin sur son visage — souriant à travers les larmes, les yeux pleins de rien d’autre que de tristesse.

La configuration globale plus le storyboard à timecodes est le squelette standard d’une prise longue de 30 secondes  les interdits de timing comme « les larmes ne doivent pas couler trop tôt » sont précisément la précision que seule la 2.5 peut tenir.

2.2 Coupes et formule de transition

Pour une narration multi-plans, écrivez les directions de transition directement dans les tranches à timecodes. Une spécification de coupe = type de transition + contraintes de base + logique de coupe. Transitions courantes  coupe naturelle, fondu entrant/sortant, fondu enchaîné, flash blanc/flash noir, occlusion wipe (un objet couvre l’objectif, l’image devient noire, puis s’écarte), morphose par match cut (une pleine lune devient un bol de vin), whip pan d’action, relais dynamique (un changement de tenue), dolly in/out (de la pupille au décor), transition à l’encre. Vous pouvez aussi proposer des candidats et laisser le modèle choisir  « parmi la coupe naturelle, l’occlusion wipe et la morphose par match cut, choisissez celle qui convient le mieux au style de ce film. »

[Type de transition] + [Contraintes de base] facultatives + [Logique de coupe]

Requis

Type de transition

Nommez la transition  « utilisez un occlusion wipe à la coupe (pas de coupes dures, pas d’objets apparaissant de nulle part). »

Facultatif

Contraintes de base

Gardez la sensation de respiration du plan et les durées en équilibre  indiquez ce que contiennent le plan A et le plan B.

Facultatif

Logique de coupe

Renforcez que « les scènes doivent se succéder naturellement »  quand vous voulez un langage caméra plus riche, ajoutez un changement de taille de plan (ex. close-up vers medium shot).

Wuxia anime de 30 secondes  cinq transitions à la suite

Prompt

[Configuration globale] Environnement de base et texture  une auberge de bord de route en plein air, au cœur d’une forêt de bambous calme, la nuit. Visez un savoir-faire d’animation 2D de premier ordre — la dérive des feuilles de bambou qui tombent et les ondulations du vin doivent obéir à la physique réelle, avec la grâce flottante propre au wuxia chinois. Style visuel  look donghua d’époque premium (3D cel-shaded avec rendu réaliste), bords à l’encre. Entrelacement à fort contraste de lumières froides et chaudes (lumière de lune bleu-blanc désolée contre la chaleur jaune des bougies sur la table de l’auberge). Langage caméra  montage au scalpel et plusieurs types de transitions physiquement sans couture, avec un contraste extrême entre l’immobilité et le mouvement. Design du personnage  un épéiste de 22 ans au visage sculpté et beau des héros de donghua. Sourcils en lames et yeux étoilés, queue-de-cheval haute, mèches lâches sur le front. Il porte un costume de combat blanc à col croisé bordé de noir  une épée longue à fourreau noir repose sur la table. Cœur de jeu  la vitesse de mise à mort d’un wuxia de premier ordre « une frappe, un résultat », le sang-froid posé de l’épéiste, et l’espace négatif poétique de l’esthétique orientale. Interdits  pas de look 3D gras (gardez strictement le style donghua pur cel-shaded). Pas de chorégraphie de combat bâclée, pas de clipping ni de membres déformés. Pas de sous-titres et pas de dialogue supplémentaire. L’effet à l’encre ne peut apparaître qu’après la marque des 25 secondes, avec le « clic » du fourreau — jamais avant. [Storyboard à timecodes (avec coupes et transitions explicites)] 00:00-00:04 Plan 1 [Un verre en pleine nuit] (morphose par match cut)  la caméra tient un plan bas statique sur le ciel nocturne, une énorme pleine lune brillante en plein centre. La lune s’assombrit et s’estompe peu à peu tandis qu’un bol de vin rond — identique en forme et en taille (vue de dessus de la table) — se matérialise lentement là où était la lune et la remplace entièrement, la lumière de la lune piquetant la surface du vin de fines ondulations. La transition doit être sans couture. La caméra recule ensuite lentement et descend de la vue de dessus au niveau des yeux  l’épéiste est assis à la table de l’auberge et lève lentement le bol. 00:05-00:10 Plan 2 [Intention meurtrière cachée] (transition close-up en dolly in)  le mouvement de l’épéiste se bloque  son regard devient soudain tranchant comme un rasoir. La caméra fonce à vitesse extrême, grossissant son œil jusqu’à ce que la pupille remplisse l’écran — et le cadre se déplie sans couture à l’intérieur de la pupille  très haut au-dessus de la forêt de bambous, un assassin tout de noir serrant une lame courte en prise inversée plonge du ciel comme un faucon, droit sur l’objectif. 00:11-00:18 Plan 3 [Les lames se croisent] (transition par whip pan d’action)  la caméra revient brutalement au cadrage en pied de l’épéiste tandis qu’il bondit de son siège en dégainant son épée. La caméra suit son bras armé dans un violent élan vers la droite du cadre (whip pan), étalant tout l’écran en flou de mouvement horizontal. Dans le flou, la scène saute en plein air et se fige  la longue épée de l’épéiste et la lame courte de l’assassin s’entrechoquent violemment, éclatant en d’énormes étincelles orange et en onde de choc annulaire là où les armes se rencontrent. 00:19-00:24 Plan 4 [Une frappe, un résultat] (occlusion wipe)  les deux se croisent en plein air. L’onde de choc de l’échange soulève une tempête de feuilles de bambou  une énorme feuille émeraude balaie l’objectif latéralement, le recouvrant entièrement et noircissant le cadre. Quand la feuille s’écarte, l’image a déjà coupé sur un plan au niveau des yeux  l’assassin tombe mollement au sol en arrière-plan tandis que l’épéiste, dos à la caméra au premier plan, rengaine lentement sa longue épée. 00:25-00:30 Plan 5 [La note qui persiste] (transition à l’encre)  avec le « clic » de l’épée qui se loge dans son fourreau, toute la forêt de bambous et l’assassin abattu se dissolvent soudain comme une goutte d’encre épaisse tombant dans l’eau, s’étendant en lavis d’encre noir et blanc — et le cadre se fige définitivement dans le paysage d’encre éclaboussée.

Chaque tranche nomme une transition et précise comment elle s’exécute  les contraintes de timing négatives comme « jamais avant » sont ce qui empêche l’effet de brûler la politesse.

03 Références multimodales

La 2.5 ouvre grand les limites de référence  jusqu’à 30 images de référence, et des clips vidéo et audio de référence jusqu’à 30 secondes chacun (consultez l’aide-mémoire des paramètres pour les paliers réellement proposés sur Molyin) — plus le pilotage purement audio pour la première fois. Ce chapitre couvre les quatre scénarios de référence les plus utiles  plans multi-personnes, clonage vocal, transfert créatif et storyboards multi-grilles.

3.1 Références multi-personnes (soigner le problème des jumeaux)

La 2.5 s’est concentrée sur la correction des « jumeaux » et de la « dérive d’échange de visages » dans les scènes multi-personnes, mais l’écriture compte toujours  liez chaque personnage à une image de référence une par une, désignez-les par le même nom tout du long, et ajoutez un verrou global à la fin. Utilisez des photos en solo pour les références de personnage — jamais de collages multi-vues.

[Liaison des personnages] + [Relations et actions] facultatives + [Verrou global]

Requis

Liaison des personnages

« L’apparence du personnage A référence l’Image 1, celle du personnage B référence l’Image 2 » — une image de référence en solo par personnage, chacun nommé à son tour.

Facultatif

Relations et actions

Énoncez les relations spatiales et les interactions  « A tend un verre d’eau à B », « quatre personnes dansent en synchronie à un espacement fixe. »

Facultatif

Verrou global

Clôturez par « les traits du visage et la garde-robe de chaque personnage restent cohérents avec les images de référence tout du long — pas d’échange de visages, pas de substitution, pas de distorsion. »

Danse de rue rétro à quatre

Prompt

Un court métrage joyeux sur une rue de ville rétro en animation de dessin animé américain (la scène référence l’Image 5). Les apparences, tenues et traits du visage des quatre jeunes danseurs référencent respectivement l’Image 1, l’Image 2, l’Image 3 et l’Image 4  les quatre dansent en synchronie sur la rue piétonne rétro, leurs mouvements corporels serrés et continus, l’espacement entre eux fixe. Le choc froid-chaud des néons de la rue reste unifié tout du long  caméra frontale verrouillée avec un lent mouvement de tracking latéral. Chaque détail de costume, trait du visage et forme du corps reste hautement cohérent avec les images de référence tout du long — pas d’échange de visages, pas d’échange de mouvements, chaque identité se poursuit, mouvement fluide sans clipping ni distorsion, dans un look de dessin animé rétro.

Nécessite 5 images de référence (4 personnages + 1 scène)  les recommandations officielles sont de 1 à 8 images de sujet pour les meilleurs résultats — au-delà, la stabilité baisse et vous relancez.

3.2 Références vocales

Uploadez un clip vocal propre et sans bruit comme audio de référence et le modèle clone son caractère vocal avec une haute fidélité — même la tension émotionnelle et le rythme de parole se transfèrent  un discours enflammé, un ton de présentatrice glacé, un murmure ensommeillé, tout fonctionne. Dans le prompt, nommez-le directement — « la voix référence l’Audio N » — et ajoutez une direction émotionnelle pour un contrôle fin.

Le murmure d’un détective par nuit pluvieuse

Prompt

Sur un toit ruisselant de pluie, scintillant de néons la nuit, le détective privé de l’Image 1 s’appuie contre la rambarde et lève lentement la tête vers la caméra, la pluie dégouttant de son trench-coat. De la voix d’Audio 1, il dit, à voix basse  « Je vous ai trouvé. » Gardez l’intonation basse et suspensive d’Audio 1, son rythme de respiration et sa texture grave, avec les mouvements des lèvres strictement synchronisés à la prononciation. Le seul son ambiant est la pluie et la circulation au loin — pas de musique de fond, pas de sous-titres.

Nécessite 1 image de référence de personnage + 1 clip audio de référence  « gardez l’intonation et le rythme de respiration d’Audio 1 » est la formulation clé d’un clonage haute fidélité.

3.3 Transfert créatif (pas seulement un transfert de mouvement)

La 2.5 fait passer la compréhension de la vidéo de référence de « l’imitation de mouvement » au « transfert créatif »  au-delà de la dynamique du corps, elle peut saisir le langage caméra de la source, sa logique de couleurs, son ton émotionnel, même son feeling viral internet. La clé est de décrire le noyau que vous voulez transférer — « le vibe mignon », « le timing comique », « le rythme de montage » — pas seulement le mouvement de surface.

La journée joueuse d’un shiba noir

Prompt

Référencez les expressions animées mignonnes, l’allure, les mouvements et le schéma créatif du Shiba Inu dans Video 1 pour créer un court métrage du Shiba Inu noir d’Image 1, en capturant précisément l’état joueur et vif du chien dans la vidéo de référence. Le décor est un salon lumineux à la lumière naturelle douce, la caméra suivant doucement les mouvements du chien. Gardez la couleur du pelage et les traits physiques du shiba noir d’Image 1 inchangés  l’ambiance est chaleureuse et apaisante.

Nécessite 1 vidéo de référence + 1 image de sujet  « capturer précisément l’état/l’allure de… » déclenche un transfert de niveau créatif bien mieux que « faire les mêmes mouvements ».

3.4 Storyboards multi-grilles

Uploadez une image de storyboard multi-grilles (un simple dessin au trait ou des bonhommes allumettes suffisent) comme squelette de l’intrigue, et le modèle génère une vidéo cohérente qui suit strictement le plan de plans. Quatre étapes  présentez d’abord ce que représente chaque case, puis liez les designs des sujets à leurs images de référence, puis remplissez la composition, la taille de plan, le mouvement de caméra et l’action de chaque plan, et enfin le style global et les interdits.

Un chat errant trouve un foyer (storyboard 9 grilles)

Prompt

L’Image 1 est un storyboard de film complet contenant 9 plans consécutifs  chaque case représente un plan complet, formant ensemble une narration cinématographique complète, chaleureuse et apaisante. La femme d’âge moyen référence l’Image 2  une femme de 40 à 50 ans, style CG de film d’animation 3D, peau claire, courts cheveux bouclés brun foncé, grands yeux, visage doux et gentil, toujours avec un sourire naturel. Elle porte un cardigan tricoté jaune pâle sur une couche blanche et une jupe longue bleue aux chevilles — un look de mère au foyer  son apparence, sa garde-robe et ses proportions restent cohérentes tout du long. Le chaton référence l’Image 3  un chaton tabby orange et blanc, rond et chibi, style CG de film d’animation 3D, grands yeux, nez rose, fourrure douce et duveteuse. Il porte un bonnet tricoté jaune et un sac en tissu vert à cordon — adorable et attendrissant  son pelage, sa tenue et ses proportions restent cohérents tout du long. Plan 1 (0-3 s)  le soir dans un quartier résidentiel  un medium shot en contre-plongée se rapproche lentement tandis que le chaton errant saute sur une poubelle au bord du trottoir, soulève le couvercle avec ses pattes avant et y plonge la tête en cherchant de la nourriture. Lumière chaude du couchant sur la rue  l’ambiance est un peu solitaire mais réelle. Plan 2 (3-5 s)  un close shot se rapprochant légèrement de la poubelle  le chaton saisit le bord avec ses deux pattes et fouille à l’intérieur, les oreilles qui frémissent, les yeux concentrés — la faim et le désarroi au premier plan. Plan 3 (5-9 s)  un medium shot verrouillé à l’entrée de l’immeuble  la femme se tient à la porte avec de la nourriture et repère le chaton. Le chaton se retourne vers elle, méfiant mais sans s’enfuir — leur premier contact visuel. Plan 4 (9-12 s)  un medium shot en pied  le chaton se tient dans la cour ouverte et s’approche lentement du pas de la porte, l’espoir dans les yeux. Plan 5 (12-16 s)  la caméra descend au niveau des yeux du chat  la femme s’accroupit et pose doucement le bol de nourriture devant le chaton, qui baisse immédiatement la tête pour manger, la queue se balançant légèrement, tandis que la femme regarde en souriant — le cadre plein de chaleur. Plan 6 (16-20 s)  un medium shot en tracking  la femme sort lentement de la cour en portant un panier de légumes, le chaton suivant tranquillement à côté d’elle, toujours à un demi-pas derrière. Plan 7 (20-23 s)  à la porte intérieure, la femme ouvre lentement la porte  une lumière jaune chaude se répand, formant un contraste chaud-froid avec le soir dehors. Plan 8 (23-26 s)  un medium shot de derrière et de côté  la femme se retourne, sourit et fait un petit signe de la main, invitant le chaton à rentrer. Le chaton se tient sur le seuil, la regardant, les oreilles dressées, la queue qui se balance, hésitant avant d’accepter progressivement l’invitation. Plan 9 (26-30 s)  la caméra recule lentement  la femme attend patiemment à la porte tandis que le chaton fait enfin un pas en avant et la suit à l’intérieur, la lumière jaune chaude étirant longuement leurs deux silhouettes tandis que la porte se referme lentement — le cadre reposant sur la cour calme et chaleureuse. Utilisez un style CG de film d’animation Pixar, des matériaux physiques PBR, un éclairage global de haute qualité, une lumière volumétrique douce, une profondeur de champ cinématographique. Mouvement de caméra naturel et stable, comportements des animaux fidèles à la réalité, et continuité du temps, de l’espace, des positions des personnages et de l’éclairage entre les plans. Pas d’échange de visages, de distorsion ou d’erreurs de proportions sur les personnages  pas de personnes, d’animaux ou d’accessoires supplémentaires sans rapport.

Nécessite 3 images de référence (storyboard + femme + chaton)  les timecodes plan par plan se mappent un à un sur les grilles du storyboard pour une fidélité maximale.

04 Voix et langues

La 2.5 brise la barrière des langues  optimisation ciblée pour le chinois, l’anglais, l’espagnol, l’indonésien et le malais, plus une couverture complète du thaï, de l’arabe, du portugais, du vietnamien, du japonais et du coréen — écrire les prompts dans votre langue maternelle et la prononciation des dialogues multilingues sont tous deux bien plus précis. En même temps, les instructions négatives comme « pas de sous-titres / pas de BGM » sont enfin réellement obéies, et la BGM et les voix d’une vidéo de référence peuvent être séparées sans perte.

4.1 Prompts et dialogues multilingues

Écrivez le prompt dans la langue que vous maîtrisez le mieux  quand un personnage doit parler, écrivez ses répliques dans la langue cible et la synchro labiale correspondra à la prononciation de cette langue. Pour les publicités visant un marché précis, pensez à ajouter une contrainte de langue  toute la signalétique, les sous-titres et les logos unifiés dans la langue cible, sans texte étranger mélangé.

Une publicité japonaise pour un restaurant de ramen à Tokyo

Prompt

Le style global est celui d’une vraie publicité commerciale  photographie cinématographique, éclairage jaune chaud, atmosphère de Tokyo la nuit, langage visuel naturel et fluide. Plan 1 (0-3 s)  la caméra se rapproche lentement d’une rue de Tokyo la nuit (la vue de la rue référence l’Image 1) vers l’entrée d’un restaurant de ramen (la devanture référence l’Image 2). L’enseigne du restaurant, les lanternes, le panneau des horaires et le menu sont tous en japonais naturel et correct — pas de chinois, d’anglais ou de texte illisible nulle part. Plan 2 (3-7 s)  la caméra entre à l’intérieur, où le commis (l’apparence référence l’Image 3) se tient dans la cuisine ouverte, sourit à la caméra et dit en japonais naturel et courant  « Bonjour, voulez-vous un bol de notre tonkotsu ramen maison  » Les formes de sa bouche restent strictement synchronisées à la prononciation japonaise, la voix naturelle, avec les caractéristiques d’un vrai locuteur masculin japonais. L’arrière-plan garde les sons ambiants réels des nouilles qui bouillent, de la vapeur et des ustensiles qui tintent. Plan 3 (7-11 s)  coupe sur un close-up du ramen (référence l’Image 4), la vapeur montant en continu, le chashu oscillant légèrement, l’huile du bouillon s’écoulant naturellement. Un texte de marque apparaît à l’écran, tout en japonais naturel et correct  « Une saveur riche, un bol de bonheur », dans une typographie fidèle au design des publicités commerciales japonaises. Plan 4 (11-15 s)  le client (l’apparence référence l’Image 5) est assis à la table, goûte le ramen, s’illumine d’un sourire satisfait et dit naturellement à la caméra  « C’est vraiment délicieux — je reviendrai, c’est sûr  » La voix garde une prononciation japonaise naturelle avec une synchro labiale précise. Le logo de la marque (référence l’Image 6) et un slogan japonais apparaissent  « Un bol dont j’ai envie chaque jour. » Toute la signalétique, les menus, les affiches et les logos restent unifiés en japonais — aucune autre langue mélangée  chaque ligne de dialogue de la vidéo est en japonais, et aucun sous-titre ou doublage chinois ne peut être généré. Les identités des personnages restent cohérentes — le commis et le client n’échangent jamais de visages ni de tenues.

Nécessite 6 images de référence (rue / devanture / commis / ramen / client / logo)  la contrainte « tout dans la langue cible, aucun texte mélangé » doit être écrite en toutes lettres.

4.2 Bases propres et séparation de la BGM

La 2.5 améliore nettement la stabilité de génération, et l’instruction négative « pas de sous-titres, pas de BGM » atterrit enfin avec une forte probabilité — la base propre que la post-production commerciale attend est là. Dans l’autre sens, pour une vidéo de référence avec du son, une ligne — « retirez la musique de fond, gardez les voix » — sépare sans perte les pistes audio en préservant parfaitement l’image et les sous-titres d’origine.

Présentation de tenues e-commerce silencieuse

Prompt

Une vidéo e-commerce verticale 9:16 de présentation de tenues, contre un fond de studio seamless blanc pur et minimaliste (la mise en page référence l’Image 1), la mise en page fixe à deux colonnes tenue de bout en bout  à gauche du cadre, trois modules rectangulaires à fines bordures noires arrondies empilés verticalement, chacun surmonté d’un chiffre noir en serif (1, 2, 3), chaque module contenant une flat lay de la pièce correspondante avec une petite étiquette « 1x » dessous  à droite, une jeune mannequin féminine se tient en pied présentant la tenue en vrai — caméra fixe en pied à hauteur des yeux, éclairage de studio doux et uniforme, pas d’ombres dures, textures des tissus nettes et fines. La mannequin garde une pose naturelle et élégante avec quelques mouvements lents — une main qui se lève pour ajuster le vêtement, un déplacement de posture — le style global propre et premium. Absolument aucun texte, slogan, filigrane, logo ou annotation supplémentaire à aucun moment  pas de musique de fond, pas de voix off, pas de bruit ambiant — une image purement visuelle, totalement silencieuse  la caméra reste fixe, sans push, pull, pan ou tilt, et la structure de la mise en page reste inchangée de bout en bout.

Nécessite 1 image de référence de mise en page, et l’interrupteur audio est déjà éteint pour vous au moment de la génération  le trio « pas de sous-titres + pas de BGM + silence » s’exécute enfin de manière fiable sur la 2.5.

Retirer la BGM, ne garder que la voix

Prompt

Retirez toute la musique de fond de Video 1, en ne gardant que les voix des personnes qui parlent et le bruit ambiant. Les voix doivent garder leur timbre, leur ton, leur respiration et leurs détails d’origine  l’image, les personnes, les sous-titres, la qualité d’image, l’étalonnage et la composition restent tous complètement inchangés — ne modifiez aucun contenu visuel.

Nécessite 1 vidéo de référence avec des voix  c’est le geste par excellence pour les edits de fans, le nettoyage d’interviews et l’échange de doublages multilingues.

05 Édition, modèles blancs et fond vert

Seedance 2.5 pratique une chirurgie de précision sans toucher au reste du plan  suppression et remplacement locaux, rendu de modèle blanc en film fini, échanges de fond vert, et transitions sans couture entre deux vidéos. Pour les réécritures en une instruction d’un clip source — ajouter, retirer, changer, remplacer le fond — passez au modèle Seedance 2.5 Video Edit  uploadez un clip source de 3 à 15 secondes en mode édition vidéo, et la durée et le format de sortie suivent la source. Les jeux multi-assets — rendu de modèle blanc, composition d’un sujet sur fond vert dans une nouvelle scène, transitions entre deux vidéos — restent en mode référence vers vidéo avec votre métrage attaché comme références. Une discipline s’applique dans les deux cas  gardez des mots comme éditer, étendre ou continuer hors des prompts ordinaires de référence vers vidéo, sinon la tâche est mal lue — quand vous voulez une véritable édition ou extension, utilisez le modèle dédié.

5.1 Suppression et remplacement locaux

Le cœur de la formule d’édition est d’énoncer « de A à B »  la cible d’édition exacte + l’action et le changement + le moment où il prend effet. Verbes de travail  ajouter, retirer, modifier/remplacer/changer en. Associez à des timecodes pour verrouiller la plage temporelle de l’édition — sans eux, l’édition s’applique à tout le clip.

[Cible d’édition exacte] + [Action et changement] + [Moment d’effet] facultatif

Requis

Cible d’édition

Verrouillez la cible  « la femme à gauche dans la vidéo », « le verre sur la table », « le titre anglais vert » — plus c’est spécifique, moins il y a de dommages collatéraux.

Requis

Action et changement

Émettez la commande  de A à B — « retirez-le et remplissez naturellement le fond », « remplacez par un pantalon de costume noir. »

Facultatif

Moment d’effet

« Appliquez le changement de manière cohérente sur tout le clip » ou « uniquement pendant les secondes 5-8 » — verrouiller la timeline évite les ruptures de continuité.

Retirer les personnes en trop

Prompt

Retirez la femme à gauche et l’homme à droite de Video 1, en ne gardant que la femme au centre, ses mouvements inchangés. Remplissez naturellement les zones supprimées pour correspondre à l’éclairage et à la perspective du métrage d’origine, sans laisser de traces fantômes ni de zones floues  chaque autre partie de l’image, la composition et le mouvement de caméra restent exactement les mêmes.

Nécessite 1 vidéo source  nommez qui reste et qui part par position, ajoutez une ligne sur le remplissage propre — c’est la recette au plus haut taux de réussite pour une suppression invisible.

Recolorer la tenue + retirer un texte

Prompt

Retirez complètement le titre anglais vert qui apparaît dans Video 1, et modifiez le survêtement bleu porté par la personne qui fait des étirements de dos en survêtement rouge — ne changez que la couleur du vêtement. Retirez aussi complètement les accessoires de fitness en trop en arrière-plan  le kettlebell bleu à droite et le tapis d’équilibre bleu à gauche. La personne elle-même, sa peau, sa tête, ses mains et ses pieds, sa posture, ses exercices, le tapis de yoga, la moquette, le mur et le cadre de la caméra restent tous inchangés. Après le retrait du texte et des accessoires, les zones qu’ils couvraient doivent être remplies naturellement — pas de fantôme de texte, pas de zones floues, pas de restes d’accessoires. Le survêtement rouge doit rester stable pendant que la personne se retourne, lève une jambe et s’étire, en conservant les plis et la texture de tissu d’origine du vêtement.

Nécessite 1 vidéo source  plusieurs cibles d’édition peuvent tenir dans un seul prompt, mais chaque cible a besoin de son propre « changer en quoi » clair.

5.2 Rendu de modèle blanc

Uploadez une animation de modèle blanc (gray-box) exportée de Maya/Blender comme vidéo de référence, et l’IA rend le film final à partir de votre prompt — mouvements de caméra, blocage et trajectoires suivent strictement le modèle blanc, tandis que les matériaux, l’éclairage et les personnages viennent de vos mots. Les modèles blancs grossiers (primitives géométriques simples) fonctionnent le mieux aujourd’hui  énoncez « déclaration de référence + quel modèle correspond à quel personnage + intrigue détaillée + traitement de la scène + récapitulatif global ». Pour les modèles blancs avec membres ou ailes, écrivez toute la séquence de mouvement ou ils sortiront raides.

Modèle blanc en reine elfe

Prompt

Référencez le mouvement de caméra et les changements d’éclairage physiques de Video 1, et remplacez précisément le modèle blanc de la vidéo par la reine elfe d’Image 1. Son apparence suit strictement l’image  longs cheveux blanc argenté, robe magnifique brodée blanc et or, et un bâton magique surmonté d’un cristal lumineux — gardez le personnage cohérent, sans clipping, sans changement de visage. Le décor est un grand hall elfique, en conservant la scène de Video 1. Les positions de caméra correspondent à la vidéo d’origine, et la reine elfe lève gracieusement son bâton magique en suivant les mouvements du modèle dans la vidéo de référence. Pendant qu’elle bouge, ses cheveux blanc argenté et la large jupe de sa robe blanche s’écoulent naturellement avec les courants d’air, soyeux avec un vrai drapé. En même temps que le mouvement, les effets d’éclairage de la vidéo de référence se transforment en un pilier de lumière sacré montant du sol, en écho à l’éclat doré éblouissant du bâton dans sa main. La vidéo finale exige une qualité CG photoréaliste de niveau cinéma, un éclairage sacré et épique, une image haute définition, une peau finement détaillée, des textures métalliques nettes sur le costume, des détails riches et un mouvement fluide et naturel.

Nécessite 1 vidéo de modèle blanc + 1 image de référence de personnage  « remplacez précisément le modèle blanc par le personnage de l’Image N » est la formulation centrale du rendu de modèle blanc.

5.3 Génération et remplacement sur fond vert

Les deux directions sont supportées  transformer le fond d’une vidéo ordinaire en fond vert (pour pouvoir la composer vous-même en post), ou composer sans couture une personne de métrage sur fond vert dans une toute nouvelle scène — séparation du premier plan jusqu’aux cheveux individuels, avec la perspective et l’éclairage de la personne automatiquement fondus dans le nouveau fond, sans scintillement, sans saut.

Fond vert en un clic

Prompt

Transformez tout le fond blanc de la vidéo en un fond vert pur. Les mouvements de la personne, les éléments du premier plan et la composition du cadre restent inchangés  les bords de la personne sont propres, sans frange blanche résiduelle, et le détail des cheveux reste intact. Retirez l’audio et gardez le silence.

Nécessite 1 vidéo source, et l’interrupteur audio est déjà éteint pour vous au moment de la génération  une fois le fond vert obtenu, changez le fond dans n’importe quel logiciel de montage.

5.4 Transitions sans couture entre deux vidéos

Uploadez les clips avant et après, et le modèle génère automatiquement les frames de pont qui comblent l’écart — sans modifier le métrage source. Les techniques avancées comme les transitions déclenchées par action, les tirées de regard et les occlusions wipes sont toutes supportées. Votre prompt n’a besoin de décrire que ce qui se passe à la jonction.

Une carpe franchit la porte du dragon

Prompt

Joignez sans couture Video 1 et Video 2 sans modifier ni l’une ni l’autre. La carpe de la frame finale de Video 1 commence à nager rapidement vers l’avant, puis saute vite hors de l’eau dans les airs, où une porte de pierre ancienne et massive apparaît  la carpe franchit la porte dans les nuages et la brume, se transforme finalement en dragon, et le plan se connecte à Video 2.

Nécessite 2 vidéos (les clips d’ouverture et de clôture)  la ligne « sans modifier les vidéos sources » est obligatoire, et la description de la transition ne couvre que le segment du milieu manquant.

Aide-mémoire des paramètres Seedance 2.5 (vs 2.0)

Voici tous les paliers réellement proposés pour Seedance 2.5 dans le générateur Molyin, en regard de la 2.0 Standard.

Seedance 2.5Seedance 2.0
ModesTexte vers vidéo / Image vers vidéo / Référence vers vidéoTexte vers vidéo / Image vers vidéo / Référence vers vidéo
Résolutions480p / 720p / 1080p480p / 720p / 1080p / 4k
Durée4–30 s4–15 s
Formats16:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:116:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:1
AudioSupportéSupporté
Première/dernière imageSupportéSupporté
Images de référence1–91–9
Vidéos de référenceJusqu’à 3Jusqu’à 3
Audio de référenceJusqu’à 3Jusqu’à 3
Rendre la dernière imageSupportéSupporté

FAQ

Les huit façons les plus courantes de rater un clip — et les correctifs que nous avons vérifiés.