01 La fórmula base
La comprensión de Seedance 2.5 de las indicaciones estructuradas sube otro nivel: un prompt completo se construye con cuatro capas — descripciones de assets, un resumen en una frase, la trama detallada y un cierre global. Este capítulo monta primero el esqueleto y luego te entrega la fórmula de personas reales validada oficialmente — diseñada a propósito para curar la «cara de IA» y la piel de plástico.
1.1 La fórmula completa del prompt
Un prompt completo de Seedance 2.5 = descripciones de assets + resumen en una frase + trama detallada + cierre global. Omite la primera capa si no subiste assets; divide la trama en segmentos siguiendo una línea de tiempo o un arco narrativo; y coloca el cierre global al final, reforzando lo que atraviesa toda la película y lo que no debe aparecer (subtítulos, música de fondo).
[Descripciones de assets] + [Resumen en una frase] + [Trama detallada] + [Cierre global]
Resumen en una frase
Sujeto + lugar + acontecimiento + género/estilo + algún movimiento de cámara especial — una frase que fija el tono de la película.
Trama detallada
Escribe siguiendo una línea de tiempo o un arco narrativo: cada plano lleva su contenido visual, movimiento de cámara, acciones, diálogos y efectos de sonido — más lo que no quieres (descripciones negativas).
Descripciones de assets
Numera tus assets en el orden de subida e indica para qué sirve cada uno: la apariencia de un personaje, una voz, un movimiento o un escenario. Sin assets de referencia, esta capa entera puede omitirse.
Cierre global
Al final, refuerza los detalles que atraviesan toda la película: posición de cámara, rasgos del entorno, luz y atmósfera — o prohibiciones globales (subtítulos, música de fondo).
Un documental de grullas de corona roja en el humedal
Prompt
Estilo de documental de naturaleza fotorrealista con iluminación cinematográfica y fiel a la realidad. En la neblina de primera hora de la mañana, en un vasto humedal de juncos (el escenario sigue la Imagen 1), una elegante grulla de corona roja (apariencia según la Imagen 2) despliega las alas en una danza — plumas blancas como la nieve, una corona de un rojo vivo, una silueta alta y esbelta. El escenario es un humedal otoñal de aguas someras, el agua reluciente, rodeado de juncos dorados, lentejas de agua y plantas acuáticas, con niebla matinal a lo lejos y el sol naciente suavemente desenfocado al fondo. Plano medio en ángulo bajo con un sutil aire de cámara en mano, mayormente fija, manteniendo la grulla centrada en todo momento. 0s-3s: La grulla permanece inmóvil en el agua somera y despliega lentamente sus anchas alas blanquinegras; el movimiento es suave y la corriente de aire de sus aleteos ondula la superficie. Sopla una brisa matinal; la luz del sol entra en diagonal desde el horizonte y atraviesa la neblina con efecto Tyndall. 3s-8s: La grulla brinca con ligereza sobre el agua, sus patas rozan la superficie por turnos y levantan salpicaduras cristalinas. Su largo cuello se arquea hacia atrás, el pico apuntando al cielo; luego aterriza con suavidad, pliega las alas, pasea la mirada con gracia a su alrededor y lanza un canto claro y resonante. La cámara baja acompaña con suavidad los brincos de la grulla arriba y abajo, con profundidad de campo natural y los juncos del primer término suavemente desenfocados. Solo sonido ambiente de la naturaleza: agua que fluye, aleteos poderosos y el canto de la grulla — sereno, etéreo y hermoso.
Requiere 2 imágenes de referencia (escenario + sujeto); abre con una frase que fije el tono, desglosa la trama por línea de tiempo en el medio y cierra con la atmósfera global — la estructura de cuatro capas se lee de un vistazo.
1.2 La fórmula de personas reales (curar la cara de IA)
2.5 ha rebajado muchísimo el «aspecto de IA», pero cómo escribes sigue siendo el factor decisivo para personas fotorrealistas. La fórmula de siete dimensiones validada oficialmente descompone a una persona en edad/etnia, textura de la piel, detalles faciales, ojos, cabello, vestuario y complexión/presencia — los ojos son el alma, y el sufijo de fidelidad «conserva los poros finos reales y la textura de la piel» es casi obligatorio.
[Edad/Etnia] + [Tono/Textura de piel] + [Detalles faciales] + [Ojos/Alma] + opcional [Cabello] [Vestuario] [Complexión/Presencia]
Edad/Etnia
Edad exacta + nacionalidad/etnia + un adjetivo de estilo + un sustantivo para la forma del rostro, p. ej. «una mujer de Asia oriental de 22 años con un rostro frío y de rasgos clásicos y esculpidos».
Tono/Textura de piel
Tono cálido/frío + sustantivo del tono de piel + adjetivo de textura + el sufijo de fidelidad «conserva los poros finos reales y la textura de la piel» (añadir pecas o pequeñas imperfecciones lo hace aún más real).
Detalles faciales
Forma de los ojos + arco de las cejas + puente de la nariz + forma de los labios + línea de la mandíbula — escribe al menos 3-4 juntos; deciden lo reconocible que resulta la persona.
Ojos/Alma
Un adjetivo para la mirada + el mensaje o la metáfora que transmiten los ojos + la emoción subyacente — esto determina el rango emocional del personaje.
Peinado/Color
Color de pelo exacto + estado/textura + un sustantivo para el peinado + interacción con el entorno (mecido por la brisa, etc.).
Vestuario/Textura
Corte y confección + color + sustantivo de la prenda + material del tejido y estado de uso + cómo se lleva — el vestuario construye al personaje de forma indirecta.
Complexión/Presencia
Rasgos de la complexión y los hombros + requisito de encuadre + postura y dirección de la mirada + una palabra para la atmósfera general.
Primer plano de una belleza clásica
Prompt
Una mujer de Asia oriental de 22 años con un rostro dulce y clásico hecho para el cine. Piel clara de tono frío con una textura fina y tersa, conservando los poros finos reales y la textura de la piel. Ojos rasgados en forma de flor de melocotón (los bordes ligeramente húmedos), cejas suavemente relajadas, una nariz pequeña y recta, labios llenos con una sonrisa tierna, tenue, apenas perceptible, y una línea de mandíbula de trazo suave. Su mirada es profundamente afectuosa y llena de sentimiento, un remanso de agua de primavera tras sus ojos — tierna, concentrada, cargada de un apego profundo y un rastro de renuencia. El cabello negro azabache está recogido en un moño clásico bajo, elegante y sin esfuerzo, sujeto por una sola horquilla de jade sencilla, con unos pocos mechones finos sueltos sobre las mejillas que se agitan con la brisa. Viste una túnica minimalista de cuello cruzado en blanco liso, de seda discreta y de suave lustre, con el cuello ligeramente entreabierto. Su complexión es esbelta, sus hombros estrechos, y irradia un aire dulce, melancólico, de romanticismo clásico. Encuadre en primer plano, los ojos mirando directamente al objetivo, luz natural suave, poca profundidad de campo.
Funciona como texto a video puro; la misma escritura sirve también para personajes animados — solo cambia el lenguaje de «piel fotorreal» por el estilo artístico objetivo.
02 Marcas de tiempo y el plano secuencia de 30 segundos
La mejora estrella de Seedance 2.5: una sola generación se duplica de 15 a 30 segundos, y las marcas de tiempo al segundo se admiten de forma nativa — puedes especificar exactamente qué ocurre en qué segundo y dónde cae cada corte, con precisión de guion. Este capítulo enseña la estructura de tres capas para videos largos y la fórmula de transiciones.
2.1 Guiones de planos con marcas de tiempo
El núcleo de la fórmula de video largo es trocear la película en segmentos de tiempo: cada segmento detalla «segundo inicial–final + tema de la etapa + indicaciones físicas de acción/expresión + subtexto emocional». El subtexto le explica a la IA por qué lo diseñaste así — escríbelo y el matiz actoral cambia como de la noche al día. Antes de los segmentos, no olvides el bloque «[Configuración global]»: entorno y textura, estilo visual, lenguaje de cámara, diseño de personajes, núcleo interpretativo y prohibiciones.
[Segundo inicial–Segundo final] + [Tema de la etapa] + [Indicaciones de acción/expresión] + opcional [Subtexto emocional]
Segmento de tiempo
Segundos de inicio y fin explícitos (p. ej. 0-3s, 00:08-00:15) — 2.5 ejecuta con precisión de segundo.
Acción/Indicaciones físicas
Tamaño de plano + composición + los movimientos detallados del personaje — todo lo que la imagen debe seguir estrictamente en este segmento.
Tema de la etapa
Ponle nombre al segmento (p. ej. «Insistencia», «Resignación») para ayudar al modelo a fijar la clave emocional del párrafo.
Subtexto emocional
Explícale a la IA la intención detrás de las indicaciones físicas, p. ej. «ella no se está desahogando — está esperando una respuesta».
Plano secuencia de 29 segundos: una despedida junto al río
Prompt
Plano secuencia de 29 segundos (una mujer con vestido de época se despide junto al río) [Configuración global de la escena] Entorno base: la orilla de un río al amanecer, una pequeña barca desenfocada al fondo — una escena de despedida solitaria. La atmósfera es silenciosa y contenida. Estilo visual: cinematográfico, poca profundidad de campo (fondo limpio y desenfocado), luz natural suave. Lenguaje de cámara: mantén durante todo el video un primer plano cerrado sobre la mujer, como desde el punto de vista subjetivo del hombre que está frente a ella. Un sutil aire de respiración de cámara en mano, sin cortes rápidos. Diseño de personaje: una mujer de Asia oriental de 22 años con un rostro dulce y clásico hecho para el cine. Piel clara de tono frío con una textura fina y tersa, conservando los poros finos reales y la textura de la piel. Ojos rasgados en forma de flor de melocotón (los bordes ligeramente húmedos), una nariz pequeña y recta, labios llenos con una sonrisa tierna, tenue, apenas perceptible. Su mirada es profundamente afectuosa y llena de sentimiento, un remanso de agua de primavera tras sus ojos. Cabello negro azabache recogido en un moño clásico bajo, sujeto por una sola horquilla de jade sencilla. Viste una túnica minimalista de cuello cruzado en blanco liso, de seda suave y lustrosa. Una silueta esbelta que irradia un aire dulce, de romanticismo clásico. Núcleo interpretativo: contenido y de grano fino. Concéntrate en el vaivén de la mirada, el subir y bajar de su respiración, el leve temblor de sus labios, la tensión y distensión de sus cejas, el tragar de su garganta y el deslizarse natural de las lágrimas. Prohibiciones: nada de sollozos exagerados, nada de cortes rápidos, nada de grandes movimientos corporales, nada de diálogos adicionales ni música de fondo, y las lágrimas no deben caer antes de tiempo. [Storyboard de emoción y acción (creciendo a lo largo de 0-29 segundos)] Etapa 1, 0-3s [Insistencia]: mira directamente al objetivo, aún sin lágrimas en los ojos, el ceño apenas fruncido, los labios entreabriéndose mientras murmura en voz baja: «¿De verdad tienes que irte?» Subtexto: no se está desahogando — está esperando que él diga en voz alta una respuesta que ella adivinó hace tiempo. Etapa 2, 3-10s [Resignación]: su mirada se desvía lentamente hacia el vacío junto a ella, los párpados descienden, las comisuras de sus labios se estiran en una breve sonrisa amarga que se desploma al instante; sus fosas nasales se tensan ligeramente, toma la más mínima bocanada de aire contenida, su pecho se eleva una vez. Subtexto: con ese gesto está obligando al dolor y a la amargura a volver a bajar. Etapa 3, 11-17s [Recuerdo]: la cámara avanza ligeramente. Ella vuelve los ojos y recorre despacio, con cuidado, el rostro de él. Los bordes de sus ojos están rojos, pero las lágrimas se contienen con fuerza — no cae ni una gota. En medio, una pausa de 0,5 segundos de silencio absoluto: sus labios se agitan una vez y se cierran con fuerza, su barbilla se tensa, su garganta se mueve apenas. Subtexto: esta mirada no es un adiós — está grabando su rostro en la memoria por última vez, para toda la vida. Etapa 4, 18-23s [Lamento]: baja los ojos y, sin previo aviso, una sola lágrima cae directa sobre su cuello. No la seca; cuando vuelve a alzar la vista, la súplica de su mirada se ha convertido en una pena profunda. El ceño fruncido empieza a aflojarse, y niega con la cabeza — apenas — una vez. Subtexto: la ceja que se relaja señala liberación interior; ese mínimo gesto de negación es un último e impotente rechazo del destino. Etapa 5, 24-29s [Dejar ir]: la cámara avanza hasta un primerísimo primer plano. Ella se esfuerza en dibujar una sonrisa suave (sin rastro de autoburla), y justo cuando llega a las comisuras de sus labios, una segunda lágrima resbala desde el rabillo del ojo, pasa junto a la nariz y se detiene en su labio. Con una voz casi inaudible que lucha por mantener firme, dice: «Vete.» La sonrisa queda congelada en su rostro mientras las lágrimas siguen resbalando, su mirada sin apartarse nunca de él. La cámara descansa finalmente sobre su rostro — sonriendo entre lágrimas, sus ojos llenos únicamente de pena.
Configuración global más storyboard con marcas de tiempo es el esqueleto estándar de un plano secuencia de 30 segundos; las prohibiciones de tiempo como «las lágrimas no deben caer antes de tiempo» son exactamente la precisión que solo 2.5 puede sostener.
2.2 Cortes y fórmula de transiciones
Para la narrativa multiplano, escribe las indicaciones de transición directamente dentro de los segmentos con marca de tiempo. Una especificación de corte = tipo de transición + restricciones base + lógica del corte. Transiciones habituales: corte natural, fundido de entrada/salida, encadenado, destello blanco/destello negro, barrido por oclusión (un objeto cubre el objetivo, la imagen se va a negro y luego se aparta), morph con match cut (una luna llena se convierte en un cuenco de vino), latigazo de acción (whip pan), relevo dinámico (un cambio de vestuario), dolly in/out (de la pupila a la escena), transición de tinta china. También puedes ofrecer candidatas y dejar que el modelo elija: «entre corte natural / barrido por oclusión / morph con match cut, elige la que mejor encaje con el estilo de esta película».
[Tipo de transición] + opcional [Restricciones base] + [Lógica del corte]
Tipo de transición
Nombra la transición: «usa un barrido por oclusión en el corte (sin cortes duros, sin objetos que aparezcan de la nada)».
Restricciones base
Mantén en equilibrio la respiración del material y las duraciones; indica qué contienen el plano A y el plano B.
Lógica del corte
Refuerza que «las escenas deben cambiar con naturalidad»; cuando quieras un lenguaje de cámara más rico, añade un cambio de tamaño de plano (p. ej. de primer plano a plano medio).
Anime wuxia de 30 segundos: cinco transiciones seguidas
Prompt
[Configuración global] Entorno base y textura: una posada al aire libre junto al camino, en lo profundo de un bosque de bambú silencioso, de noche. Apunta a un acabado de animación 2D de máximo nivel — la deriva de las hojas de bambú al caer y las ondas en el vino deben obedecer la física real, con la gracia flotante propia del wuxia de estilo chino. Estilo visual: acabado donghua de época premium (3D con cel-shading y render realista), bordes de tinta china. Entrelazado de alto contraste entre luz fría y cálida (la luz de luna azul-blanquecina y desolada contra el fuego amarillo cálido de las velas en la mesa de la posada). Lenguaje de cámara: montaje de corte afiladísimo y varios tipos de transiciones físicamente invisibles, con contraste extremo entre quietud y movimiento. Diseño de personaje: un espadachín de 22 años con el rostro apuesto y esculpido de los héroes del donghua. Cejas como espadas y ojos estrellados, una coleta alta, mechones sueltos sobre la frente. Viste un traje de combate blanco de cuello cruzado con ribetes negros; una espada larga de vaina negra descansa sobre la mesa. Núcleo interpretativo: la velocidad letal del «golpe único» del wuxia de primer nivel, la compostura imperturbable del espadachín y el poético espacio en blanco de la estética oriental. Prohibiciones: nada de acabado 3D grasiento (mantén estrictamente el estilo donghua puro con cel-shading). Nada de coreografía de lucha descuidada, nada de clipping ni extremidades deformadas. Sin subtítulos y sin diálogos adicionales. El efecto de tinta china solo puede aparecer después de la marca de 25 segundos, con el «clic» de la vaina — nunca antes. [Storyboard con marcas de tiempo (con cortes y transiciones explícitos)] 00:00-00:04 Plano 1 [Un trago en la noche tranquila] (morph con match cut): la cámara mantiene un ángulo bajo estático sobre el cielo nocturno, una luna llena enorme y brillante justo en el centro. La luna se atenúa y se desvanece gradualmente mientras un cuenco de vino redondo — idéntico en forma y tamaño (vista cenital de la mesa) — se materializa lentamente donde estaba la luna y la sustituye por completo, la luz de luna salpicada sobre la superficie del vino con finas ondas. La transición debe ser invisible. La cámara luego retrocede despacio y desciende de la vista cenital a la altura de los ojos: el espadachín está sentado a la mesa de la posada y levanta lentamente el cuenco. 00:05-00:10 Plano 2 [Intención asesina oculta] (transición de dolly-in a primer plano): el movimiento del espadachín se detiene en seco; su mirada se vuelve de pronto afilada como una navaja. La cámara avanza a velocidad extrema, magnificando su ojo hasta que la pupila llena la pantalla — y la imagen se despliega sin costuras dentro de la pupila: en lo alto sobre el bosque de bambú, un asesino vestido de negro que empuña una hoja corta en agarre invertido se lanza en picado desde el cielo como un halcón, directo hacia el objetivo. 00:11-00:18 Plano 3 [Las hojas se cruzan] (transición de latigazo de acción con whip pan): la cámara vuelve de un tirón al encuadre de cuerpo entero del espadachín, que salta de su asiento desenvainando la espada. La cámara sigue su brazo armado en un barrido violento hacia la derecha del cuadro (whip pan), emborronando toda la pantalla en un desenfoque de movimiento horizontal. Dentro del desenfoque, la escena salta al aire y se congela: la espada larga del espadachín y la hoja corta del asesino chocan con dureza, estallando en enormes chispas naranjas y una onda expansiva anular en el punto de contacto. 00:19-00:24 Plano 4 [Un golpe certero] (barrido por oclusión): los dos se cruzan en el aire. La onda expansiva del choque levanta una tormenta de hojas de bambú; una enorme hoja esmeralda barre lateralmente el objetivo, cubriéndolo por completo y fundiendo la imagen a negro. Cuando la hoja se aleja, la imagen ya ha cortado a un plano a ras de suelo a la altura de los ojos: el asesino cae desplomado al fondo mientras el espadachín, de espaldas a cámara en primer término, envaina lentamente su espada larga. 00:25-00:30 Plano 5 [La nota que perdura] (transición de tinta china): con el «clic» de la espada al asentarse en su vaina, todo el bosque de bambú y el asesino caído se disuelven de pronto como una gota de tinta espesa al tocar el agua, expandiéndose en aguada de tinta en blanco y negro — y la imagen se congela para siempre dentro del paisaje de tinta salpicada.
Cada segmento nombra una transición y detalla cómo se ejecuta; las restricciones negativas de tiempo como «nunca antes» son lo que evita que el efecto se adelante.
03 Referencias multimodales
2.5 abre de par en par los límites de referencia: hasta 30 imágenes de referencia, y clips de video y audio de referencia de hasta 30 segundos cada uno (consulta la tabla de parámetros para los niveles realmente ofrecidos en Molyin) — más, por primera vez, la generación guiada solo por audio. Este capítulo cubre los cuatro escenarios de referencia más útiles: encuadres con varias personas, clonación de voz, transferencia creativa y storyboards en cuadrícula.
3.1 Referencias de varias personas (arreglar el problema de los gemelos)
2.5 se centró en arreglar los «gemelos» y la «deriva de caras» en escenas con varias personas, pero la escritura sigue importando: vincula cada personaje a una imagen de referencia uno por uno, refiérete a ellos con el mismo nombre en todo el prompt y añade un bloqueo global al final. Usa fotos individuales como referencias de personaje — nunca collages con varias vistas.
[Vinculación de personajes] + opcional [Relaciones y acciones] + [Bloqueo global]
Vinculación de personajes
«La apariencia del personaje A sigue la Imagen 1, la del personaje B la Imagen 2» — una imagen de referencia individual por personaje, cada uno nombrado por turno.
Relaciones y acciones
Detalla las relaciones espaciales y las interacciones: «A le pasa a B un vaso de agua», «cuatro personas bailan sincronizadas a una distancia fija».
Bloqueo global
Cierra con «los rasgos faciales y el vestuario de cada personaje se mantienen consistentes con las imágenes de referencia en todo momento — sin intercambio de caras, sin cambios, sin distorsión».
Street dance retro de cuatro personas
Prompt
Un número corto y alegre en una calle urbana de animación de dibujos americanos retro (el escenario sigue la Imagen 5). Las apariencias, los atuendos y los rasgos faciales de los cuatro jóvenes bailarines siguen respectivamente la Imagen 1, la Imagen 2, la Imagen 3 y la Imagen 4; los cuatro bailan sincronizados en la calle peatonal retro, sus movimientos corporales precisos y continuos, la distancia entre ellos fija. El contraste frío-cálido del neón de la calle se mantiene unificado en todo momento; cámara frontal fija con un lento movimiento de travelling lateral. Cada detalle del vestuario, cada rasgo facial y cada silueta corporal se mantiene altamente consistente con las imágenes de referencia en todo momento — sin intercambio de caras, sin intercambio de pasos, cada identidad se conserva, movimiento fluido sin clipping ni distorsión, con un acabado de animación de dibujos retro.
Requiere 5 imágenes de referencia (4 personajes + 1 escenario); la pauta oficial es 1-8 imágenes de sujeto para los mejores resultados — más allá, la estabilidad cae y acabarás regenerando.
3.2 Referencias de voz
Sube un clip de voz limpio y sin ruido como audio de referencia y el modelo clona su carácter vocal con alta fidelidad — hasta la tensión emocional y el ritmo del habla se transfieren: un discurso encendido, un tono gélido de locutor de noticias, un susurro somnoliento, todo funciona. En el prompt, nómbralo directamente — «la voz sigue el Audio N» — y añade una indicación emocional para el control fino.
El susurro de un detective en una noche de lluvia
Prompt
En una azotea empapada de lluvia y parpadeante de neones por la noche, el detective privado de la Imagen 1 se apoya en la barandilla y alza lentamente la cabeza hacia la cámara, la lluvia goteando de su gabardina. Con la voz del Audio 1 dice, en voz baja: «Te encontré.» Mantén la entonación grave y cargada de suspense del Audio 1, su ritmo de respiración y su textura rasposa, con los movimientos de labios estrictamente sincronizados con la pronunciación. El único sonido ambiente es la lluvia y el tráfico lejano — sin música de fondo, sin subtítulos.
Requiere 1 imagen de referencia de personaje + 1 clip de audio de referencia; «mantén la entonación y el ritmo de respiración del Audio 1» es la formulación clave para una clonación de alta fidelidad.
3.3 Transferencia creativa (no solo transferencia de movimiento)
2.5 eleva la comprensión del video de referencia de «imitación de movimiento» a «transferencia creativa»: más allá de la dinámica corporal, puede captar el lenguaje de cámara de la fuente, su lógica de color, su tono emocional, incluso su aire viral de internet. La clave está en describir el núcleo que quieres transferir — «el rollo adorable», «el timing cómico», «el ritmo de montaje» — y no solo el movimiento superficial.
El día juguetón de un Shiba negro
Prompt
Toma como referencia las expresiones animadas adorables, la actitud, los movimientos y el patrón creativo del Shiba Inu del Video 1 para crear un video corto del Shiba Inu negro de la Imagen 1, capturando con precisión el estado juguetón y vivaz del perro del video de referencia. El escenario es un salón luminoso con luz natural suave, la cámara siguiendo con suavidad los movimientos del perro. Mantén sin cambios el color del pelaje y los rasgos físicos del Shiba negro de la Imagen 1; la atmósfera es cálida y reconfortante.
Requiere 1 video de referencia + 1 imagen de sujeto; «captura con precisión el estado/la actitud de...» activa la transferencia a nivel creativo mucho mejor que «haz los mismos movimientos».
3.4 Storyboards en cuadrícula
Sube una imagen de storyboard en cuadrícula (vale un dibujo lineal sencillo o monigotes) como esqueleto de la trama, y el modelo genera un video coherente que sigue estrictamente el plan de planos. Cuatro pasos: primero presenta qué representa cada viñeta, luego vincula los diseños de los sujetos a sus imágenes de referencia, después rellena la composición, el tamaño de plano, el movimiento de cámara y la acción de cada plano, y por último el estilo global y las prohibiciones.
Un gato callejero encuentra hogar (storyboard de 9 viñetas)
Prompt
La Imagen 1 es un storyboard cinematográfico completo con 9 planos consecutivos; cada viñeta representa un plano completo, y juntas forman una narración cinematográfica completa, cálida y reconfortante. La mujer de mediana edad sigue la Imagen 2: una mujer de entre 40 y 50 años, estilo CG de película de animación 3D, piel clara, pelo corto rizado castaño oscuro, ojos grandes, un rostro dulce y amable, siempre con una sonrisa natural. Viste una rebeca de punto amarillo pálido sobre una capa interior blanca y una falda azul hasta los tobillos — un aspecto de madre de familia; su apariencia, vestuario y proporciones se mantienen consistentes en todo momento. El gatito sigue la Imagen 3: un gatito atigrado naranja y blanco, redondo y de estilo chibi, estilo CG de película de animación 3D, ojos grandes, nariz rosada, pelaje suave y esponjoso. Lleva un gorrito de punto amarillo y carga una bolsita de tela verde con cordón — dulce y entrañable; su pelaje, atuendo y proporciones se mantienen consistentes en todo momento. Plano 1 (0-3s): atardecer en una zona residencial urbana; un plano medio en ángulo bajo avanza lentamente mientras el gatito callejero salta a un cubo de basura junto a la acera, abre la tapa con las patas delanteras y asoma la cabeza buscando comida. Luz cálida de atardecer en la calle; la atmósfera es un poco solitaria pero real. Plano 2 (3-5s): un plano corto que avanza ligeramente hacia el interior del cubo; el gatito se agarra al borde con ambas patas y rebusca dentro, las orejas temblando, los ojos concentrados — el hambre y el desamparo en primer plano. Plano 3 (5-9s): un plano medio fijo en la entrada del edificio; la mujer está en la puerta con comida en las manos y descubre al gatito. El gatito la mira de vuelta, receloso pero sin huir — su primer contacto visual. Plano 4 (9-12s): un plano medio de cuerpo entero; el gatito está de pie en el patio abierto y se acerca lentamente a la puerta, con esperanza en los ojos. Plano 5 (12-16s): la cámara desciende a la altura de los ojos del gato; la mujer se agacha y deposita con suavidad el cuenco de comida frente al gatito, que baja de inmediato la cabeza para comer, la cola meciéndose ligeramente, mientras la mujer observa con una sonrisa — el encuadre lleno de calidez. Plano 6 (16-20s): un plano medio en travelling; la mujer sale despacio del patio cargando una cesta de verduras, el gatito siguiéndola en silencio a su lado, siempre medio paso por detrás. Plano 7 (20-23s): en la puerta interior, la mujer abre lentamente la puerta; una luz amarilla cálida se derrama, formando un contraste cálido-frío con el atardecer de fuera. Plano 8 (23-26s): un plano medio desde atrás y en escorzo; la mujer se gira, sonríe y saluda con suavidad, invitando al gatito a casa. El gatito, de pie en el umbral, la mira hacia arriba, las orejas erguidas, la cola meciéndose, dudando antes de aceptar poco a poco la invitación. Plano 9 (26-30s): la cámara retrocede lentamente; la mujer espera paciente en la puerta mientras el gatito por fin da un paso adelante y la sigue adentro, la luz amarilla cálida estirando las siluetas de ambos mientras la puerta se cierra despacio — la imagen descansa sobre el patio cálido y silencioso. Usa un estilo CG de película de animación de Pixar, materiales físicos PBR, iluminación global de alta calidad, luz volumétrica suave, profundidad de campo cinematográfica. Movimiento de cámara natural y estable, comportamiento de los animales fiel a la vida, y continuidad de tiempo, espacio, posiciones de los personajes e iluminación entre planos. Sin intercambio de caras, distorsión ni errores de proporción en los personajes; sin personas, animales ni objetos adicionales que no vengan al caso.
Requiere 3 imágenes de referencia (storyboard + mujer + gatito); las marcas de tiempo por plano se corresponden una a una con las viñetas del storyboard para la máxima fidelidad.
04 Voz e idioma
2.5 rompe la barrera del idioma: optimización específica para chino, inglés, español, indonesio y malayo, más cobertura completa de tailandés, árabe, portugués, vietnamita, japonés y coreano — tanto escribir el prompt en tu lengua materna como la pronunciación de diálogos multilingües son mucho más precisas. Al mismo tiempo, las instrucciones negativas como «sin subtítulos / sin música de fondo» por fin se obedecen de verdad, y la música de fondo y las voces de un video de referencia pueden separarse sin pérdidas.
4.1 Prompts y diálogos multilingües
Escribe el prompt en el idioma que mejor domines; cuando un personaje deba hablar, escribe sus líneas en el idioma objetivo y la sincronía labial seguirá la pronunciación de ese idioma. Para anuncios dirigidos a un mercado concreto, recuerda añadir una restricción de idioma: toda la rotulación, los textos y los logotipos unificados en el idioma objetivo, sin texto extranjero mezclado.
Un anuncio en japonés para un local de ramen de Tokio
Prompt
El estilo general es el de un anuncio comercial real: fotografía cinematográfica, iluminación amarilla cálida, atmósfera de Tokio de noche, lenguaje visual natural y fluido. Plano 1 (0-3s): la cámara avanza lentamente desde una calle de Tokio de noche (la escena urbana sigue la Imagen 1) hacia la entrada de un local de ramen (la fachada sigue la Imagen 2). El rótulo del local, los farolillos, el cartel de horarios y la carta están todos en japonés natural y correcto — sin chino, inglés ni texto corrupto en ninguna parte. Plano 2 (3-7s): la cámara entra al interior, donde el dependiente (apariencia según la Imagen 3) está de pie en la cocina abierta, sonríe a cámara y dice en un japonés natural y fluido: «Hola, ¿le apetece un tazón de nuestro ramen tonkotsu casero?» Las formas de su boca se mantienen estrictamente sincronizadas con la pronunciación japonesa, la voz natural, con las características de un hablante masculino japonés real. El fondo conserva los sonidos ambientales reales de los fideos hirviendo, el vapor y el tintineo de la vajilla. Plano 3 (7-11s): corte a un primer plano del ramen (sigue la Imagen 4), el vapor subiendo sin cesar, el chashu meciéndose ligeramente, el aceite del caldo fluyendo con naturalidad. Aparece en pantalla el texto de marca, todo en japonés natural y correcto: «Sabor intenso, un tazón de felicidad», con una tipografía fiel al diseño de los anuncios comerciales japoneses. Plano 4 (11-15s): el cliente (apariencia según la Imagen 5) está sentado a la mesa, prueba el ramen, esboza una sonrisa satisfecha y dice con naturalidad a cámara: «¡Está riquísimo! ¡Volveré sin falta!» La voz mantiene una pronunciación japonesa natural con sincronía labial precisa. Aparecen el logotipo de la marca (sigue la Imagen 6) y un eslogan en japonés: «El tazón que me apetece cada día.» Toda la rotulación, cartas, pósteres y logotipos se mantienen en japonés unificado — sin mezclar ningún otro idioma; cada línea de diálogo del video es en japonés, y no debe generarse ningún subtítulo ni doblaje en chino. Las identidades de los personajes se mantienen consistentes — el dependiente y el cliente nunca intercambian caras ni atuendos.
Requiere 6 imágenes de referencia (calle / fachada / dependiente / ramen / cliente / logo); la restricción «todo en el idioma objetivo, sin texto mezclado» debe formularse con firmeza.
4.2 Material limpio y separación de la música de fondo
2.5 mejora enormemente la estabilidad de la generación, y la instrucción negativa «sin subtítulos, sin música de fondo» por fin acierta con alta probabilidad — el material limpio que la postproducción comercial necesita ya está aquí. En la dirección contraria, para un video de referencia con sonido, una sola línea — «elimina la música de fondo, conserva las voces» — separa las pistas de audio sin pérdidas mientras la imagen y los subtítulos originales se conservan a la perfección.
Escaparate de moda para e-commerce en silencio
Prompt
Un video vertical 9:16 de presentación de outfits para e-commerce sobre un fondo de estudio blanco puro, minimalista y sin costuras (la composición sigue la Imagen 1), con la maquetación dividida fija durante todo el video: en el lado izquierdo del cuadro, tres módulos rectangulares con finos bordes negros redondeados apilados en vertical, cada uno coronado por un numeral negro con serifa (1, 2, 3), y cada módulo con una vista cenital de la prenda correspondiente y una pequeña etiqueta «1x» debajo; en el lado derecho, una modelo joven de pie, de cuerpo entero, luciendo el outfit de verdad — cámara fija a la altura de los ojos con encuadre de cuerpo entero, iluminación de estudio suave y uniforme, sin sombras duras, texturas de tejido nítidas y finas. La modelo mantiene una pose natural y elegante con unos pocos movimientos lentos — una mano que sube a ajustar la ropa, un cambio de postura — con un estilo general limpio y premium. Absolutamente nada de textos, eslóganes, marcas de agua, logotipos ni anotaciones adicionales en ningún momento; sin música de fondo, sin voz en off, sin ruido ambiente — una imagen completamente silenciosa y puramente visual; la cámara permanece fija, sin acercamientos, alejamientos, panorámicas ni inclinaciones, y la estructura de la maquetación se mantiene inalterada durante todo el video.
Requiere 1 imagen de referencia de composición, y el interruptor de audio ya viene desactivado por ti en la generación; el trío «sin subtítulos + sin música de fondo + en silencio» por fin se ejecuta con fiabilidad en 2.5.
Quitar la música y quedarte solo con la voz
Prompt
Elimina toda la música de fondo del Video 1, conservando únicamente las voces de las personas que hablan y el ruido ambiente. Las voces deben conservar su timbre, tono, respiración y detalle originales; la imagen, las personas, los subtítulos, la calidad de imagen, el etalonaje y la composición permanecen completamente inalterados — no modifiques ningún contenido visual.
Requiere 1 video de referencia con voces; es el recurso estrella para fan edits, limpieza de entrevistas y sustitución de doblajes multilingües.
05 Edición, modelos blancos y pantalla verde
Seedance 2.5 opera con precisión quirúrgica sin tocar el resto del material: eliminación y sustitución locales, render de modelos blancos hasta la película acabada, cambio de fondo con pantalla verde y transiciones invisibles entre dos videos. Para reescrituras de un clip original con una sola instrucción — añadir, eliminar, cambiar, sustituir el fondo — cambia al modelo Seedance 2.5 Video Edit: sube un clip original de 3–15 segundos en modo de edición de video, y la duración y la relación de aspecto de la salida siguen a la fuente. Las jugadas multi-asset — render de modelos blancos, integrar un sujeto de pantalla verde en una escena nueva, transiciones entre dos videos — siguen ejecutándose en modo referencia a video con tu material adjunto como referencia. En ambos casos rige una disciplina: mantén palabras como editar, extender o continuar fuera de los prompts normales de referencia a video, o la tarea se malinterpretará — cuando quieras una edición o extensión de verdad, usa el modelo dedicado.
5.1 Eliminación y sustitución locales
El núcleo de la fórmula de edición es detallar «de A a B»: el objetivo exacto de la edición + la acción y el cambio + cuándo surte efecto. Los verbos de batalla: añadir, eliminar, modificar/sustituir/cambiar a. Combínalos con marcas de tiempo para fijar el rango temporal de la edición — si lo omites, la edición se aplica a todo el clip.
[Objetivo exacto de la edición] + [Acción y cambio] + opcional [Momento de efecto]
Objetivo de la edición
Fija el objetivo: «la mujer de la izquierda en el video», «el vaso sobre la mesa», «el texto verde del título en inglés» — cuanto más específico, menos daños colaterales.
Acción y cambio
Da la orden: de A a B — «elimínalo y rellena el fondo con naturalidad», «sustitúyelo por unos pantalones de vestir negros».
Momento de efecto
«Aplica el cambio de forma consistente en todo el clip» o «solo durante los segundos 5-8» — fijar la línea temporal evita rupturas de continuidad.
Eliminar a las personas de más
Prompt
Elimina del Video 1 a la mujer de la izquierda y al hombre de la derecha, conservando solo a la mujer del centro, con sus movimientos inalterados. Rellena las zonas eliminadas con naturalidad para que coincidan con la iluminación y la perspectiva del material original, sin dejar imágenes fantasma ni parches borrosos; el resto de la imagen, la composición y el movimiento de cámara permanecen exactamente iguales.
Requiere 1 video original; nombra por posición quién se queda y quién se va, añade una línea sobre el relleno limpio — esa es la receta con más éxito para una eliminación invisible.
Recolorear la ropa + eliminar texto
Prompt
Elimina por completo el texto verde del título en inglés que aparece en el Video 1, y edita la ropa deportiva azul de la persona que hace estiramientos de espalda para convertirla en ropa deportiva roja — cambia únicamente el color de la ropa. Elimina también por completo los accesorios de fitness sobrantes del fondo: la kettlebell azul de la derecha y la esterilla de equilibrio azul de la izquierda. La persona en sí, su piel, cabeza, manos y pies, la postura corporal, los movimientos del ejercicio, la esterilla de yoga, la alfombra, la pared y el encuadre de cámara permanecen inalterados. Tras eliminar el texto y los accesorios, las zonas que cubrían deben rellenarse con naturalidad — sin fantasmas de texto, sin parches borrosos, sin restos de accesorios. La ropa deportiva roja debe mantenerse estable mientras la persona rueda, levanta una pierna y se estira, conservando los pliegues y la textura de tejido originales de la prenda.
Requiere 1 video original; varios objetivos de edición caben en un mismo prompt, pero cada objetivo necesita su propio «cambiar a qué» bien claro.
5.2 Render de modelos blancos
Sube como video de referencia una animación de modelo blanco (gray-box) exportada de Maya/Blender, y la IA renderiza la película final a partir de tu prompt — los movimientos de cámara, el blocking y las trayectorias siguen estrictamente el modelo blanco, mientras que los materiales, la iluminación y los personajes salen de tus palabras. Hoy funcionan mejor los modelos blancos toscos (primitivas geométricas simples): detalla «declaración de referencia + qué modelo se corresponde con qué personaje + trama detallada + tratamiento de la escena + cierre global». Para modelos blancos con extremidades o alas, escribe la secuencia de movimiento completa o saldrán rígidos.
De modelo blanco a reina elfa
Prompt
Toma como referencia el movimiento de cámara y los cambios físicos de iluminación del Video 1, y sustituye con precisión el modelo blanco del video por la reina elfa de la Imagen 1. Su apariencia sigue estrictamente la imagen: larga melena blanco plateado, una magnífica túnica bordada en blanco y oro, y un bastón mágico coronado por un cristal luminoso — mantén el personaje consistente, sin clipping, sin cambios de rostro. El escenario es un gran salón élfico, conservando la escena del Video 1. Las posiciones de cámara coinciden con el video original, y la reina elfa alza con gracia su bastón mágico siguiendo los movimientos del modelo del video de referencia. Mientras se mueve, su melena blanco plateado y la amplia falda de su túnica blanca ondean con naturalidad en las corrientes de aire, sedosas y con caída real. Con el movimiento, los efectos de luz del video de referencia se transforman en un pilar de luz sagrada que se alza desde el suelo, en resonancia con el deslumbrante brillo dorado del bastón en su mano. El video final exige calidad CG fotorreal cinematográfica, iluminación sagrada y épica, imagen en alta definición, piel finamente detallada, texturas metálicas nítidas en el vestuario, riqueza de detalle y movimiento fluido y natural.
Requiere 1 video de modelo blanco + 1 imagen de referencia de personaje; «sustituye con precisión el modelo blanco por el personaje de la Imagen N» es la formulación central del render de modelos blancos.
5.3 Generación y sustitución de pantalla verde
Se admiten ambas direcciones: convertir el fondo de un video normal en una pantalla verde (para componerlo tú mismo en postproducción), o integrar sin costuras a una persona de metraje con pantalla verde en una escena completamente nueva — separación del primer plano fina hasta el último cabello, con la perspectiva y la iluminación de la persona fusionadas automáticamente con el nuevo fondo, sin parpadeos ni saltos.
Plate de pantalla verde con un clic
Prompt
Convierte todo el fondo blanco del video en un fondo de pantalla verde puro. Los movimientos de la persona, los elementos del primer término y la composición del cuadro permanecen inalterados; los bordes de la persona quedan limpios, sin halos blancos residuales, y el detalle del cabello se mantiene intacto. Elimina el audio y déjalo en silencio.
Requiere 1 video original, y el interruptor de audio ya viene desactivado por ti en la generación; una vez tengas el plate de pantalla verde, cambia el fondo en cualquier software de edición.
5.4 Transiciones invisibles entre dos videos
Sube el clip anterior y el posterior, y el modelo genera automáticamente los fotogramas puente que rellenan el hueco — sin modificar el material original. Se admiten técnicas avanzadas como transiciones activadas por una acción, arrastres de mirada y barridos por oclusión. Tu prompt solo necesita describir qué ocurre en la costura.
Una carpa salta la Puerta del Dragón
Prompt
Une sin costuras el Video 1 y el Video 2 sin modificar ninguno de los dos. La carpa del último fotograma del Video 1 empieza a nadar rápidamente hacia delante, luego salta con rapidez fuera del agua hacia el aire, donde aparece una pesada y antigua puerta de piedra; la carpa cruza por encima de la puerta hacia las nubes y la niebla, se transforma finalmente en un dragón, y el plano enlaza con el Video 2.
Requiere 2 videos (el clip de apertura y el de cierre); la línea «sin modificar los videos originales» es obligatoria, y la descripción de la transición cubre solo el tramo intermedio que falta.