La mayoría de quienes prueban Seedance 2.0 nota lo mismo: escribes «un hombre corriendo por las calles, muy cinematográfico» y estás apostando — regeneras cinco veces y esperas que alguna funcione. Mientras tanto, algunos prompts clavan un plano casi final al primer intento. La diferencia no es suerte. Es entender qué lee realmente el modelo.
Seedance 2.0 ingiere tu texto, tus imágenes, tus videos y tu audio en conjunto, y por dentro lo divide todo en dos dimensiones: una capa espacial (qué hay en el encuadre) y una capa temporal (cómo cambian las cosas en el tiempo). No es un asistente de redacción que responde a palabras de ambiente — es un director multimodal esperando una orden de trabajo. Un buen prompt se lee como notas de producción, no como poesía: quién, dónde, haciendo qué, cómo se mueve la cámara y en qué orden.
Este artículo condensa lo que hemos aprendido a lo largo de cientos de generaciones en cinco reglas y una tabla de solución de problemas. Léelo una vez y desperdiciarás muchas menos generaciones.
Primer paso: elige el verbo de tarea correcto
Si generas a partir de material de referencia (imágenes, videos, audio), decide primero qué tipo de tarea estás haciendo — la estructura de tu frase le dice al modelo cómo interpretar todo lo demás:
| Tarea | Qué buscas | Formulación recomendada |
|---|---|---|
| Referencia multimodal | Extraer elementos (un sujeto, un movimiento, un estilo, una voz) y generar un video totalmente nuevo | «Tomando como referencia el sujeto de <Imagen 1>, genera…» |
| Edición de video | Añadir, quitar o cambiar elementos de un video existente; todo lo demás se mantiene | «Edita estrictamente <Video 1>, cambiando A por B» |
| Extensión de video | Continuar un video existente hacia adelante o hacia atrás en el tiempo | «Extiende <Video 1> hacia adelante, generando…» |
Y aquí está la trampa en la que cae casi todo el mundo: en tareas de edición y extensión, di «Video 1» — nunca «tomando como referencia el Video 1». Esas palabras de más pueden hacer que el modelo lea tu edición como una tarea de referencia, y obtendrás un video nuevo que solo se parece vagamente al original.
Los tres tipos de tarea también se combinan: «Tomando como referencia el trabajo de cámara de <Video 2>, edita estrictamente <Video 1>…»
La fórmula central
Para texto a video o cualquier tarea compleja, organiza tu prompt sobre este esqueleto:
sujeto preciso + detalle de la acción + escena + iluminación y tono + trabajo de cámara + estilo visual + calidad + restricciones
El orden tiene su lógica: primero fija quién hace qué (el protagonista de la capa temporal), luego establece dónde y con qué atmósfera (la capa espacial), después dile al modelo cómo filmarlo, y al final ajusta el resultado con palabras de estilo, calidad y restricción. Las cinco reglas siguientes despliegan esta fórmula.
Regla 1: ponle nombre a tu reparto
Una imagen de referencia suele contener más de una cosa, y el modelo no sabe quién es «él». Así que el primer movimiento es la definición del sujeto:
Define a la mujer de la Imagen 1 con vestido rojo y sombrero de paja como Rosa.
Tres cosas importan:
-
Define con 2–3 rasgos estables y estáticos (ropa, peinado, categoría) para que el sujeto sea identificable de forma única;
-
Una vez definido, usa siempre la misma etiqueta — no alternes entre «Rosa» y «la mujer»;
-
En escenas simples sin definiciones formales, vincula el sujeto a su fuente cada vez que lo menciones, con
sujeto@Image N— p. ej., «el barista@Image 1».
Varios personajes reciben definiciones separadas y etiquetas separadas: «Define al hombre alto del Video 1 como el policía, y al hombre bajo como el ladrón.» A partir de ahí, la escena de persecución siempre dice policía y ladrón, y las referencias nunca se enredan.
Un movimiento avanzado: si el rostro de un personaje importa, prepara un primer plano dedicado solo de la cabeza y deja el reparto de funciones por escrito — «Los rasgos faciales de Leo siguen la Imagen 1 (retrato); su vestuario y estilismo siguen la Imagen 2 (plano de cuerpo entero)». Es la defensa más eficaz contra los cambios de cara a mitad del video.
Regla 2: escribe planos, no vibras
La representación interna del modelo desacopla espacio y tiempo, así que la forma ideal de un prompt para un video complejo es una línea de tiempo de planos: divide el video en Plano 1, Plano 2, Plano 3, descritos en el orden en que ocurren los hechos.
Mal: «Un hombre corre nervioso por las calles, muy cinematográfico.» El modelo solo puede adivinar.
Bien:
Plano 1: Vista lateral de un callejón; el hombre arranca a correr despacio, respirando con dificultad. Plano 2: Choca contra un puesto de fruta; la cámara gira bruscamente hacia un primer plano de su rostro aterrado. Plano 3: Salta un muro bajo y desaparece; la cámara retrocede lentamente y se queda en la calle vacía.
Dentro de cada plano, cubre cuatro cosas en un orden fijo:
-
Movimiento de cámara o transición («plano medio, avance lento de cámara», «corte a…»)
-
Acción y expresión del sujeto
-
Posición o cambio espacial
-
Audio (efectos de sonido, diálogo, música)
Una advertencia: no escribas marcas de tiempo exactas como «0–3 segundos». El soporte del modelo para tiempos precisos es inestable, y forzar duraciones tiende a producir artefactos. Deja que marque el ritmo de la historia con naturalidad.
Regla 3: coreografía, no etiquetas
El principio para las acciones: partes concretas del cuerpo + intensidad cuantificada. Sé concreto con manos, piernas, cabeza — y añade amplitud, velocidad y fuerza: «levanta una mano lentamente», «gira la cabeza de golpe», «se impulsa con fuerza», en lugar de un vago «se mueve».
Dos lecciones que costaron caras:
-
Prefiere movimientos pequeños, lentos, suaves y continuos. Caminar despacio, alzar una mano con suavidad, sentarse en una silla sin prisa — estos funcionan con mucha más frecuencia que esprintar, saltar o caer rodando con violencia;
-
Escribe las transiciones entre acciones. «Llevado por la inercia del giro, levanta una mano» fluye mucho mejor que dos acciones desconectadas.
Lo mismo vale para la emoción — no escribas etiquetas abstractas; exterioriza los sentimientos en detalle físico:
| Abstracto | Exteriorizado |
|---|---|
| Ella está triste | Cabeza gacha, hombros temblando ligeramente, dedos aferrando sin darse cuenta el dobladillo de la chaqueta, lágrimas a punto de caer sin caer |
| Él está nervioso | Mira el reloj una y otra vez, los dedos tamborilean sobre la mesa, respiración corta, la mirada se escapa hacia otro lado |
| Ella siente alivio | Una exhalación larga, los hombros tensos por fin se sueltan, una sonrisa leve mientras alza la vista hacia la distancia |
Regla 4: un solo movimiento de cámara por plano
Seedance 2.0 entiende muy bien el vocabulario cinematográfico estándar — úsalo sin miedo: plano medio, primer plano, plano general, avance lento de cámara, travelling lateral suave, cámara fija, seguimiento cámara en mano…
La única regla de hierro: especifica solo un movimiento de cámara por plano. Pedir avance, retroceso, paneo y travelling a la vez desestabiliza visiblemente el encuadre. Para coreografías de cámara complejas, divídelas en varios planos — o mejor, entrégale al modelo un video de referencia de cámara.
Regla 5: cierra el encuadre con restricciones
El párrafo final de tu prompt existe para enjaular el azar. Tres grupos de palabras, cada uno con su trabajo:
-
Calidad: alta definición, detalle rico, textura cinematográfica, color natural, iluminación suave;
-
Estilo: nombra el look objetivo de forma explícita — «estilo anime 2D», «película vintage», «paleta cyberpunk de azules y violetas fríos». Esto importa sobre todo cuando tu imagen de referencia es fotorrealista pero quieres un resultado animado; si lo omites, la salida deriva hacia la imagen real;
-
Restricciones: mantén este trío en guardia permanente — «sin subtítulos», «sin marca de agua», «sin logo». Para escenas con varios personajes, añade una línea global: «Durante todo el video, nunca muestres personajes duplicados con apariencia y ropa idénticas.»
Arma tu kit de referencias: 4–5 assets, cada uno con su trabajo
Más material de referencia no es mejor. Asigna a cada asset uno de estos cuatro roles funcionales:
-
Ancla de personaje: fija la apariencia (retrato + cuerpo entero, 1–2 imágenes)
-
Definidor de escena: fija el entorno y la dirección de arte (1 imagen)
-
Referencia de cámara: fija el lenguaje de planos y el ritmo del movimiento (1 video)
-
Control de atmósfera: fija la emoción y el timbre de voz (1 clip de audio)
De cuatro a cinco assets en total es el punto óptimo. Llenar el límite de subida hasta el tope directamente perjudica: con demasiadas entradas el modelo no puede jerarquizar los rasgos, y aparecen conflictos de estilo y confusión de sujetos. Y una regla contraintuitiva: nunca uses hojas de personaje con varias vistas (frente/perfil/espalda en una sola imagen). El modelo tiende a leer los distintos ángulos como personas distintas, lo que empeora la deriva del rostro y los glitches de «gemelos».
El orden también importa: cuanto más fielmente deba reproducirse un asset, antes debe aparecer en tu prompt.
La puntuación que el modelo entiende
Seedance 2.0 tiene una convención de símbolos para distinguir tipos de información. Usarla correctamente mejora la comprensión de forma medible:
| Tipo | Símbolo | Ejemplo |
|---|---|---|
| Música | () | (Suena música rock de ritmo rápido de fondo) |
| Efecto de sonido | <> | |
| Diálogo | {} | {Hola, mundo}; para idiomas distintos del chino/inglés, nombra el idioma: dice en japonés {こんにちは} |
| Rótulo / cartela | 【】 | 【Capítulo uno: La partida】 |
Mantén el diálogo en un solo idioma de principio a fin — no mezcles idiomas a mitad del guion (nombres propios aparte).
Tabla de solución de problemas
| Síntoma | Solución |
|---|---|
| El rostro del personaje cambia a mitad del video | Añade un primer plano dedicado solo de la cabeza; escribe «rostro de la Imagen 1, estilismo de la Imagen 2»; pon las referencias críticas primero; descarta las hojas de varias vistas |
| Aparecen «gemelos» idénticos en el encuadre | Vincula cada personaje a su imagen; añade la restricción global contra duplicados; usa fotos de una sola persona; no pegues un guion entero como prompt |
| El estilo deriva hacia el fotorrealismo | Nombra el estilo explícitamente («animación 3D estilizada»); si hace falta, convierte antes la imagen de referencia al estilo objetivo |
| Aparecen subtítulos no deseados | Añade «sin subtítulos»; elimina el texto del material de referencia; el formato horizontal dispara subtítulos con mucha menos frecuencia que el vertical |
| Salto visible en las costuras de una extensión | Termina cada segmento en un corte; al editar, recorta ~6 fotogramas del final del primer clip y 1 fotograma del inicio del siguiente |
| La calidad se degrada al encadenar extensiones | Limita cuántas veces extiendes; usa fuentes en HD; truco avanzado — convierte primero la fuente en un video de modelo blanco (3D sin texturas) y luego extiende |
| Más de 4 personajes se vuelve un caos | Agrupa antes los personajes en imágenes (máximo 4 por imagen) y luego pasa de imagen a video |
| El efecto especial no coincide con la intención | No describas el efecto con palabras — aporta un video de referencia del efecto |
Una decisión que merece su propio párrafo: ¿cuándo extender y cuándo montar? Para escenas de diálogo en una sola localización — conversaciones largas, construcción emocional — usa la extensión de video para lograr una sensación inmersiva de plano secuencia. Para giros de trama o acción rápida — persecuciones, peleas, montaje — genera los segmentos por separado y córtalos entre sí para proteger el ritmo y el impacto. Los proyectos reales suelen combinar ambos.
Un ejemplo completo: el puesto de fideos del mercado nocturno
Aquí están todas las reglas aplicadas en un solo prompt.
Assets: Imagen 1 = retrato del vendedor; Imagen 2 = plano de cuerpo entero del vendedor; Imagen 3 = escena del puesto en el mercado nocturno; Audio 1 = música de fondo animada de mercado callejero.
Define al hombre de la Imagen 1 y la Imagen 2 como Leo; sus rasgos faciales siguen la Imagen 1 (retrato), su vestuario y estilismo siguen la Imagen 2 (plano de cuerpo entero). La escena sigue el puesto de fideos del mercado nocturno de la Imagen 3; la música de fondo se mezcla con el Audio 1. Plano 1: Plano medio con cámara fija. Leo está de pie tras el wok salteando fideos; las llamas se alzan mientras su muñeca sacude el wok en ráfagas rápidas y controladas, con un brillo de sudor en la frente. (Suena de fondo música animada de mercado callejero) Plano 2: La cámara avanza lentamente hasta un plano corto. Leo emplata los fideos y los entrega; la comisura de sus labios se eleva y le dice a un cliente fuera de cámara {Cómetelo mientras está caliente}. Plano 3: La cámara retrocede lentamente hasta un plano general. El letrero del puesto se enciende contra la noche, la multitud pasa sin prisa y Leo se vuelve hacia el wok. En general: alta definición, detalle rico, tonos cálidos, textura cinematográfica, iluminación suave. Sin subtítulos, sin marca de agua, sin logo. Solo un Leo aparece en todo el video; nunca muestres personajes duplicados con apariencia idéntica.
Vuelve a mapearlo: verbo de tarea (referencia), definición del sujeto con funciones repartidas (el retrato manda sobre el rostro, el cuerpo entero sobre el estilismo), tres planos que cubren cámara/acción/espacio/audio, un movimiento de cámara por plano, los símbolos correctos y el cierre de calidad + estilo + restricciones.
Imagen a video: dos prompts más listos para usar
El ejemplo del puesto de fideos muestra el enfoque con el kit completo de assets. Pero imagen a video suele empezar de forma mucho más modesta: tienes una o dos fotos y quieres que se muevan. Los dos prompts siguientes — uno simple, uno a gran escala — demuestran un criterio fácil de pasar por alto: no todo prompt necesita una lista de planos. Una sola acción continua en una sola localización cabe en un párrafo; solo una historia con varios eventos a través de distintos espacios se gana la estructura completa de «planteamiento + planos + restricciones».
Ejemplo 1 — una sola imagen, micromovimiento: darle vida a una foto antigua
Assets: Imagen 1 = una foto antigua de una anciana sentada en una silla de mimbre en un patio.
Tomando como referencia a la anciana de la Imagen 1 — de pelo plateado, con una blusa de algodón azul oscuro, sentada en una silla de mimbre — genera una escena de ella en el patio en una tarde tranquila: mira al frente con calma, luego sus ojos parpadean despacio, las comisuras de sus labios se elevan en una sonrisa leve, inclina la cabeza ligeramente hacia la derecha del encuadre y, llevada por ese movimiento, alza la mano derecha para acomodarse con suavidad un mechón suelto detrás de la oreja; tras ella, la ropa tendida y las sombras de los árboles se mecen suavemente con la brisa. Plano medio corto con cámara fija. Textura de película vintage, tonos cálidos, iluminación suave; rostro estable y sin distorsión, movimientos lentos y continuos; sin subtítulos, sin marca de agua, sin logo.
Contrástalo con las reglas: el sujeto queda fijado con tres rasgos estáticos (silla de mimbre, blusa azul oscuro, pelo plateado); cada acción es un micromovimiento lento y continuo con su transición escrita (la inclinación de cabeza se encadena con el gesto de acomodarse el pelo); una sola posición de cámara en todo el clip; y una frase de cierre condensa calidad, estabilidad y el trío de restricciones. Una petición simple debe ser así de corta — forzarle una lista de planos solo le da al modelo más margen para improvisar.
Ejemplo 2 — storyboard con varias imágenes: un corto en un callejón bajo la lluvia
Assets: Imagen 1 = retrato de la mujer; Imagen 2 = su plano de cuerpo entero en qipao; Imagen 3 = un callejón de piedra empapado por la lluvia en un pueblo antiguo del sur. Ojo con el orden de subida: el rostro — el asset que debe reproducirse con más fidelidad — va primero.
Ambientación general: un callejón de piedra velado por la lluvia y la niebla en un pueblo antiguo del sur, realismo cinematográfico. Define a la mujer de la Imagen 1 y la Imagen 2 como Mei: sus rasgos faciales siguen la Imagen 1 (retrato), su vestuario y estilismo siguen la Imagen 2 (plano de cuerpo entero); la escena sigue el callejón de piedra de la Imagen 3, con la Imagen 3 como fotograma inicial. Plano 1: Plano general con cámara fija. Una lluvia fina cae sobre el pavimento de piedra mientras Mei entra caminando despacio desde la boca del callejón bajo un paraguas de papel aceitado, con pasos sin prisa y el bajo de su qipao meciéndose suavemente a cada zancada. Plano 2: La cámara avanza lentamente hasta un plano medio corto. Mei se detiene ante una puerta de madera, inclina ligeramente el paraguas mientras gira la cabeza, su mirada se posa en la aldaba de latón, con gotas diminutas de lluvia prendidas de sus pestañas. Plano 3: Travelling lateral suave. Llevada por la inercia de alzar el brazo, Mei pliega el paraguas en un solo gesto, se vuelve y cruza el umbral; el encuadre se queda en la luz difusa de los faroles al fondo del callejón. (Suena de fondo una música lenta de guzheng) En general: alta definición, detalle rico, textura cinematográfica con grano de película, paleta fría de baja saturación, iluminación con capas; rostro estable y sin distorsión, movimientos lentos, continuos y naturales, sin cortes ni tirones; sin subtítulos, sin marca de agua, sin logo; solo una Mei aparece en todo el video — nunca muestres personajes duplicados con apariencia idéntica.
Este prompt hilvana las cinco reglas y añade una técnica específica de imagen a video: declarar el fotograma inicial. «La Imagen 3 como fotograma inicial» hace que el video se despliegue desde la composición de la imagen de escena — primero el callejón vacío, después entra el personaje — mucho más estable que dejar que el modelo adivine la apertura. Fíjate también en cómo se escribe la emoción: la palabra «melancolía» no aparece nunca; lo que está escrito es «su mirada se posa en la aldaba de latón, gotas de lluvia prendidas de sus pestañas».
Texto a video: escribir sin ninguna imagen
Todos los ejemplos hasta aquí se apoyaban en assets de referencia. ¿Pero qué pasa si no tienes nada — texto a video puro? La fórmula sigue siendo el esqueleto del inicio de este artículo, con una diferencia clave: no hay imagen a la que vincular, así que el sujeto y el estilo viven o mueren por tus palabras — condensa los rasgos con más densidad. Mismo par: uno simple, uno a gran escala.
Ejemplo 1 — un gato frente a una tienda de conveniencia en una noche nevada (montaje en un solo párrafo)
Bien entrada la noche, frente a una tienda de conveniencia, un gato de pelo corto naranja y blanco está sentado en el escalón de la entrada mientras cae una nieve fina. Sus orejas se sacuden de vez en cuando, quitándose los copos de las puntas; la punta de su cola barre sin prisa de lado a lado; cada respiración se condensa en una pequeña nube blanca en el aire frío. Tras él, una luz amarilla cálida se derrama a través de la puerta de cristal, y los copos de nieve descienden lentamente a través del resplandor. Plano corto con cámara fija. Alta definición, detalle rico, textura cinematográfica, contraste nocturno entre frío y calidez, iluminación suave; detalle del pelaje estable, movimientos lentos y continuos; sin subtítulos, sin marca de agua, sin logo.
Sin imagen de referencia, «naranja y blanco, de pelo corto, sentado en el escalón» es toda la identidad de este gato — la densidad de rasgos determina directamente la estabilidad del sujeto. Y las acciones siguen siendo todas micromovimientos lentos (sacudidas de orejas, barridos de cola, respiración visible), algo que importa aún más con sujetos animales.
Ejemplo 2 — un anuncio de cafetería (lista de planos + texto en pantalla)
Ambientación general: una cafetería independiente a primera hora de la mañana, tonos cálidos cinematográficos, luz natural entrando en diagonal por grandes ventanales. Plano 1: Primer plano con cámara fija. Granos de café marrón oscuro caen lentamente desde arriba en la tolva metálica de un molinillo, rebotando al aterrizar, con un polvillo fino flotando a contraluz. Plano 2: La cámara avanza lentamente. En una taza de cerámica blanca, el arte latte florece desde el centro hasta formar una hoja mientras el vapor sube en espirales, atrapando la luz de la ventana. Plano 3: La cámara retrocede lentamente hasta un plano general. La cafetería iluminada por la mañana luce limpia y tranquila, con el latte humeando sobre la barra; en el tercio inferior del encuadre, un texto blanco escrito a mano aparece en fundido: «Primero un sorbo, después el día». (Suena de fondo una guitarra acústica suave) En general: alta definición, detalle rico, tonos cálidos, textura cinematográfica, iluminación suave; el líquido y el vapor se comportan con naturalidad, sin distorsión; sin texto aparte de la línea especificada, sin marca de agua, sin logo.
Este esconde una regla que es fácil aplicar al revés: cuando quieres texto en pantalla, las restricciones se invierten. Quita «sin subtítulos» y en su lugar detalla los cuatro esenciales del texto — contenido, momento, posición, entrada — y cierra con «sin texto aparte de la línea especificada» como red de seguridad. Los eslóganes son el uso comercial más común de texto a video; esta inversión merece grabarse en la memoria.
Para cerrar
Seedance 2.0 movió el cuello de botella de la generación de video de la capacidad del modelo a tu capacidad de comunicar. No necesitas saber filmar una película — necesitas escribir prompts como un director escribe notas de producción: nombra al reparto, cuenta la historia plano a plano, coreografía el movimiento, un movimiento de cámara por plano, y cierra con restricciones.
El resto es práctica. ¿Ese prompt del puesto de fideos de arriba? Tómalo, ajústalo y hazlo tuyo.