Guía

Guía de Wan 2.7

El manual de escritura completo, desde la fórmula base hasta el fotograma inicial y final, la continuación de video, la referencia de voz y la edición de video — cada capítulo incluye prompts de ejemplo listos para enviar que puedes cargar en el generador de Molyin con un clic. Wan 2.7 es el modelo de video MoE de 27B de Alibaba Tongyi: 1080p cinematográfico, duración continua de 2-15s, audio nativo en cada video, interpolación entre fotograma inicial y final y continuación de video — esta guía repasa cada una de estas armas una por una.

Actualizado el 2026-08-06

01 Fórmula base

Wan 2.7 entiende instrucciones estructuradas: quién, qué hace, cómo se mueve la cámara, dónde y con qué tono. Este capítulo descompone un buen prompt en cinco piezas reutilizables y luego repasa dos herramientas prácticas: las cinco relaciones de aspecto y la semilla. Fija primero el esqueleto; cada capítulo posterior no es más que una extensión de él.

1.1 La fórmula básica del prompt

Todo empieza con una frase: sujeto y movimiento son las dos partes obligatorias; cámara, entorno y estética se apilan según necesites. Rueda primero el clip en tu cabeza y después escríbelo con la fórmula. La duración es un control deslizante continuo de 2-15s — planifica exactamente lo que cabe en esos segundos. Un extra: Wan 2.7 expande automáticamente los prompts cortos con una reescritura inteligente, pero un original bien estructurado siempre supera sus suposiciones.

[Sujeto] + [Movimiento] + opcional [Cámara] [Entorno] [Estética]

Obligatorio

Sujeto

El protagonista: una persona, un animal o un producto. Cuanto más específico, mejor.

Obligatorio

Movimiento

Qué hace el sujeto, con las partes del cuerpo y el ritmo bien detallados. Los movimientos pequeños, lentos y coherentes son los más fiables.

Opcional

Cámara

Tamaño de plano y movimiento: primer plano, acercamiento, paneo. Para narrativas de varios planos, escribe el storyboard directamente, p. ej. «Plano 1 [0-3s] plano general».

Opcional

Entorno

Escena y atmósfera: lugar, hora, luz, clima.

Opcional

Estética

Dirección de arte y calidad: tono de color, textura, nitidez.

Motorista bajo la lluvia de neón

Prompt

En una calle lluviosa de Tokio de noche, una motorista con chaqueta de cuero negro está sentada a horcajadas sobre una moto pesada, se quita el casco y sacude su pelo empapado por la lluvia, mientras los letreros de neón proyectan reflejos rosas y azules sobre el asfalto mojado. La cámara se acerca lentamente desde un ángulo bajo hasta un primer plano de medio cuerpo, con la llovizna claramente visible a contraluz. Calidad cinematográfica, etalonaje cyberpunk, riqueza de detalle.

Dos frases para sujeto+movimiento, una para la cámara y otra para el entorno, palabras de estilo para cerrar — ese es un sólido prompt base de Wan 2.7. Recomendado: 1080p, 16:9.

1.2 Elegir entre cinco relaciones de aspecto

Wan 2.7 ofrece cinco relaciones de aspecto: 16:9, 9:16, 1:1, 4:3 y 3:4. Solo hay una regla — decide hacia atrás desde la plataforma de publicación: 16:9 para video horizontal, 9:16 para feeds móviles, 1:1 para feeds cuadrados, 4:3 o 3:4 para retratos y bodegones. Fija la relación antes de generar; recortar después solo tira calidad a la basura. Nota: imagen a video no tiene selector de relación de aspecto — la salida sigue tu fotograma inicial.

Gabardina al doblar la esquina

Prompt

En una calle antigua bañada por el sol de la tarde, una modelo con gabardina beige dobla la esquina a paso tranquilo, el bajo del abrigo se balancea con cada paso, y se detiene frente a un escaparate con una sonrisa de perfil. La cámara la sigue en plano medio y luego se acerca lentamente. Textura cálida de película vintage, calle rica en detalles.

Precargado con 9:16 vertical — el lienzo estándar de los feeds móviles, una composición de cuerpo entero que llena el encuadre.

1.3 Reproducir e iterar con la semilla

La semilla es el control de aleatoriedad de Wan 2.7: fíjala y el mismo prompt regenera resultados muy similares — cambia una palabra y verás exactamente qué hace esa palabra; cambia la semilla y el mismo prompt entrega una tanda fresca. Dos hábitos que merece la pena cultivar: anota la semilla cuando consigas un resultado que te encante, y bloquea la semilla mientras haces pruebas A/B de redacción. La generación es probabilística — la misma semilla no garantiza una salida idéntica píxel a píxel, pero la composición y la estabilidad del sujeto superan con creces al azar puro.

Grulla de papel en el alféizar

Prompt

Una grulla de origami se posa sobre un alféizar calentado por el sol, una brisa se cuela por la rendija de la ventana, sus alas tiemblan suavemente antes de que el viento la levante del alféizar y la haga girar por la habitación hacia la estantería. La cámara la sigue lentamente, la luz y la sombra motean el suelo de madera, polvo fino flota en el aire.

Precargado con semilla 42 — cambia las palabras, conserva la semilla y compara cada iteración de ajuste fino.

1.4 Banda sonora de referencia: que la imagen siga a la música

La ranura de entrada de audio en texto a video significa «banda sonora» — sube una pista musical y el modelo la trata como música de fondo, dejando que el ritmo, los golpes de movimiento y los movimientos de cámara sigan la emoción de la música. En el prompt basta con nombrarla: «usa el Audio 1 como banda sonora», y añade una línea sobre cómo debe responder la imagen a la música (sincronía con el beat, crescendo emocional, ajuste de atmósfera). Esto es distinto de «cada video tiene sonido»: la ranura de banda sonora es tu dirección musical deliberada — sin ella, el modelo musicaliza el video por su cuenta.

Atardecer al volante por la carretera costera

Prompt

Un descapotable vintage recorre una carretera costera al atardecer, la chica del asiento del copiloto tararea suavemente contra el viento, su pelo vuela, las palmeras pasan veloces al borde de la carretera, el mar refleja la puesta de sol como oro esparcido. La cámara acompaña al coche en travelling lateral y orbita lentamente hacia el frente, tonos dorados cálidos, textura de película. Usa el Audio 1 como banda sonora — el ritmo y el movimiento de cámara siguen la emoción de la música, y la órbita se acelera en el estribillo.

Sube 1 pista musical a la ranura de audio (la ranura de audio en t2v significa banda sonora); precargado con 10 segundos — margen suficiente para el crescendo emocional de la música y la sincronía con el beat.

02 Imagen a video

Un fotograma inicial más una descripción de movimiento, y Wan 2.7 da vida a la imagen — el centro de gravedad del prompt pasa de describir la escena a describir el movimiento, porque la escena ya existe. Primero, una regla dura: la relación de aspecto de salida en imagen a video sigue automáticamente tu fotograma inicial — no hay selector de aspecto. ¿Quieres un resultado en 9:16? Sube una imagen en 9:16.

2.1 Dar vida a las fotos

Un prompt de imagen a video cubre solo tres cosas: qué se mueve, cómo se mueve y si la cámara se mueve. No fuerces cosas que no están en la imagen; «despierta» las que sí están — tela que ondea, agua que fluye, luz de farol que parpadea son pequeños movimientos con alta tasa de acierto. Añade «mantener la textura original» y el estilo no derivará.

Atardecer en el puerto pesquero

Prompt

Da vida a esta foto: el sol poniente tiñe el puerto pesquero de rojo dorado, las ondas centelleantes se desplazan lentamente por el agua, los barcos pesqueros amarrados se mecen con suavidad sobre las pequeñas olas, las banderas de los mástiles ondean en la brisa marina, y unas gaviotas rozan el rompeolas lejano. La cámara permanece fija, conservando en todo momento la cálida textura de película crepuscular de la foto original.

Sube 1 imagen de fotograma inicial; escribe solo el movimiento sin repetir la escena, y deja que «mantener la textura original» sostenga el estilo. La relación de aspecto de salida sigue al fotograma inicial.

2.2 Fotograma inicial y final: controla el principio y el final

Wan 2.7 es una de las cuatro familias de modelos en Molyin con soporte de fotograma inicial y final (junto a la familia Seedance, Kling 3.0 y Veo 3.1) — sube un fotograma inicial y uno final, y el modelo genera todo lo que hay en medio. Esto cambia tu forma de escribir el prompt: sáltate el principio y el final (ya están en las imágenes) y escribe solo «cómo ir de A a B» — el ritmo del cambio y cómo la cámara lo acompaña. Mantén ambas imágenes con la misma relación de aspecto, y cuanto mayor sea la distancia visual, más descripción del proceso deberías aportar.

Una gota de tinta florece en montañas

Prompt

Una gota de tinta espesa cae en agua clara, florece lentamente y se estira, filamentos de tinta se rizan y fluyen por el agua, formando poco a poco un paisaje de montañas en tinta china con capas, con nubes que derivan por los espacios vacíos. La cámara se adentra lentamente en el corazón de la masa de tinta, sin cortes en todo momento, con textura de papel de arroz y calidad de tinta china de principio a fin.

Activa el interruptor «Añadir fotograma final» en el modo imagen a video y sube ambos fotogramas (gota de tinta → paisaje); el prompt solo describe la transformación, y 8 segundos le dan al florecimiento espacio para respirar.

2.3 Audio conductor: haz hablar a la foto

La ranura de entrada de audio en imagen a video significa «audio conductor» — sube una grabación de voz y la persona de la foto habla con ella: los labios, la expresión y el movimiento de la cabeza siguen el ritmo del habla. Los clips de busto parlante, las presentaciones de producto y los monólogos de personaje dependen de esto. En el prompt basta una línea: «labios estrictamente sincronizados con el habla del Audio 1», y luego describe la cámara y la atmósfera como de costumbre.

Presentador de pódcast ante el micro

Prompt

Da vida a esta foto: el presentador de pódcast habla con naturalidad al micrófono con expresión animada, asiente levemente y gesticula con las manos, los labios estrictamente sincronizados con el habla del Audio 1, y los cambios emocionales de la voz arrastran consigo las expresiones del rostro. La cálida lámpara de escritorio sobre la estantería del fondo brilla en silencio; la cámara mantiene un plano medio fijo, conservando en todo momento la textura de fotografía documental de la foto original.

Sube 1 foto de retrato + 1 grabación de voz (la ranura de audio en i2v significa audio conductor); una voz limpia y sin ruido da la mayor tasa de acierto en la sincronía labial.

2.4 Continuación de video: sigue rodando sin repetir la toma

Imagen a video también acepta un video de 2-10s como «base de continuación» (first_clip) — el modelo retoma desde el final de ese clip y sigue rodando, con el movimiento, el estilo y la iluminación arrastrados de forma natural. El prompt solo describe el segmento nuevo; no hace falta resumir lo anterior. Tres límites que recordar: la base de continuación es mutuamente excluyente con la imagen de fotograma inicial (elige una); puede combinarse con un fotograma final para fijar el desenlace; pero no puede combinarse con el audio conductor. El control de duración fija la longitud total tras la continuación, y la facturación sigue ese total.

Continuación: [descripción del contenido nuevo] + opcional [requisito de continuidad]

Obligatorio

Contenido nuevo

Describe solo lo que ocurre después de que termine el clip base: nueva acción, nueva escena, nuevo trabajo de cámara.

Opcional

Continuidad

Una línea — «acción sin cortes, estilo e iluminación arrastrados del video original» — evita saltos en la costura.

El segundo salto del skater

Prompt

Continúa el video subido: tras el aterrizaje, el skater rueda hacia delante con fluidez, la cámara sigue acompañándolo desde un ángulo bajo mientras acelera hacia las escaleras de delante, salta, hace girar la tabla, aterriza con firmeza en el suelo llano de abajo, saluda a la cámara y sale de plano patinando. La acción enlaza sin cortes, con el estilo y la iluminación arrastrados del video original.

Sube 1 clip de 2-10s como base de continuación (mutuamente excluyente con la imagen de fotograma inicial; no combinable con el audio conductor); precargado con 10s de total — el control fija la longitud completa tras la continuación.

03 Referencia a video

Las apariencias y los gestos característicos que las palabras no capturan — personajes, productos, ademanes — entrégaselos a los medios de referencia. La referencia a video de Wan 2.7 acepta una mezcla de imágenes y videos: hasta 5 imágenes, hasta 5 videos y no más de 5 elementos en total. Nómbralos en tu prompt como «Imagen 1», «Imagen 2», «Video 1» según el orden de subida (imágenes y videos se numeran de forma independiente), y el modelo fija la apariencia y el movimiento a partir de tus medios mientras la escena y la historia siguen siendo enteramente tuyas. El audio va por una ranura de entrada de audio única e independiente (referencia de voz, ver 3.3) y no cuenta contra el cupo de referencias. Nota: el tope de duración en r2v es siempre de 10 segundos — con o sin videos de referencia.

3.1 La fórmula de referencia de personaje

Un prompt de referencia a video tiene tres tiempos: sube los medios al escenario con «Imagen N», describe qué ocurre en la escena nueva y cierra con «mantener la consistencia». El orden de subida es el orden de numeración — la primera imagen es la Imagen 1, el segundo video es el Video 2. Varios ángulos del mismo personaje funcionan mejor; pon un solo personaje por elemento de referencia, o el modelo no sabrá quién es quién.

[Referencias: Imagen 1…] + [Descripción de la escena] + mantener [Sujeto] consistente

Obligatorio

Referencias

Imágenes o videos — hasta 5 imágenes, hasta 5 videos, 5 en total — referenciados como «Imagen N» y «Video N» en sus propias secuencias.

Opcional

Descripción de la escena

Qué ocurre en la escena nueva: acción, entorno, cámara — el encuadre se genera desde cero, todo dirigido por tus palabras.

Opcional

Consistencia

Un cierre con «mantener la consistencia con las referencias» refuerza el bloqueo de apariencia.

El restaurante de medianoche del chef panda

Prompt

El panda gigante de la Imagen 1, con delantal azul oscuro, saltea y remueve comida en un wok dentro de una pequeña cocina de cálida luz amarilla, el vapor se eleva, y con aire satisfecho prueba una cucharada de caldo y asiente complacido. La cámara rodea el fogón media vuelta y se posa en un primer plano de su cara. Cocina rica en detalles, una atmósfera cotidiana acogedora y entrañable. La apariencia del panda se mantiene consistente con la imagen de referencia, calidad de animación 3D.

Sube 1 o más imágenes de referencia; «Imagen 1» se refiere a tu personaje subido, y el cierre «mantener la consistencia» es la fórmula estándar de bloqueo de apariencia.

3.2 Mezclar referencias de imagen y video

El movimiento estrella de Wan 2.7: las imágenes fijan la apariencia, los videos fijan el movimiento, y ambos pueden compartir escenario — «la bailarina del Video 1 entra al escenario de la Imagen 1», y el modelo toma de cada uno lo que necesita. Tres reglas duras: hasta 5 imágenes, hasta 5 videos y no más de 5 elementos en total; el tope de duración es siempre de 10 segundos (con o sin videos de referencia); y cada elemento de referencia debe contener un solo personaje.

El titiritero sube al escenario

Prompt

El titiritero de la Imagen 1 entra con sus hilos en la mano al escenario del teatro vintage de la Imagen 2, un foco lo atrapa mientras se inclina ante el público con el gesto del Video 1, luego alza su marioneta y comienza la función mientras el telón se cierra lentamente a su espalda. La cámara se acerca despacio desde un plano medio en el patio de butacas, la atmósfera del teatro es solemne y misteriosa. Las apariencias se mantienen consistentes con los medios de referencia.

Sube 2 imágenes de referencia + 1 video de referencia (3 elementos en total, dentro del tope de 5); «Imagen 1», «Imagen 2» y «Video 1» nombran cada uno su propio papel; el tope de duración en r2v es siempre de 10s — precargado con 8.

3.3 Referencia de voz: que el personaje hable con tu voz

La ranura de entrada de audio en referencia a video significa «referencia de voz» — sube una grabación de la voz objetivo y el personaje generado habla con esa voz, reproduciendo fielmente el acento, el tono y la tensión emocional. Las locuciones de marca, los clips de presentador virtual y los diálogos con varios personajes dependen de esto. En el prompt, nómbrala: «di la frase con la voz del Audio 1» — escribe la frase en sí directamente en el prompt, y los labios se sincronizan con la pronunciación automáticamente.

El nuevo eslogan del embajador de marca

Prompt

El embajador de marca de la Imagen 1 está de pie en el estudio minimalista de la Imagen 2, mira a cámara y dice el eslogan de la marca con la voz del Audio 1: «Haz de cada partida un paisaje». El tono es cálido y resuelto, los labios estrictamente sincronizados con la pronunciación, con una sonrisa leve en la palabra «paisaje». La cámara se acerca despacio hasta un primer plano de medio cuerpo. La apariencia se mantiene consistente con las imágenes de referencia, luz suave de estudio, un acabado limpio y premium.

Sube una imagen de retrato + una imagen de escenario + 1 pista de referencia de voz (la ranura de audio en r2v significa referencia de voz); escribe la frase en el prompt y deja la reproducción de la voz al audio.

3.4 Ancla de fotograma inicial: controla la composición de apertura

La referencia a video admite una subida extra de «fotograma inicial» para anclar el plano de apertura — la composición, la posición de cámara y la iluminación del primer fotograma quedan bajo tu control preciso, y el modelo se despliega según el prompt a partir del segundo fotograma. Un efecto secundario que conviene conocer: en cuanto se aporta un fotograma inicial, la relación de aspecto de salida lo sigue y el selector de aspecto deja de aplicar (en ese caso se ignora el parámetro de relación de aspecto).

La apertura del nuevo producto del barista

Prompt

Usa el fotograma inicial subido como plano de apertura: el barista de la Imagen 1 se gira desde detrás de la barra hacia la cámara, alza la nueva bebida insignia de la Imagen 2, el vapor sube de la taza, y sonríe mientras la presenta hacia el objetivo. La composición de apertura queda estrictamente anclada al fotograma inicial, y luego la cámara se acerca despacio hasta un primer plano de la bebida. Las apariencias de la persona y del producto se mantienen consistentes con las imágenes de referencia, en una atmósfera de cafetería cálida de tonos madera.

En modo r2v sube una imagen de fotograma inicial + 1-2 imágenes de referencia; en cuanto se aporta un fotograma inicial, la relación de aspecto lo sigue — que el selector de aspecto quede inerte es el comportamiento esperado.

04 Edición de video

Edita video con lenguaje llano — sube un video de origen de 2-10s y escribe una instrucción en lenguaje corriente: cambia el estilo, el atuendo, el objeto, y todo lo demás se queda como estaba. La duración de salida sigue automáticamente al video de origen (no hay selector de duración); la relación de aspecto ofrece seis opciones — auto sigue al origen por defecto, o fuerza una relación explícita como 16:9 o 9:16. También puedes adjuntar 1 imagen de referencia para enseñarle al modelo «en qué convertirlo». El control de audio es tu segunda pluma: el interruptor «conservar audio original» decide el destino de la pista de origen, y el diálogo de ajustes tiene un interruptor de «reescritura inteligente» (prompt_extend, activado por defecto) que expande automáticamente las instrucciones cortas con detalle.

4.1 Transferencia de estilo

Dale al clip entero una piel artística nueva: claymation, acuarela, pixel art, neón ciber — con una frase basta. Nombra tres rasgos del estilo objetivo — trazo, material, tono de color — y añade «mantener el movimiento de cámara y el ritmo tal cual», y el modelo cambia el aspecto sin tocar la historia.

Convertir metraje callejero en claymation

Prompt

Convierte este video a estilo claymation: formas redondeadas modeladas a mano con textura visible de huellas dactilares y material de arcilla, iluminación suave de set en miniatura, personajes y edificios con forma de arcilla moldeada, movimiento de cámara y ritmo exactamente iguales a los del original.

Sube un video de origen de 2-10s; se enruta a Wan 2.7 Video Edit automáticamente, la duración sigue al origen y la relación de aspecto queda en auto por defecto (sigue al origen). Nombrar el trío «forma + material + iluminación» es la receta de estilo más fiable.

4.2 Sustitución de elementos

Cambia atuendos, objetos y productos sin tocar el resto del plano: declara con claridad «sustituye A por B» y añade «mantener todo lo demás sin cambios». Las sustituciones son más precisas con una imagen de referencia — «la chaqueta de cuero de la Imagen 1» vale más que cien adjetivos.

Poner una chaqueta de cuero

Prompt

Sustituye la chaqueta del personaje en el video por la chaqueta de cuero marrón de la Imagen 1, con la tela plegándose de forma natural con el movimiento, su textura y la dirección de la luz a juego con la escena original, y todo lo demás sin cambios.

Sube un video de origen, opcionalmente con 1 imagen de referencia; «sustituye A por B + mantener todo lo demás» es la formulación de sustitución más fiable.

Referencia rápida de parámetros de Wan 2.7

Todos los niveles que el generador de Molyin expone realmente para la familia Wan 2.7.

Wan 2.7Wan 2.7 Video Edit
ModosTexto a video / Imagen a video / Referencia a videoEdición de video
Resolución720p / 1080p720p / 1080p
Duración2–15 sSigue el video de origen
Relación de aspecto16:9 / 9:16 / 1:1 / 4:3 / 3:4Sigue el video de origen
AudioAudio siempre activo, sin controlSigue el video de origen
Fotograma inicial y finalNo
Imágenes de referencia1–5Hasta 1
Videos de referenciaHasta 3No
Audio de referenciaNoNo
Devolver último fotogramaNoNo

Preguntas frecuentes

Las ocho preguntas más habituales, con respuestas que verificamos nosotros mismos.