01 Fórmula base
Wan 3.0 entiende instrucciones estructuradas: quién, qué hace, cómo se mueve la cámara, dónde y con qué tono. Este capítulo construye primero el esqueleto del prompt y luego repasa dos controles nuevos de 3.0 — el interruptor de audio y la relación de aspecto inteligente adaptive.
1.1 La fórmula básica del prompt
Todo empieza con una frase: sujeto y movimiento son las dos partes obligatorias; cámara, entorno y estética se apilan según necesites. La duración es un control deslizante continuo de 2-30s — planifica exactamente lo que cabe en esos segundos; para la escritura de videos largos de 30 segundos, ver el capítulo 4.
[Sujeto] + [Movimiento] + opcional [Cámara] [Entorno] [Estética]
Sujeto
El protagonista: una persona, un animal o un producto. Cuanto más específico, mejor.
Movimiento
Qué hace el sujeto, con las partes del cuerpo y el ritmo bien detallados. Los movimientos pequeños, lentos y coherentes son los más fiables.
Cámara
Tamaño de plano y movimiento: primer plano, acercamiento, paneo. Para narrativas de varios planos, escribe el storyboard directamente, p. ej. «Plano 1 [0-3s] plano general».
Entorno
Escena y atmósfera: lugar, hora, luz, clima.
Estética
Dirección de arte y calidad: tono de color, textura, nitidez.
La librería de la esquina lluviosa
Prompt
En una noche de lluvia, en una esquina, una pequeña librería sigue encendida con cálida luz amarilla. La dueña, con un suéter beige, lleva una pila de libros hasta el alféizar del escaparate, alza la vista hacia la lluvia de fuera y sonríe mientras cuelga un letrero de madera de «Abierto». La cámara se acerca lentamente desde el otro lado de la calle hasta un primer plano del escaparate, las gotas de lluvia resbalan por el cristal, los letreros de neón proyectan reflejos sobre el pavimento mojado. Calidad cinematográfica, etalonaje de contraste cálido-frío, riqueza de detalle.
Dos frases para sujeto+movimiento, una para la cámara y otra para el entorno, palabras de estilo para cerrar — ese es un sólido prompt base de Wan 3.0.
1.2 El interruptor de audio: pieza terminada o material limpio
El audio de la familia Wan por fin tiene interruptor (el precio es el mismo en ambos casos): actívalo y la ambientación, los efectos de sonido y la banda sonora se generan junto con la imagen — lo que recibes es una pieza terminada; desactívalo y obtienes material limpio sin pista de audio, listo para tu propia música y postproducción. ¿Quieres una «pieza terminada»? Interruptor activado. ¿Quieres «metraje en bruto»? Interruptor desactivado — para trabajos comerciales que necesitan locución, subtítulos o un BGM sustituido, desactivarlo es el camino más limpio.
Metraje B-roll silencioso
Prompt
Un bosque de bambú al amanecer, una niebla fina deriva lentamente entre los troncos, la luz del sol se cuela oblicua entre las hojas formando haces de luz, unas hojas de bambú caen con el viento. La cámara panea despacio desde un ángulo bajo, el encuadre es sereno y etéreo, calidad documental, tonos verde azulado.
El interruptor de audio viene desactivado — tómalo como metraje de fondo y coloca encima tu propia música y narración, sin un BGM impuesto por el modelo que tengas que limpiar.
1.3 La relación de aspecto inteligente adaptive
El selector de relación de aspecto gana un nuevo valor por defecto adaptive: déjalo sin tocar y el modelo elige el lienzo a partir de tus medios de referencia y de la intención del contenido — el material de origen vertical produce salida vertical, la redacción cinematográfica produce horizontal, y la mayoría de las veces elige mejor que una conjetura humana. ¿Necesitas control preciso (digamos, un 9:16 fijo para colocación en feed)? Las cinco relaciones explícitas siguen ahí. Ante la duda, déjaselo a adaptive; cuando haya un requisito duro, fíjala explícitamente.
Teaser de vela aromática
Prompt
Una vela aromática artesanal arde en silencio sobre una mesa de madera natural, la llama parpadea con suavidad, la cera ámbar brilla tenue, con tela de lino y flores secas desenfocadas al fondo. La cámara orbita lentamente media vuelta alrededor de la vela, los puntos de luz se desplazan por la superficie de la mesa. Sensación premium minimalista, tonos cálidos, calidad de anuncio comercial.
Precargado con adaptive — el modelo elige el lienzo adecuado a partir de la intención «calidad de anuncio comercial»; cambia a una relación explícita en cuanto necesites fijarla.
02 Imagen a video
Un fotograma inicial más una descripción de movimiento, y Wan 3.0 da vida a la imagen — el centro de gravedad del prompt pasa de describir la escena a describir el movimiento, porque la escena ya existe. Un fotograma inicial fija la apertura; el fotograma inicial y final fija ambos extremos. Este capítulo cubre las dos jugadas.
2.1 Dar vida a las fotos
Un prompt de imagen a video cubre solo tres cosas: qué se mueve, cómo se mueve y si la cámara se mueve. No fuerces cosas que no están en la imagen; «despierta» las que sí están — tela que ondea, agua que fluye, luz de farol que parpadea son pequeños movimientos con alta tasa de acierto. Añade «mantener la textura original» y el estilo no derivará.
Luces del puerto pesquero
Prompt
Da vida a esta foto: en el puerto pesquero bajo el cielo nocturno, las lámparas de los barcos se encienden una tras otra, sus reflejos se mecen sobre el agua, las banderas de los mástiles ondean con suavidad en la brisa marina, y el haz del faro lejano barre lentamente el horizonte. La cámara permanece fija, conservando en todo momento la textura de película de tonos azules de la foto original.
Sube 1 imagen de fotograma inicial; escribe solo el movimiento sin repetir la escena, y deja que «mantener la textura original» sostenga el estilo.
2.2 Fotograma inicial y final: controla el principio y el final
Sube un fotograma inicial y uno final, y el modelo genera todo lo que hay en medio. Esto cambia tu forma de escribir el prompt: sáltate el principio y el final (ya están en las imágenes) y escribe solo «cómo ir de A a B» — el ritmo del cambio y cómo la cámara lo acompaña. Mantén ambas imágenes con la misma relación de aspecto, y cuanto mayor sea la distancia visual, más descripción del proceso deberías aportar.
Un árbol, cuatro estaciones
Prompt
El mismo árbol se transforma lentamente a partir de una copa primaveral en plena floración: los pétalos se van con el viento, las hojas verdes se espesan hasta dar sombra, luego se vuelven amarillas y rojas, hasta que solo quedan ramas cubiertas de nieve. La cámara retrocede despacio, la luz y la sombra de las cuatro estaciones fluyen con naturalidad, con la posición y el encuadre del árbol siguiendo estrictamente el fotograma inicial y el final.
En modo imagen a video, sube un fotograma inicial (primavera) + un fotograma final (invierno); 8 segundos les dan a las cuatro estaciones espacio para girar.
03 Referencias omni
La capacidad estrella de Wan 3.0: mezcla tres canales de medios de referencia — hasta 10 imágenes + 5 videos + 5 pistas de audio. Las imágenes mandan sobre la apariencia, los videos sobre el movimiento, el audio sobre la voz. Nómbralos en tu prompt como «Imagen 1», «Video 1», «Audio 1» según el orden de subida para asignarles su papel (los tres tipos de medio se numeran de forma independiente).
3.1 La fórmula de referencia multi-imagen
Un prompt de referencia a video tiene tres tiempos: sube los medios al escenario con «Imagen N», describe qué ocurre en la escena nueva y cierra con «mantener la consistencia». Varios ángulos del mismo sujeto funcionan mejor; pon un solo sujeto por imagen de referencia — los collages dejan al modelo sin saber quién es quién.
[Referencias: Imagen 1…] + [Descripción de la escena] + mantener [Sujeto] consistente
Referencias
Hasta 10 imágenes de referencia, referenciadas como «Imagen N» según el orden de subida.
Descripción de la escena
Qué ocurre en la escena nueva: acción, entorno, cámara — el encuadre se genera desde cero, todo dirigido por tus palabras.
Consistencia
Un cierre con «mantener la consistencia con las imágenes de referencia» refuerza el bloqueo de apariencia.
El día del nuevo producto de la barista
Prompt
La barista de la Imagen 1, con el delantal verde oscuro de la Imagen 2, está de pie tras la barra de café minimalista de la Imagen 3 y empuja con suavidad un café de filtro hacia la cámara, con el arte latte de la espuma claramente visible, y alza la mirada con una sonrisa. La cámara retrocede despacio desde un primer plano de la taza hasta un plano medio, luz matinal de tonos cálidos, una atmósfera cotidiana acogedora y reconfortante. La persona, el atuendo y el escenario se mantienen consistentes con las imágenes de referencia.
Sube 3 imágenes de referencia (persona / atuendo / escenario); «Imagen 1», «Imagen 2» e «Imagen 3» nombran cada una su propio papel, y el cierre «mantener la consistencia» bloquea la apariencia.
3.2 Videos de referencia: migra el movimiento y el trabajo de cámara
Los videos de referencia mandan sobre «cómo se mueven las cosas»: el modelo aprende el ritmo de acción del personaje y el lenguaje de movimiento de la cámara a partir de tu video y los aplica a tu escena nueva. Tres reglas duras que recordar: hasta 5 videos de referencia con una longitud combinada de no más de 15 segundos; los segundos totales de los videos de referencia se descuentan del presupuesto de generación de 30 segundos (10 segundos de referencia dejan aproximadamente 20 segundos de salida); y cuando se usan como referencia de sujeto, mantén un solo sujeto por clip.
Tomar prestada la cámara de una película
Prompt
Sigue el movimiento de cámara y el ritmo de planos del Video 1: la cámara se eleva desde un ángulo bajo a la altura del escritorio, orbita media vuelta alrededor del sujeto, luego retrocede y se asienta. Coloca en escena la máquina de escribir vintage de la Imagen 1, golpeada por un par de manos invisibles sobre un escritorio a altas horas de la noche, con el papel temblando suavemente a cada pulsación y la lámpara del escritorio brillando cálida. El trabajo de cámara sigue estrictamente el Video 1, la apariencia del sujeto se mantiene consistente con la Imagen 1, calidad cinematográfica.
Sube 1 video de referencia + 1 imagen de sujeto; «sigue el movimiento de cámara y el ritmo de planos del Video 1» es la formulación estándar para migrar el lenguaje de cámara.
3.3 Audio de referencia: que el personaje hable con tu voz
El audio de referencia es el canal nuevo de la familia Wan: sube una grabación de voz limpia (hasta 5 pistas, no más de 15 segundos combinados) y el modelo clona su timbre, haciendo que el personaje en pantalla diga con esa voz las frases que escribiste. Nombra el «Audio 1» en el prompt y añade una línea de dirección de tono; los labios se sincronizan con la pronunciación automáticamente.
La frase de apertura de la fundadora
Prompt
La fundadora de la marca de la Imagen 1 está sentada en el estudio de madera natural de la Imagen 2, con algunas piezas artesanales de cuero dispuestas frente a ella. Mira a cámara y dice con naturalidad con la voz del Audio 1: «Ocho años de trabajo artesanal, y lo que más quiero decir sigue siendo: ve más despacio, y llegarás antes». Mantén el tono cálido y sin prisa y el ritmo de pausas del Audio 1, los labios estrictamente sincronizados con la pronunciación, y su apariencia consistente con las imágenes de referencia.
Sube 1 imagen de retrato + 1 imagen de escenario + 1 grabación de voz; «mantén el tono y el ritmo de pausas del Audio 1» es la formulación clave para una reproducción de voz de alta fidelidad.
04 Videos largos de 30 segundos y flujos de trabajo de campo
Los 30 segundos son el salto generacional de Wan 3.0 — un solo clip ya puede contar una historia completa. Este capítulo te da el método de escritura segmentada para videos largos, más el flujo de costos del veterano: borrador en 480p, cambio a un nivel superior para el corte final.
4.1 El guion segmentado de 30 segundos
La manera de escribir videos largos es cortar el clip en segmentos de tiempo: cada segmento declara sus segundos de inicio y fin, el contenido de la imagen y el trabajo de cámara, y un párrafo de configuración global al principio fija el estilo y la atmósfera. Ajusta la carga de acción a la longitud del segmento — meter 10 acciones en 3 segundos solo obliga al modelo a ir en avance rápido; si quieres un corte, nombra la transición dentro del segmento.
[Configuración global] + [Segundos de inicio-fin] + [Contenido de imagen y cámara] + opcional [Transición]
Segmento de tiempo
Segundos de inicio y fin explícitos (p. ej. 0-5s, 5-12s). Cortar 30 segundos en 3-5 segmentos es lo más estable.
Imagen y cámara
Qué ocurre en este segmento y cómo se mueve la cámara — con la carga de acción ajustada a la longitud del segmento.
Configuración global
Un párrafo de apertura que fija el estilo, el tono de color, la atmósfera y las prohibiciones duras para todo el clip.
Transición
Cómo se unen los segmentos: corte natural, fundido encadenado, cortinilla — basta con nombrarla.
Una ciudad despierta en 30 segundos
Prompt
[Configuración global] Estilo documental aéreo, un degradado de color del azul frío del alba al dorado cálido, iluminación físicamente real, sin subtítulos, sin banda sonora (solo sonido ambiente puro). 0-6s: El horizonte urbano antes del amanecer, luces esparcidas como estrellas, nubes bajas, la cámara se acerca lentamente desde gran altura. 6-14s: El horizonte clarea hacia el alba; la cámara desciende a través de la capa de nubes mientras la silueta de la ciudad se afila poco a poco, y un tren ligero madrugador se desliza entre los edificios arrastrando una estela de luz. 14-22s: La cámara baja a nivel de calle y avanza en travelling: una tienda de desayunos sube su persiana, el vapor se eleva de las vaporeras de bambú, un ciclista cruza la luz de la mañana — la ciudad empieza a despertar. 22-30s: El sol salta sobre el horizonte; la cámara asciende rápido de vuelta a gran altura, la ciudad entera bañada en luz dorada de la mañana, y el encuadre se congela en un majestuoso plano general.
La configuración global marca el tono y cuatro segmentos se reparten cada tramo — escribe primero el esqueleto de un clip de 30 segundos y luego rellena la carne, y el ritmo no se desmoronará.
4.2 El flujo de borrador en 480p
El flujo del veterano: haz el borrador en 480p durante la fase creativa — a aproximadamente una cuarta parte del costo de 1080p — y una vez que la composición, el movimiento y el ritmo cuadren, cambia el mismo prompt a 1080p para el corte final. Diez revisiones en fase de borrador no duelen; el final sale a la primera.
El skater (versión borrador)
Prompt
En un skatepark al atardecer, un adolescente con sudadera oversize se lanza desde la rampa, salta, hace girar la tabla, aterriza firme, avanza hacia la cámara y frena en seco justo delante, con el polvo levantado claramente visible a contraluz. La cámara lo sigue desde un ángulo bajo, luego orbita media vuelta y se detiene en su cara sonriente. Cámara rápida con sensación de velocidad, estilo documental callejero, tonos dorados cálidos.
Precargado con 480p — valida primero la acción y el trabajo de cámara con este; cuando estés satisfecho, cambia la resolución a 1080p, estira la duración y lanza el mismo prompt para el corte final.