Guía

Guía de Wan 3.0

Wan 3.0 unifica texto a video, imagen a video y referencia a video en un solo modelo — hasta 30 segundos por clip, con imágenes, videos y audio como entrada en cualquier combinación. Esta guía se organiza en torno a tareas creativas reales: desde la fórmula base, el interruptor de audio y la relación de aspecto adaptativa, hasta las referencias omni y el guion de videos largos de 30 segundos — cada ejemplo se precarga en el generador de Molyin con un clic.

Actualizado el 2026-08-06

01 Fórmula base

Wan 3.0 entiende instrucciones estructuradas: quién, qué hace, cómo se mueve la cámara, dónde y con qué tono. Este capítulo construye primero el esqueleto del prompt y luego repasa dos controles nuevos de 3.0 — el interruptor de audio y la relación de aspecto inteligente adaptive.

1.1 La fórmula básica del prompt

Todo empieza con una frase: sujeto y movimiento son las dos partes obligatorias; cámara, entorno y estética se apilan según necesites. La duración es un control deslizante continuo de 2-30s — planifica exactamente lo que cabe en esos segundos; para la escritura de videos largos de 30 segundos, ver el capítulo 4.

[Sujeto] + [Movimiento] + opcional [Cámara] [Entorno] [Estética]

Obligatorio

Sujeto

El protagonista: una persona, un animal o un producto. Cuanto más específico, mejor.

Obligatorio

Movimiento

Qué hace el sujeto, con las partes del cuerpo y el ritmo bien detallados. Los movimientos pequeños, lentos y coherentes son los más fiables.

Opcional

Cámara

Tamaño de plano y movimiento: primer plano, acercamiento, paneo. Para narrativas de varios planos, escribe el storyboard directamente, p. ej. «Plano 1 [0-3s] plano general».

Opcional

Entorno

Escena y atmósfera: lugar, hora, luz, clima.

Opcional

Estética

Dirección de arte y calidad: tono de color, textura, nitidez.

La librería de la esquina lluviosa

Prompt

En una noche de lluvia, en una esquina, una pequeña librería sigue encendida con cálida luz amarilla. La dueña, con un suéter beige, lleva una pila de libros hasta el alféizar del escaparate, alza la vista hacia la lluvia de fuera y sonríe mientras cuelga un letrero de madera de «Abierto». La cámara se acerca lentamente desde el otro lado de la calle hasta un primer plano del escaparate, las gotas de lluvia resbalan por el cristal, los letreros de neón proyectan reflejos sobre el pavimento mojado. Calidad cinematográfica, etalonaje de contraste cálido-frío, riqueza de detalle.

Dos frases para sujeto+movimiento, una para la cámara y otra para el entorno, palabras de estilo para cerrar — ese es un sólido prompt base de Wan 3.0.

1.2 El interruptor de audio: pieza terminada o material limpio

El audio de la familia Wan por fin tiene interruptor (el precio es el mismo en ambos casos): actívalo y la ambientación, los efectos de sonido y la banda sonora se generan junto con la imagen — lo que recibes es una pieza terminada; desactívalo y obtienes material limpio sin pista de audio, listo para tu propia música y postproducción. ¿Quieres una «pieza terminada»? Interruptor activado. ¿Quieres «metraje en bruto»? Interruptor desactivado — para trabajos comerciales que necesitan locución, subtítulos o un BGM sustituido, desactivarlo es el camino más limpio.

Metraje B-roll silencioso

Prompt

Un bosque de bambú al amanecer, una niebla fina deriva lentamente entre los troncos, la luz del sol se cuela oblicua entre las hojas formando haces de luz, unas hojas de bambú caen con el viento. La cámara panea despacio desde un ángulo bajo, el encuadre es sereno y etéreo, calidad documental, tonos verde azulado.

El interruptor de audio viene desactivado — tómalo como metraje de fondo y coloca encima tu propia música y narración, sin un BGM impuesto por el modelo que tengas que limpiar.

1.3 La relación de aspecto inteligente adaptive

El selector de relación de aspecto gana un nuevo valor por defecto adaptive: déjalo sin tocar y el modelo elige el lienzo a partir de tus medios de referencia y de la intención del contenido — el material de origen vertical produce salida vertical, la redacción cinematográfica produce horizontal, y la mayoría de las veces elige mejor que una conjetura humana. ¿Necesitas control preciso (digamos, un 9:16 fijo para colocación en feed)? Las cinco relaciones explícitas siguen ahí. Ante la duda, déjaselo a adaptive; cuando haya un requisito duro, fíjala explícitamente.

Teaser de vela aromática

Prompt

Una vela aromática artesanal arde en silencio sobre una mesa de madera natural, la llama parpadea con suavidad, la cera ámbar brilla tenue, con tela de lino y flores secas desenfocadas al fondo. La cámara orbita lentamente media vuelta alrededor de la vela, los puntos de luz se desplazan por la superficie de la mesa. Sensación premium minimalista, tonos cálidos, calidad de anuncio comercial.

Precargado con adaptive — el modelo elige el lienzo adecuado a partir de la intención «calidad de anuncio comercial»; cambia a una relación explícita en cuanto necesites fijarla.

02 Imagen a video

Un fotograma inicial más una descripción de movimiento, y Wan 3.0 da vida a la imagen — el centro de gravedad del prompt pasa de describir la escena a describir el movimiento, porque la escena ya existe. Un fotograma inicial fija la apertura; el fotograma inicial y final fija ambos extremos. Este capítulo cubre las dos jugadas.

2.1 Dar vida a las fotos

Un prompt de imagen a video cubre solo tres cosas: qué se mueve, cómo se mueve y si la cámara se mueve. No fuerces cosas que no están en la imagen; «despierta» las que sí están — tela que ondea, agua que fluye, luz de farol que parpadea son pequeños movimientos con alta tasa de acierto. Añade «mantener la textura original» y el estilo no derivará.

Luces del puerto pesquero

Prompt

Da vida a esta foto: en el puerto pesquero bajo el cielo nocturno, las lámparas de los barcos se encienden una tras otra, sus reflejos se mecen sobre el agua, las banderas de los mástiles ondean con suavidad en la brisa marina, y el haz del faro lejano barre lentamente el horizonte. La cámara permanece fija, conservando en todo momento la textura de película de tonos azules de la foto original.

Sube 1 imagen de fotograma inicial; escribe solo el movimiento sin repetir la escena, y deja que «mantener la textura original» sostenga el estilo.

2.2 Fotograma inicial y final: controla el principio y el final

Sube un fotograma inicial y uno final, y el modelo genera todo lo que hay en medio. Esto cambia tu forma de escribir el prompt: sáltate el principio y el final (ya están en las imágenes) y escribe solo «cómo ir de A a B» — el ritmo del cambio y cómo la cámara lo acompaña. Mantén ambas imágenes con la misma relación de aspecto, y cuanto mayor sea la distancia visual, más descripción del proceso deberías aportar.

Un árbol, cuatro estaciones

Prompt

El mismo árbol se transforma lentamente a partir de una copa primaveral en plena floración: los pétalos se van con el viento, las hojas verdes se espesan hasta dar sombra, luego se vuelven amarillas y rojas, hasta que solo quedan ramas cubiertas de nieve. La cámara retrocede despacio, la luz y la sombra de las cuatro estaciones fluyen con naturalidad, con la posición y el encuadre del árbol siguiendo estrictamente el fotograma inicial y el final.

En modo imagen a video, sube un fotograma inicial (primavera) + un fotograma final (invierno); 8 segundos les dan a las cuatro estaciones espacio para girar.

03 Referencias omni

La capacidad estrella de Wan 3.0: mezcla tres canales de medios de referencia — hasta 10 imágenes + 5 videos + 5 pistas de audio. Las imágenes mandan sobre la apariencia, los videos sobre el movimiento, el audio sobre la voz. Nómbralos en tu prompt como «Imagen 1», «Video 1», «Audio 1» según el orden de subida para asignarles su papel (los tres tipos de medio se numeran de forma independiente).

3.1 La fórmula de referencia multi-imagen

Un prompt de referencia a video tiene tres tiempos: sube los medios al escenario con «Imagen N», describe qué ocurre en la escena nueva y cierra con «mantener la consistencia». Varios ángulos del mismo sujeto funcionan mejor; pon un solo sujeto por imagen de referencia — los collages dejan al modelo sin saber quién es quién.

[Referencias: Imagen 1…] + [Descripción de la escena] + mantener [Sujeto] consistente

Obligatorio

Referencias

Hasta 10 imágenes de referencia, referenciadas como «Imagen N» según el orden de subida.

Opcional

Descripción de la escena

Qué ocurre en la escena nueva: acción, entorno, cámara — el encuadre se genera desde cero, todo dirigido por tus palabras.

Opcional

Consistencia

Un cierre con «mantener la consistencia con las imágenes de referencia» refuerza el bloqueo de apariencia.

El día del nuevo producto de la barista

Prompt

La barista de la Imagen 1, con el delantal verde oscuro de la Imagen 2, está de pie tras la barra de café minimalista de la Imagen 3 y empuja con suavidad un café de filtro hacia la cámara, con el arte latte de la espuma claramente visible, y alza la mirada con una sonrisa. La cámara retrocede despacio desde un primer plano de la taza hasta un plano medio, luz matinal de tonos cálidos, una atmósfera cotidiana acogedora y reconfortante. La persona, el atuendo y el escenario se mantienen consistentes con las imágenes de referencia.

Sube 3 imágenes de referencia (persona / atuendo / escenario); «Imagen 1», «Imagen 2» e «Imagen 3» nombran cada una su propio papel, y el cierre «mantener la consistencia» bloquea la apariencia.

3.2 Videos de referencia: migra el movimiento y el trabajo de cámara

Los videos de referencia mandan sobre «cómo se mueven las cosas»: el modelo aprende el ritmo de acción del personaje y el lenguaje de movimiento de la cámara a partir de tu video y los aplica a tu escena nueva. Tres reglas duras que recordar: hasta 5 videos de referencia con una longitud combinada de no más de 15 segundos; los segundos totales de los videos de referencia se descuentan del presupuesto de generación de 30 segundos (10 segundos de referencia dejan aproximadamente 20 segundos de salida); y cuando se usan como referencia de sujeto, mantén un solo sujeto por clip.

Tomar prestada la cámara de una película

Prompt

Sigue el movimiento de cámara y el ritmo de planos del Video 1: la cámara se eleva desde un ángulo bajo a la altura del escritorio, orbita media vuelta alrededor del sujeto, luego retrocede y se asienta. Coloca en escena la máquina de escribir vintage de la Imagen 1, golpeada por un par de manos invisibles sobre un escritorio a altas horas de la noche, con el papel temblando suavemente a cada pulsación y la lámpara del escritorio brillando cálida. El trabajo de cámara sigue estrictamente el Video 1, la apariencia del sujeto se mantiene consistente con la Imagen 1, calidad cinematográfica.

Sube 1 video de referencia + 1 imagen de sujeto; «sigue el movimiento de cámara y el ritmo de planos del Video 1» es la formulación estándar para migrar el lenguaje de cámara.

3.3 Audio de referencia: que el personaje hable con tu voz

El audio de referencia es el canal nuevo de la familia Wan: sube una grabación de voz limpia (hasta 5 pistas, no más de 15 segundos combinados) y el modelo clona su timbre, haciendo que el personaje en pantalla diga con esa voz las frases que escribiste. Nombra el «Audio 1» en el prompt y añade una línea de dirección de tono; los labios se sincronizan con la pronunciación automáticamente.

La frase de apertura de la fundadora

Prompt

La fundadora de la marca de la Imagen 1 está sentada en el estudio de madera natural de la Imagen 2, con algunas piezas artesanales de cuero dispuestas frente a ella. Mira a cámara y dice con naturalidad con la voz del Audio 1: «Ocho años de trabajo artesanal, y lo que más quiero decir sigue siendo: ve más despacio, y llegarás antes». Mantén el tono cálido y sin prisa y el ritmo de pausas del Audio 1, los labios estrictamente sincronizados con la pronunciación, y su apariencia consistente con las imágenes de referencia.

Sube 1 imagen de retrato + 1 imagen de escenario + 1 grabación de voz; «mantén el tono y el ritmo de pausas del Audio 1» es la formulación clave para una reproducción de voz de alta fidelidad.

04 Videos largos de 30 segundos y flujos de trabajo de campo

Los 30 segundos son el salto generacional de Wan 3.0 — un solo clip ya puede contar una historia completa. Este capítulo te da el método de escritura segmentada para videos largos, más el flujo de costos del veterano: borrador en 480p, cambio a un nivel superior para el corte final.

4.1 El guion segmentado de 30 segundos

La manera de escribir videos largos es cortar el clip en segmentos de tiempo: cada segmento declara sus segundos de inicio y fin, el contenido de la imagen y el trabajo de cámara, y un párrafo de configuración global al principio fija el estilo y la atmósfera. Ajusta la carga de acción a la longitud del segmento — meter 10 acciones en 3 segundos solo obliga al modelo a ir en avance rápido; si quieres un corte, nombra la transición dentro del segmento.

[Configuración global] + [Segundos de inicio-fin] + [Contenido de imagen y cámara] + opcional [Transición]

Obligatorio

Segmento de tiempo

Segundos de inicio y fin explícitos (p. ej. 0-5s, 5-12s). Cortar 30 segundos en 3-5 segmentos es lo más estable.

Obligatorio

Imagen y cámara

Qué ocurre en este segmento y cómo se mueve la cámara — con la carga de acción ajustada a la longitud del segmento.

Opcional

Configuración global

Un párrafo de apertura que fija el estilo, el tono de color, la atmósfera y las prohibiciones duras para todo el clip.

Opcional

Transición

Cómo se unen los segmentos: corte natural, fundido encadenado, cortinilla — basta con nombrarla.

Una ciudad despierta en 30 segundos

Prompt

[Configuración global] Estilo documental aéreo, un degradado de color del azul frío del alba al dorado cálido, iluminación físicamente real, sin subtítulos, sin banda sonora (solo sonido ambiente puro). 0-6s: El horizonte urbano antes del amanecer, luces esparcidas como estrellas, nubes bajas, la cámara se acerca lentamente desde gran altura. 6-14s: El horizonte clarea hacia el alba; la cámara desciende a través de la capa de nubes mientras la silueta de la ciudad se afila poco a poco, y un tren ligero madrugador se desliza entre los edificios arrastrando una estela de luz. 14-22s: La cámara baja a nivel de calle y avanza en travelling: una tienda de desayunos sube su persiana, el vapor se eleva de las vaporeras de bambú, un ciclista cruza la luz de la mañana — la ciudad empieza a despertar. 22-30s: El sol salta sobre el horizonte; la cámara asciende rápido de vuelta a gran altura, la ciudad entera bañada en luz dorada de la mañana, y el encuadre se congela en un majestuoso plano general.

La configuración global marca el tono y cuatro segmentos se reparten cada tramo — escribe primero el esqueleto de un clip de 30 segundos y luego rellena la carne, y el ritmo no se desmoronará.

4.2 El flujo de borrador en 480p

El flujo del veterano: haz el borrador en 480p durante la fase creativa — a aproximadamente una cuarta parte del costo de 1080p — y una vez que la composición, el movimiento y el ritmo cuadren, cambia el mismo prompt a 1080p para el corte final. Diez revisiones en fase de borrador no duelen; el final sale a la primera.

El skater (versión borrador)

Prompt

En un skatepark al atardecer, un adolescente con sudadera oversize se lanza desde la rampa, salta, hace girar la tabla, aterriza firme, avanza hacia la cámara y frena en seco justo delante, con el polvo levantado claramente visible a contraluz. La cámara lo sigue desde un ángulo bajo, luego orbita media vuelta y se detiene en su cara sonriente. Cámara rápida con sensación de velocidad, estilo documental callejero, tonos dorados cálidos.

Precargado con 480p — valida primero la acción y el trabajo de cámara con este; cuando estés satisfecho, cambia la resolución a 1080p, estira la duración y lanza el mismo prompt para el corte final.

Referencia rápida de parámetros de Wan 3.0 (vs 2.7)

Todos los niveles que el generador de Molyin expone realmente para Wan 3.0, comparados lado a lado con Wan 2.7.

Wan 3.0Wan 2.7
ModosTexto a video / Imagen a video / Referencia a videoTexto a video / Imagen a video / Referencia a video
Resolución480p / 720p / 1080p720p / 1080p
Duración2–30 s2–15 s
Relación de aspectoauto / 16:9 / 9:16 / 1:1 / 4:3 / 3:416:9 / 9:16 / 1:1 / 4:3 / 3:4
AudioAudio activado por defecto, sin parámetro de control
Fotograma inicial y final
Imágenes de referencia1–101–5
Videos de referenciaHasta 3Hasta 3
Audio de referenciaHasta 5No
Devolver último fotogramaNoNo

Preguntas frecuentes

Las ocho preguntas más habituales, con respuestas que verificamos nosotros mismos.