Guía

Guía de Veo 3.1

De la fórmula central al audio nativo, la imagen a video y la referencia a video con Fast — cada capítulo incluye prompts de ejemplo que puedes enviar tal cual, y un clic en «Probar» rellena automáticamente el generador de Molyin. La función estrella de Veo 3.1 es que cada clip viene con sonido: efectos, diálogos y música se generan junto con la imagen, sincronizados automáticamente. Esta guía trata la escritura de audio como una habilidad de primer orden y la cubre capítulo a capítulo.

Actualizado el 2026-08-12

01 La fórmula central

Veo 3.1 entiende la dirección estructurada: quién, qué hace, cómo se mueve la cámara, dónde y cómo suena. Este capítulo descompone un buen prompt en cinco partes reutilizables — y fíjate en que la quinta es el sonido, porque cada clip de Veo lleva audio. Escribir el sonido no es un deber opcional; es parte del oficio.

1.1 La fórmula básica del prompt

Todo empieza con una frase: sujeto y movimiento son las dos partes obligatorias; cámara, entorno y audio se añaden según haga falta. La duración de Veo 3.1 está fijada en 8 segundos — trátala como una unidad narrativa, no como una limitación: 8 segundos son exactamente un beat completo (un sujeto, una acción central, un movimiento de cámara). Antes de escribir, pregúntate: si en estos 8 segundos solo pasa una cosa, ¿cuál es? Una segunda acción metida con calzador suele significar que las dos salen mal.

[Sujeto] + [Movimiento] + opcional [Cámara] [Entorno] [Audio]

Obligatorio

Sujeto

El protagonista del encuadre — una persona, un animal o un producto. Cuanto más concreto, mejor.

Obligatorio

Movimiento

Qué hace el sujeto, detallando partes del cuerpo y ritmo; una acción central por cada 8 segundos.

Opcional

Cámara

Encuadre y movimiento de cámara: primer plano, acercamiento, travelling — un solo movimiento por plano.

Opcional

Entorno

Escenario y atmósfera: lugar, hora del día, iluminación, clima.

Opcional

Audio

Efectos de sonido, diálogos, música — cada clip de Veo lleva audio; si lo dejas en blanco, el modelo improvisa.

Amanecer en el puerto pesquero

Prompt

Un puerto pesquero al amanecer. Unas barcas de madera suben y bajan con el oleaje mientras un viejo pescador con sombrero cónico, de pie en la proa, se inclina para recoger una red chorreante, vuelta a vuelta. La cámara se acerca lentamente desde un ángulo bajo en el muelle mientras la luz dorada de la mañana se extiende sobre el agua. Audio: olas que lamen los cascos, gaviotas que chillan al pasar rozando, el repiqueteo del agua sacudida de la red, el retumbo grave de un motor diésel a lo lejos.

Dos frases para sujeto + movimiento, una para la cámara y otra para el entorno, y para cerrar, nombrar los sonidos — eso es un prompt básico de Veo sólido. Sugerido: 1080p, 16:9.

1.2 El lenguaje de cámara

Veo 3.1 ejecuta los términos de cámara con fiabilidad: acercamiento, retroceso, travelling/seguimiento, órbita y grúa aterrizan todos con precisión. Una regla de disciplina — asigna a cada plano de 8 segundos un único movimiento de cámara; apilar acercamiento, órbita y paneo solo te compra metraje a la deriva. El término de cámara puede ir al principio o al final de la frase, pero solo puede haber uno por clip.

Un travelling por el mercado matinal

Prompt

Un mercado al aire libre a primera hora de la mañana. La cámara avanza lentamente en travelling a lo largo de una hilera de puestos: cestas de bambú colmadas de verduras cubiertas de rocío, un vendedor que levanta la tapa de una vaporera de bambú mientras brota un vapor blanco, una anciana que escoge tomates y va echando su elección en una bolsa de tela. La luz de la mañana entra sesgada por los huecos de los toldos de lona, con motas de polvo flotando en los haces. Audio: vendedores voceando unos sobre otros, el crujido de bolsas de plástico, el siseo de la tapa de la vaporera al levantarse — vivo y lleno de vida cotidiana.

«La cámara avanza lentamente en travelling a lo largo de…» es la forma más fiable de escribir un travelling; encadena lo que se ve en el orden en que la cámara lo va pasando. Un solo movimiento — el travelling — para los 8 segundos completos.

1.3 Control de estilo

Las palabras de estilo fijan la dirección de arte de todo el clip — su posición es flexible, pero no pueden faltar: «cinematográfico», «animación 3D», «ilustración en acuarela», «stop-motion» y «documental cámara en mano» son todos términos de alta efectividad. Mantén el estilo coherente consigo mismo: un mundo de origami debería sonar a papel que cruje. Cuando imagen y sonido se escriben en el mismo estilo, el resultado se siente como un mundo completo.

Un ciervo en un bosque de origami

Prompt

Un mundo hecho de origami: capas y capas de árboles de papel plegado. Un ciervo de papel sale de detrás de un árbol, baja la cabeza para olfatear una flor de origami y luego la levanta, con un leve tic de sus orejas de papel. La cámara se acerca lentamente hasta una vista lateral del ciervo. Aire de stop-motion, luz de estudio suave, textura de papel visible. Audio: el delicado crujir del papel, una partitura de xilófono ligera y juguetona — como abrir un libro desplegable de cuentos.

Las palabras de estilo «aire de stop-motion + textura de papel» marcan el tono, y el audio acompaña con crujido de papel y xilófono — un mundo, un estilo. Sugerido: 1080p.

02 Audio nativo

El audio siempre activo es la función estrella de Veo 3.1: cada clip viene con sonido, no hay interruptor de apagado y no se necesita doblaje en posproducción — efectos, diálogos y música se generan con la imagen, sincronizados automáticamente. Eso convierte la escritura de audio en una habilidad central del prompting de Veo: cuanto más específico seas, más preciso el resultado; si no escribes nada, el modelo improvisa — y no siempre con la atmósfera que buscabas. Este capítulo divide el sonido en efectos, diálogos y música, y los cubre uno por uno.

2.1 Diseño de sonido

Los efectos de sonido se escriben con la pauta «nómbralo + ponlo en capas»: enumera cada sonido que quieras y luego indica cuál está en primer plano y cuál a lo lejos — primero el sonido principal cercano, los detalles en medio, el telón de fondo lejano al final. Combina la onomatopeya con su fuente para obtener los mejores resultados: «el trueno retumba» supera a «hay truenos», y «lluvia que tamborilea sobre un techo de chapa» supera a «sonidos de lluvia».

Una tormenta estalla sobre el bosque

Prompt

Un bosque de coníferas en plena tormenta. Un viento huracanado dobla las copas hacia un lado, los relámpagos desgarran el cielo oscuro, gruesas gotas de lluvia martillean las hojas de los helechos y un arroyo de montaña se precipita entre las rocas. Plano estático en contrapicado entre los árboles, el encuadre se enciende con cada relámpago. Audio: lluvia densa que tamborilea de cerca sobre las hojas, el viento que aúlla a través del bosque, el arroyo que ruge, y entonces un trueno que estalla justo encima y rueda alejándose en la distancia.

Pon el audio en capas — lluvia cercana, viento y agua, el trueno viajando de cerca a lejos — dándole al trueno un arco completo. 8 segundos son exactamente el recorrido completo de un solo trueno.

2.2 Diálogo de personajes

El diálogo se escribe con la pauta «líneas entre comillas + quién habla + cómo»: pon las palabras exactas entre comillas, identifica al hablante por su aspecto y añade una indicación de tono como «con una sonrisa» o «en voz baja». El modelo sincroniza los labios automáticamente — en 8 segundos caben una o dos líneas cortas; cuanto más corta la línea, más estable la sincronía. Para conversaciones más largas, dividirlas en dos clips funciona mejor.

La cata del chef

Prompt

En la cocina de un restaurante, un chef de mediana edad con delantal oscuro levanta una cucharada de sopa, sopla, la prueba y cierra los ojos un segundo. Se gira hacia el joven ayudante que tiene al lado y dice con una sonrisa: «Falta una cosa: wasabi. Solo un toque». El ayudante se queda paralizado un instante, luego asiente y sale disparado hacia el estante de especias. Plano medio estático, la luz del fogón juega sobre ambos rostros. Audio: la olla de sopa burbujeando, el zumbido grave de la campana extractora, la voz serena del chef, el tintineo brillante de espátulas al fondo.

Una línea corta entre comillas, el hablante identificado como «el chef del delantal oscuro», con la indicación de tono «con una sonrisa» — y al final, las capas de sonidos de cocina. Sugerido: 16:9.

2.3 Música y atmósfera

La música se escribe como un trío de «género + ánimo + instrumentos»: «jazz animado» es vago, mientras que «un trío de jazz relajado, escobillas trazando círculos sobre la caja» es preciso. Ajusta la partitura al ritmo de la imagen — los montajes de cortes rápidos piden tempo enérgico, los planos largos piden un colchón ambiental. En pasajes puramente visuales sin diálogo ni efectos, la música es la única voz de la mezcla y merece esa frase extra.

Una ciudad ribereña al atardecer

Prompt

Una ciudad junto al agua al atardecer: un ferry surca aguas doradas mientras atraca, las torres de oficinas atrapan el sol poniente en su cristal, los peatones de una pasarela arrastran sombras largas, y una tienda de discos de esquina enciende sus lámparas cálidas. La cámara deriva entre estas cuatro viñetas, con un ánimo cálido y nostálgico. Música: un trío de jazz relajado — contrabajo pizzicato como cimiento, escobillas trazando círculos suaves sobre la caja, un saxofón que entra de vez en cuando con una frase. Distendido, melancólico.

La música está detallada como «trío de jazz + nostalgia relajada + contrabajo/escobillas/saxofón» — el trío completo, a juego con el ritmo de un montaje al atardecer. Sugerido: 1080p.

03 Imagen a video

Una imagen de primer fotograma más una descripción de movimiento — Veo 3.1 da vida al encuadre. El foco de tu prompt pasa de describir la imagen a describir el movimiento, porque la imagen ya existe. Una regla práctica: recorta tu imagen al formato objetivo (16:9 o 9:16) antes de subirla, para que el encuadre quede en tus manos y ningún contenido clave se pierda por el recorte automático. Escribe el sonido como de costumbre: una imagen fija no lleva información de audio, así que los efectos y la música salen enteramente de tu prompt.

3.1 Dar vida al encuadre

Un prompt de imagen a video escribe solo tres cosas: qué se mueve, cómo se mueve y si la cámara se mueve. No fuerces cosas que no están en la imagen — pero todo lo que ya está ahí puede despertarse: el vuelo de un abrigo, nubes que pasan, una llama que parpadea. Los movimientos pequeños son los que aciertan con más fiabilidad. Añade una línea — «conservar la textura original de la imagen» — y el estilo no se desviará.

Un boceto a mano cobra vida

Prompt

Da vida a este boceto hecho a mano: la chica de pie en el puente, su cabello y su bufanda se agitan suavemente con el viento. Levanta una mano para recogerse un mechón revuelto detrás de la oreja, las líneas entintadas del río bajo el puente ondulan con luz fluida, y las nubes dibujadas a lápiz pasan lentamente por encima. La cámara permanece fija; el movimiento es sutil y natural, conservando en todo momento la textura original de boceto a lápiz y el grano del papel. Audio: una brisa suave, un leve crujido como de papel, una pieza tranquila de piano solo.

Requiere 1 imagen de primer fotograma; escribe solo el movimiento, nunca vuelvas a describir la escena, y deja que «conservar la textura original de boceto a lápiz» sostenga el estilo.

3.2 Presentación de producto

Para clips de producto de e-commerce, el prompt cubre dos cosas: cómo se mueve el producto (girar, levitar, inclinarse) y cómo lo acompaña la cámara (orbitar, acercarse). Añade una línea — «mantén el producto idéntico a la imagen» — para fijar los detalles, y luego nombra la iluminación y el fondo. El audio es el detalle que la mayoría de los clips de producto olvida: el clic de la tapa de una caja, una partitura con aire premium — pequeñas cosas que mueven la conversión.

Una zapatilla de running levitando

Prompt

La zapatilla de running de la imagen se eleva lentamente sobre un fondo gris oscuro, levitando mientras da una vuelta completa y uniforme — la textura tejida del empeine y sus tiras reflectantes capturan la luz. La cámara se acerca lentamente hasta un primer plano de la mediasuela, revelando la estructura de amortiguación. Mantén el producto idéntico a la imagen. Iluminación de estudio, estética limpia y premium. Audio: un suave silbido cuando la zapatilla se eleva, respaldado por una partitura electrónica minimalista de sabor tecnológico con un beat constante.

Requiere 1 imagen de producto; «una rotación completa + acercamiento a primer plano» es la combinación clásica de presentación de producto, con una partitura de estilo tecnológico a juego.

04 Referencia a video y Fast

Veo 3.1 Fast es el nivel económico para producir en volumen: las mismas especificaciones de imagen que el modelo estándar (720p/1080p/4K, 8 segundos, audio siempre activo) a un precio más amable — ideal para borradores y producción por lotes. Además posee en exclusiva una capacidad: la referencia a video (r2v). Sube 1–3 imágenes de referencia para fijar la apariencia de un personaje y enviarlo a cualquier escena nueva. Regla estricta: la salida de referencia a video está bloqueada en 16:9 horizontal; para video vertical, vuelve a texto a video o imagen a video.

4.1 La fórmula de referencia de personajes

Un prompt de referencia a video es una estructura de tres partes: saca los materiales a escena con «Imagen N», describe qué ocurre en la nueva escena y cierra con una línea de consistencia. El orden de subida es el orden de numeración — la primera subida es la Imagen 1, la segunda la Imagen 2, hasta 3 imágenes. Varios ángulos del mismo personaje funcionan mejor; el modelo construye con ellos un expediente de identidad completo.

[Referencias: Imagen 1…Imagen 3] + [Descripción de la escena] + mantener [sujeto] consistente

Obligatorio

Imágenes de referencia

Hasta 3 imágenes, citadas en el prompt como «Imagen N»; el orden de subida es el orden de numeración.

Opcional

Descripción de la escena

Qué ocurre en la nueva escena: acción, entorno, cámara, audio.

Opcional

Consistencia

Una línea de cierre como «mantenlo idéntico a las imágenes de referencia» refuerza el anclaje.

Una mascota robot baila en la plaza

Prompt

La pequeña mascota robot blanca de cabeza redonda de la Imagen 1 y la Imagen 2 aparece de noche en una plaza de la ciudad, con una pantalla gigante en el suelo por la que fluye luz de colores. Se arranca a bailar street dance al ritmo de la música: deslizamientos de lado a lado, freezes robóticos y una pose final con un brazo en alto. La cámara la orbita media vuelta a distancia media. Mantén la mascota idéntica a las imágenes de referencia; calidad de animación 3D. Audio: un tema de funk enérgico, leves zumbidos mecánicos de las articulaciones del robot y un golpe de sonido nítido en el freeze final.

Requiere 1–3 imágenes de referencia; este ejemplo cambia automáticamente a Veo 3.1 Fast con salida en 16:9 horizontal. Varios ángulos del mismo personaje dan la mejor consistencia.

Clara en el archivo (ejemplo oficial de consistencia)

Prompt

A medium shot, with the camera slowly dollying forward in a dimly lit, grand Parisian archive. Dust motes dance in a single beam of light from a high window. Clara, a historian in her early 30s, with observant, dark brown eyes that hold a quiet intensity. She has chin-length, black hair styled in a classic bob. She is dressed in a sophisticated, dark navy-blue wool coat, with a silk scarf patterned with subtle gold and cream designs tied around her neck. She stands before a large, ancient wooden table, carefully turning the fragile, yellowed page of a massive, leather-bound book. Her expression is one of deep concentration. In a voice that is crisp and clear, with a thoughtful, analytical tone and a standard American accent, Clara says: It has to be here.

El ejemplo textual de la documentación oficial de mejores prácticas de Google: la apariencia y la voz se describen en un párrafo detallado y se reutilizan palabra por palabra en cada escena nueva, cambiando solo la acción y el entorno. Combinado con la misma semilla, esto logra consistencia visual y de voz entre escenas. La línea de diálogo se introduce con dos puntos, sin comillas.

4.2 Cuándo usar Fast

En una línea: haz borradores con Fast, remata con el estándar. La iteración de prompts, los animatics de storyboard y el contenido social por lotes multiplican la ventaja de costo de Fast; para los planos finales donde cada detalle cuenta, vuelve al modelo estándar para la máxima fidelidad. Y siempre que uses referencia a video, ya estás en Fast — el único caso en el que la elección viene hecha.

Dar vida a un óleo

Prompt

La Imagen 1 es un óleo: atardece en un pueblo costero, barcas de pesca descansan sobre la arena, un campanario de iglesia se ilumina a lo lejos. Da vida al mundo pintado: el humo de las chimeneas se riza hacia arriba, el mar reluce en gruesas pinceladas de empaste, un pescador cruza la playa con un remo al hombro, y la luz del campanario parpadea con suavidad. La cámara panea con extrema lentitud, conservando en todo momento la pincelada densa y la textura de la pintura. Mantén el estilo idéntico a la imagen de referencia. Audio: olas lejanas, la campana de la iglesia que da tres toques de la tarde, gaviotas que llaman — sereno y de largo alcance.

Requiere 1–3 imágenes de referencia; este ejemplo cambia automáticamente a Veo 3.1 Fast. Para referencias de estilo, asegura por partida doble con «conservar la textura de la pincelada» más «mantener el estilo idéntico».

Tabla de parámetros de Veo 3.1

Estos son todos los ajustes que el generador de Molyin expone realmente para Veo 3.1.

Veo 3.1Veo 3.1 Fast
ModoTexto a video / Imagen a videoTexto a video / Imagen a video / Referencia a video
Resolución720p / 1080p / 4k720p / 1080p / 4k
Duración8s8s
Relación de aspecto16:9 / 9:1616:9 / 9:16
AudioAudio activado por defecto, sin controlAudio activado por defecto, sin control
Primer/último fotograma
Imágenes de referenciaNo1–3
Videos de referenciaNoNo
Audio de referenciaNoNo
Devolver último fotogramaNoNo

Preguntas frecuentes

Las seis preguntas más frecuentes — y las respuestas que hemos verificado.