Guía

Guía de MiniMax H3

MiniMax H3 genera imagen y sonido estéreo en una sola pasada — de 4 a 15 segundos en 768p o 2K nativo, con montaje multiplano, diálogos con sincronía labial y un contexto de referencia unificado que lee juntos hasta 9 imágenes, 3 clips de video y 3 pistas de audio. Esta guía se organiza en torno a tareas creativas reales: desde la fórmula de tres pistas y las líneas de tiempo de planos hasta la dirección de audio, los fotogramas clave y el casting por referencias — cada ejemplo se precarga en el generador de Molyin con un clic.

Actualizado el 2026-08-09

01 La fórmula de tres pistas

La mayoría de los modelos de video generan una imagen; H3 genera una película — imagen, sonido ambiente y banda sonora salen de la misma pasada. Eso cambia cómo escribes: un buen prompt de H3 cubre qué vemos, cómo suena la escena y (opcionalmente) qué música suena por debajo. Este capítulo construye ese esqueleto y luego repasa los dos controles que todo trabajo necesita: resolución y duración.

1.1 Escribe para ojos y oídos a la vez

Parte de una frase de sujeto más acción, y luego apila cámara, entorno y — el hábito específico de H3 — sonido. Como el audio se genera junto con la imagen, todo lo que no especifiques se inventa por ti. Una línea de ambiente y una línea de música suelen bastar para tomar el control. El lenguaje natural corriente funciona; H3 también fue entrenado con una disposición estructurada más estricta que veremos en el capítulo 3.

[Sujeto] + [Acción] + opcional [Estilo] [Cámara] [Sonido ambiente] [Banda sonora]

Obligatorio

Sujeto

De quién o de qué trata el plano — cuanto más concreta la descripción, más estable el resultado.

Obligatorio

Acción

Qué hace el sujeto, un beat claro cada vez. Los verbos vagos producen movimiento vago.

Opcional

Estilo

El acabado general, declarado al principio: cinematográfico de acción real, animación 2D, claymation, película vintage.

Opcional

Cámara

Tamaño de plano y movimiento. H3 sigue bien el lenguaje de cámara explícito — el capítulo 2 da el vocabulario completo.

Opcional

Sonido ambiente

Cómo suena la escena en sí: lluvia, tráfico, aceite chisporroteando. Los personajes pueden oírlo.

Opcional

Banda sonora

Música que solo oye el público. Nombra instrumentos y tempo, no estados de ánimo.

El puesto de fideos nocturno

Prompt

Acción real, cinematográfico. Un puesto callejero de fideos de madrugada brilla bajo una única bombilla colgante; el cocinero levanta un colador de fideos del hervor burbujeante, el vapor inundando el cuadro, y los vuelca en un tazón que espera. La cámara mantiene un plano medio y luego avanza lentamente hacia el tazón. El agua hirviendo retumba, el colador tintinea contra el borde de la olla, pasan scooters a lo lejos. Una línea solitaria de erhu suena suave bajo la escena.

Un sujeto, una acción limpia, un movimiento de cámara — y las dos capas de sonido nombradas. Esta es la forma básica de un prompt de H3.

Faro en la tormenta

Prompt

Acción real, cinematográfico, paleta fría azul grisácea. Un farero con un chubasquero amarillo se inclina contra el viento en la galería del faro, aferrado a la barandilla mientras las rociadas de mar estallan sobre él; el haz de luz pasa barriendo dos veces. La cámara hace un travelling lateral hacia la derecha con amplitud grande a velocidad lenta, manteniéndolo encuadrado contra el mar agitado. El viento ruge, las olas golpean las rocas de abajo, el chubasquero restalla y ondea. Cuerdas graves sostenidas crecen despacio y se mantienen sin resolver.

Los seis elementos en juego — estilo primero, luego sujeto, acción, un movimiento de cámara explícito y una línea para el ambiente y otra para la banda sonora.

1.2 Resolución y duración: 768p para explorar, 2K para entregar

Dos resoluciones — 768p y 2K nativo — y un control deslizante continuo de 4–15 segundos que acepta cualquier número entero. El ritmo de trabajo: itera en 768p, donde cada segundo cuesta una fracción del 2K, y luego relanza el prompt ganador en 2K para el corte final. Ajusta la carga de acción a los segundos: un beat por cada 4–5 segundos es fiable; 15 segundos sostienen una miniescena de tres beats. H3 renderiza a 24fps con audio estéreo en todos los niveles.

El estanque de kois en 2K

Prompt

Acción real, estilo macro documental. Un estanque de kois después de la lluvia: kois naranjas y blancos se deslizan bajo una superficie punteada de gotas, los nenúfares temblando cuando los peces pasan por debajo, una hoja de arce girando lentamente en la corriente. La cámara empieza con una inclinación hacia abajo a velocidad lenta y luego mantiene un plano estático mientras tres kois convergen sobre una miga de pan a la deriva. Un suave repiqueteo de lluvia que se desvanece, el agua lamiendo la piedra, un único chapoteo cuando un koi rompe la superficie. Sin música.

Precargado a 15 segundos en 2K — los sujetos densos en textura como el agua, las escamas y el follaje son donde el 2K nativo se nota de verdad. Fíjate en que «Sin música» es en sí una indicación: mantiene vacía la pista de la banda sonora.

02 Líneas de tiempo multiplano

H3 modela los cortes de forma nativa — puedes dirigir una secuencia montada, no solo una toma única. La convención: abre con [Shot 1] y empieza cada plano posterior con una etiqueta y una marca de tiempo, como [Shot 2] En 00:04.000. Las marcas de tiempo deben crecer estrictamente y mantenerse dentro de la duración del video. Este capítulo cubre la lista de planos y el vocabulario de cámara que se mueve dentro de cada plano.

2.1 La lista de planos: etiquetas + marcas de tiempo

Escribe cada plano como su propio bloque de frases: la etiqueta, el momento del corte, y luego qué muestra el nuevo plano. Usa un corte para introducir información genuinamente nueva — un nuevo sujeto, espacio o punto de vista; si solo cambia la distancia, mueve la cámara en lugar de cortar. Presupuesta los segundos con honestidad: un video de 12 segundos sostiene tres planos con comodidad, cinco ya es forzarlo.

[Shot 1] plano de apertura … [Shot N] En MM:SS.mmm, la cámara corta a …

Obligatorio

Etiqueta de plano

[Shot 1] abre el video sin marca de tiempo; cada plano posterior recibe su propia etiqueta numerada.

Obligatorio

Momento del corte

MM:SS.mmm al inicio de cada plano posterior — estrictamente creciente, siempre dentro de la duración total.

Opcional

Frase de corte

«la cámara corta a» es la opción más versátil; «el plano transiciona a» y similares también funcionan. Encadenados y fundidos solo cuando de verdad los quieras.

Opcional

Información nueva

Qué revela este corte que el plano anterior no podía — nuevo sujeto, nuevo espacio, nuevo punto de vista. Un corte sin información nueva debería ser un movimiento de cámara.

Mercado matinal en tres planos

Prompt

Acción real, cinematográfico, luz cálida de mañana. [Shot 1] Un plano general de un mercado cubierto despertando: vendedores subiendo persianas, cajas de naranjas apiladas en pirámides, la luz del sol cortando entre los huecos del techo. [Shot 2] En 00:04.000, la cámara corta a un primer plano de las manos de un pescadero colocando caballas relucientes sobre hielo picado, gotas de agua salpicando. [Shot 3] En 00:08.000, la cámara corta a una clienta mayor que se lleva una naranja a la nariz, cierra los ojos y sonríe. Las persianas traquetean, el hielo cruje, el murmullo de la multitud crece gradualmente. Un patrón ligero de guitarra acústica a tempo de paseo.

Tres planos en 12 segundos — el general sitúa, el primer plano detalla, el rostro reacciona. Las líneas de paisaje sonoro y banda sonora van después de la lista de planos y cubren todo el video.

2.2 Vocabulario de cámara: tipo × amplitud × velocidad

H3 entiende un vocabulario de cámara preciso — panorámica (pan), travelling lateral (truck), inclinación (tilt), pedestal, acercamiento (push in), alejamiento (pull out), zoom, movimiento en arco (arc), seguimiento (tracking), plano estático, POV, vibración de cámara en mano, roll — y cada movimiento admite dos modificadores opcionales: amplitud (pequeña o grande) y velocidad (lenta o rápida). Escribe el movimiento como una acción natural dentro del plano, no como una pila de etiquetas al final. La amplitud media y la velocidad normal son los valores por defecto; menciónalas solo cuando importen.

Alrededor del escultor

Prompt

Acción real, cinematográfico, una única toma continua. En un estudio polvoriento inundado de luz de ventana, un escultor cincela el rostro de una figura de mármol, deteniéndose para soplar el polvo del pómulo. La cámara describe un arco a su alrededor con amplitud grande a velocidad lenta, revelando el rostro de la figura solo cuando la órbita se completa. Los golpes del cincel resuenan contra la piedra, el polvo susurra al desprenderse de la superficie, una paloma zurea en la claraboya. Sin música.

Un plano, una órbita — la amplitud y la velocidad del arco están escritas, y la revelación va atada a la trayectoria de la cámara. Un movimiento así de deliberado es exactamente para lo que sirve el vocabulario de tres dimensiones.

03 Dirigir el estéreo nativo

H3 produce audio estéreo en cada generación — no hay interruptor de audio, así que la verdadera pregunta es si diriges la banda sonora o la dejas al azar. El habla se sincroniza labialmente con quien habla y se genera junto con la imagen. Este capítulo cubre los tres gestos de audio: diálogo en pantalla, voz en off fuera de pantalla, y la división en dos capas entre el sonido de escena y la banda sonora.

3.1 Diálogo: quién habla, qué dice, cómo

La receta fiable tiene tres partes: identifica a quien habla (edad, carácter de la voz), da la línea exacta y dirige la interpretación. La notación nativa de H3 etiqueta a cada hablante con un ID estable como (S1) y envuelve la línea como <d>[Spanish] …</d> — la etiqueta nombra el idioma hablado, y la línea de dentro se conserva textualmente. Las comillas también funcionan, pero la forma etiquetada es la más determinista. Mantén las líneas cortas: una o dos frases por cada 10 segundos. Cualquier texto que deba aparecer en pantalla — carteles, etiquetas — va en cambio entre comillas dobles.

La recomendación de la librería

Prompt

Acción real, cinematográfico, luz cálida de tungsteno. En una librería de segunda mano abarrotada, la dueña — una mujer de sesenta y tantos con una voz grave y pausada (S1) — saca una novela encuadernada en tela de un estante alto, da dos golpecitos en su cubierta y la tiende sobre el mostrador, diciendo con serena certeza: <d>[Spanish] Todos preguntan por el famoso. Este es el que se quedan.</d> La cámara mantiene un plano medio corto por encima del hombro del cliente. Las páginas susurran, cruje una tabla del suelo, la lluvia repiquetea en el escaparate. Sin música.

Hablante establecida con edad y carácter de voz, etiquetada (S1), línea envuelta en <d>[Spanish] …</d>, interpretación dirigida con «serena certeza» — la receta completa de diálogo en un solo prompt.

3.2 Voz en off: narración sobre la imagen

Para la narración, H3 tiene una frase fija que vale la pena usar textualmente: el hablante «dice en una voz en off fuera de pantalla», seguida de la línea — y justo después, indica que los labios del personaje en pantalla permanecen cerrados. Esa última cláusula no es decorativa; es lo que impide que el modelo sincronice labialmente tu narración con quien esté en el cuadro.

La carta de las montañas

Prompt

Acción real, cinematográfico, colores apagados. Un hombre joven asciende un sendero de zigzag sobre un valle lleno de niebla, el aliento visible en el aire frío. La voz curtida de un hombre mayor (S1) dice en una voz en off fuera de pantalla: <d>[Spanish] Tu abuelo recorría este sendero cada otoño. Ahora sabes por qué.</d> mientras los labios del excursionista permanecen completamente cerrados. La cámara lo sigue desde atrás con amplitud pequeña a velocidad lenta y luego se inclina hacia arriba, hacia la línea de la cresta. El viento se mueve entre la hierba seca, las botas crujen sobre la grava, un halcón grita a lo lejos. Notas de piano dispersas a tempo lento, desvaneciéndose antes de que el video termine.

La frase de voz en off más la cláusula «los labios permanecen completamente cerrados» es la pareja que separa la narración del habla en pantalla — quita la segunda mitad y el excursionista puede empezar a vocalizar las palabras.

3.3 Dos capas: sonido de escena vs. banda sonora

H3 piensa el audio en dos capas. El sonido de escena es todo lo que los personajes podrían oír — ambiente, sonidos de acción, respiraciones. La banda sonora es música que solo oye el público — descríbela por instrumentación, tempo y dinámica, nunca con palabras de estado de ánimo. En el formato estructurado nativo de H3, estos son campos etiquetados literales: la línea de tiempo va bajo integrated_multimodal_description, el sonido de escena bajo overall_soundscape y la banda sonora bajo non_diegetic_music (escribe N/A para el silencio). Molyin pasa tu prompt intacto, así que puedes pegar la disposición completa de tres campos en el cuadro de prompt — el ejemplo de abajo es una, lista para enviar.

integrated_multimodal_description: [Shot 1] … ⏎ overall_soundscape: [ambiente + sonidos de acción] ⏎ non_diegetic_music: [instrumentación + tempo + dinámica, o N/A]

Obligatorio

Ambiente

El colchón continuo de la escena: lluvia, tono de sala, tráfico. 1–4 frases que cubren todo el video.

Opcional

Sonidos de acción

Eventos físicos que hacen ruido — pasos, impactos, tela. El diálogo se queda en el campo de la línea de tiempo, no aquí.

Opcional

Especificación musical

Instrumentos, tempo, arco dinámico — «piano disperso, lento, cuerdas en crescendo». No «música emotiva». N/A significa silencio.

Lluvia en la azotea, formato nativo completo

Prompt

integrated_multimodal_description: [Shot 1] Acción real, cinematográfico, un plano medio encuadra a una mujer de pie bajo un toldo de chapa ondulada en la azotea de un edificio mientras cae la lluvia del atardecer, sosteniendo una taza de té desportillada. Observa cómo las luces de la ciudad se difuminan abajo, luego cierra los ojos y exhala despacio. [Shot 2] En 00:05.000, la cámara corta a un primer plano de la taza: el vapor se riza hacia arriba a través de la luz de lluvia, una gota del toldo golpea el borde y salpica. overall_soundscape: La lluvia constante tamborilea sobre el toldo de chapa y sisea en las calles de abajo. La taza tintinea una vez contra su anillo, y una larga exhalación se oye bajo la lluvia. non_diegetic_music: Un motivo apagado de piano de fieltro a tempo lento, repitiéndose con un leve crescendo en la segunda mitad y sin resolución.

Esta es la disposición nativa completa de tres campos, pegada tal cual en el cuadro de prompt. Úsala cuando quieras control con precisión de fotograma; para trabajos rápidos, el estilo fluido del capítulo 1 basta.

04 Imagen a video

Dale a H3 un primer fotograma y desarrolla la escena hacia delante exactamente desde esa imagen — identidad, ropa, composición y estilo se anclan a lo que subas. La relación de aspecto de la salida sigue a la imagen original, así que compón tu imagen fija en el encuadre que quieras publicar. Añade un último fotograma y H3 interpola el viaje entre los dos.

4.1 Primer fotograma: ancla y luego desarrolla

La estructura probada: anclar primero, mover después. Abre confirmando lo que la imagen establece — sujeto, posición, atmósfera — y luego describe la siguiente acción, el comportamiento de la cámara y el sonido. No vuelvas a describir cada píxel ni contradigas la imagen; el fotograma ya ha ganado esa discusión. Los movimientos pequeños y físicos tienen la mayor tasa de acierto.

La bicicleta vieja despierta

Prompt

A partir de este fotograma, la escena cobra vida: la rueda delantera de la bicicleta empieza a girar lentamente, la carta de la baraja enganchada en sus radios repiquetea cada vez más rápido, y las cintas del manillar se elevan con una brisa que crece. La cámara avanza con amplitud pequeña a velocidad lenta hacia los radios que giran. El tictac de la carta crece hasta un suave traqueteo, el viento recorre el callejón, un perro ladra una vez a lo lejos. Sin música.

Sube una imagen de primer fotograma. El prompt no gasta ni una palabra en describir la bicicleta — la imagen es dueña del aspecto; las palabras son dueñas del movimiento y el sonido.

4.2 Primer + último fotograma: describe el viaje

Con ambos fotogramas subidos, el trabajo de tu prompt se invierte: sáltate los extremos — ya están fijados — y escribe el camino entre ellos. ¿Cómo se mueve el sujeto, qué cambia de manos, cómo evoluciona la composición y cómo se cierran progresivamente las diferencias entre los dos fotogramas? Mantenlo en una sola toma continua para que el modelo pueda interpolar con limpieza, y dale más segundos a los saltos visuales más grandes.

El cuenco toma forma

Prompt

Sobre el torno que gira, la masa de arcilla húmeda se eleva bajo las manos ahuecadas de la alfarera: sus pulgares presionan un hueco en el centro, las paredes suben y se abren hacia fuera, y la barbotina resbala por sus muñecas mientras la forma se asienta en la silueta del cuenco terminado. La cámara mantiene un plano corto estático sobre el cabezal del torno todo el tiempo. El torno zumba con constancia, la arcilla húmeda chapotea bajo sus palmas, el agua gotea de sus dedos a la bandeja.

Sube la masa como primer fotograma y el cuenco terminado como último — el prompt narra solo la transformación. Ocho segundos dan aire a la interpolación; un salto mayor entre fotogramas merece más.

05 Casting por referencias

La capacidad insignia de H3: un contexto unificado que lee hasta 9 imágenes, 3 clips de video (cada uno de 2–15s, 15 segundos en total) y 3 pistas de audio en una sola petición — y un prompt que le dice qué aporta cada asset. Nombra los assets por tipo y orden de subida — Imagen 1, Video 1, Audio 1 — y asigna a cada uno un papel. Esto es casting, no decoración: la apariencia de un asset, el movimiento de otro, la voz de un tercero.

5.1 Nombra cada asset, asigna cada papel

La regla que hace funcionar la multirreferencia: cada asset subido recibe un nombre y una tarea. «Usa el movimiento de cámara del Video 1, pon en pantalla al personaje de la Imagen 1» — tipo más orden de subida, el papel declarado sin rodeos. Las referencias sin asignar invitan al modelo a adivinar. Las imágenes aportan identidad, escenarios y estilo; los videos aportan movimiento de cámara, ritmo y estructura; el audio aporta timbre de voz y sensación musical. Las primeras 5 imágenes de referencia son gratis; a partir de la 6.ª se aplica un pequeño recargo por imagen — el estimador lo muestra antes de enviar.

[Imagen/Video/Audio N] aporta [papel] + descripción del objetivo + opcional [bloqueo de consistencia]

Obligatorio

Assets nombrados

Imagen 1, Video 1, Audio 1 — tipo más orden de subida. La numeración se reinicia dentro de cada tipo.

Obligatorio

Papeles

Qué aporta cada asset: apariencia, escenario, movimiento de cámara, ritmo, timbre de voz, estilo musical.

Opcional

Bloqueo de consistencia

Los rasgos que deben sobrevivir: pelo, vestuario, paleta, iluminación. Escríbelos con palabras aunque la imagen ya los muestre.

El paseo con gabardina

Prompt

La mujer de la Imagen 1 camina hacia la cámara por la calle lluviosa de neón, siguiendo el movimiento de cámara y el ritmo del Video 1 — un travelling lento hacia atrás que la mantiene centrada mientras avanza. Mantén su identidad consistente: pelo corto plateado, gabardina verde oscuro con el cuello subido, paso sereno y sin prisa. Los charcos salpican bajo sus botas, la lluvia sisea sobre los letreros de neón, una línea de bajo sintetizado pulsa a tempo lento.

Sube una imagen de personaje y un clip de referencia de cámara. Cada asset está nombrado, cada uno tiene exactamente una tarea, y el bloqueo de consistencia repite con palabras lo que no debe derivar.

5.2 Personajes consistentes, voces prestadas

Para un personaje recurrente, la referencia hace el trabajo pesado y el lenguaje hace el bloqueo: nombra los rasgos de identidad explícitamente junto a la referencia de imagen, y se mantienen entre planos. Las referencias de audio extienden esto a la voz — apunta un hablante a una pista subida y H3 iguala su timbre y su forma de decir sin copiar la grabación. Así es como le das a un personaje generado una voz consistente a lo largo de una serie. Las referencias de audio están libres de recargo.

El cantante callejero

Prompt

El músico callejero de la Imagen 1 — hombre joven, pelo rizado suelto, chaqueta vaquera sobre camiseta blanca, guitarra acústica desgastada — actúa bajo un arco de piedra al atardecer. Rasguea dos veces, cierra los ojos y canta (S1) con el timbre de voz y la interpretación relajada del Audio 1: <d>[Spanish] Otro día se apaga, y yo sigo en este lado de la ciudad.</d> La cámara avanza lentamente de un plano general a un plano medio corto mientras los transeúntes aminoran el paso para escuchar. Las cuerdas de la guitarra resuenan bajo la reverberación natural del arco, las monedas tintinean en la funda abierta, el tráfico del atardecer murmura más allá.

Sube una imagen de personaje y una pista vocal. El hablante (S1) se mapea al timbre del audio — la grabación gobierna cómo suena la voz, la línea <d> decide qué canta. Precargado a 12 segundos en 2K por el detalle de la actuación.

Tabla de parámetros de MiniMax H3

Todos los niveles que el generador de Molyin expone realmente para MiniMax H3.

ModosTexto a video / Imagen a video / Referencia a video
Resolución768p / 2k
Duración4–15 s
Relación de aspecto16:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:1
AudioAudio estéreo en cada generación, sin interruptor
Primer-último fotograma
Imágenes de referencia1–9
Videos de referenciaHasta 3
Audio de referenciaHasta 3
Devolver último fotogramaNo

Preguntas frecuentes

Las ocho preguntas más frecuentes, con respuestas que verificamos nosotros mismos.