Texto a video con IA
Escribe lo que quieres ver y obtén un video terminado — sin material filmado, sin fotos, sin edición. Seedance 2.5, Kling 3.0, MiniMax H3, HappyHorse, Wan, LTX, Veo y FLUX 3 convierten un prompt en clips cinematográficos con audio nativo, hasta 30 segundos y 4K.
- Generaciones fallidas reembolsadas automáticamente
- Los packs de créditos nunca caducan
- El precio de cada modelo es público
- Cancela cuando quieras con un clic
- 14
- Modelos de texto a video
- 30 s
- Duración del clip hasta
- 4K
- Salida hasta
- 6 cr/s
- Créditos desde
Un prompt, un video real
Clips de texto a video terminados, cada uno junto al prompt exacto que lo generó — la fórmula sujeto, acción, escena, cámara y sonido. Cópialo directo como tu primer prompt. Haz Remix de cualquiera para partir de la misma configuración.
- Seedance 2.5
- Text to video
- 8s
- 720P
Estilo realista de documental de naturaleza, luces y sombras cinematográficas fieles a la realidad, una tarde cálida en una ladera boscosa cubierta de hierba donde un cachorro de panda redondo y regordete rueda colina abajo. El pelaje blanco y negro del panda es esponjoso y realista, su cuerpo pequeño y rechoncho, sus movimientos torpes y adorables. La escena es una ladera boscosa verde, el suelo cubierto de hierba, musgo, tréboles, tierra, piedrecitas, ramas secas y unas pocas florecillas amarillas, con troncos altos y un bosque suavemente desenfocado al fondo. La cámara es un plano medio amplio en ángulo bajo con una ligera sensación de cámara en mano, esencialmente fija en conjunto, manteniendo al panda en el encuadre en todo momento. 0s-3s: Un cachorro de panda está tumbado en la ladera verde de hierba, con el cuerpo redondo y rechoncho. Acaba de empezar a rodar lentamente de lado colina abajo, con movimientos torpes, las briznas de hierba doblándose con suavidad bajo su cuerpo. Pasa una brisa ligera; la luz del sol cae entre los árboles desde la parte superior izquierda, proyectando luces y sombras moteadas. 3s-8s: El panda rueda hacia la parte inferior derecha del encuadre y se detiene gradualmente, pasando de estar tumbado de lado a apoyarse sobre la barriga. Su cara redonda se gira hacia la cámara, las patas delanteras apoyadas en la hierba; instalado en la hierba del primer término, se acomoda en una postura confortable, levanta ligeramente la cabeza y la vuelve a bajar con un pequeño gruñido suave. Posición de cámara baja, ligera sensación de cámara en mano, siguiendo con suavidad al panda hacia la parte inferior derecha. Profundidad de campo natural: las briznas de hierba del primer término ligeramente desenfocadas, el panda nítido, el bosque del fondo suavemente fuera de foco. Sonido ambiente natural — el viento y el golpecito sordo y amortiguado del panda al rodar. En conjunto cálido, real, natural.
- Wan 3.0
- Text to video
- 30s
- 720P
Un espectáculo visual de 30 segundos, horizontal 16:9, de altísima intensidad y factura cinematográfica, rodado en One-Take. El estilo general es «fantasía callejera de la Costa Oeste», un lenguaje visual que funde la aspereza de los videos de skate callejero de los años 90 con el acabado de un gran anuncio moderno. Colorea toda la pieza con un «sol de California» cinematográfico llevado al extremo: un cielo azul de alta saturación contra las sombras duras de las palmeras bajo el sol directo, con el calor del asfalto, el traqueteo metálico de las ruedas del carrito de supermercado y una rebeldía adolescente sin miedo flotando en el aire. La perspectiva se estira sin descanso mientras el protagonista se lanza hacia delante; la cámara acumula impulso con seguimientos en contrapicado extremo y travesías físicas de altísimo dinamismo. El protagonista es un adolescente con estilo callejero, camiseta de rayas de colores contrastados y gorra de béisbol negra, cuya expresión pasa de la relajación perezosa a la euforia de romper el límite. En la segunda escena el protagonista es el mismo adolescente, pero aparece en la dimensión real como observador. Plano 1, 0-6s: Se abre con un primer plano: el adolescente está tumbado dentro de un carrito de supermercado de acero rojo, con la avenida recta característica de California y las altísimas palmeras al fondo. Cuando entra el golpe de la música, la cámara retrocede a toda velocidad y se hunde hasta el nivel del suelo, pegada a la rueda en contrapicado extremo. El adolescente empieza a bajar en picada por la carretera empinada, el carrito da fuertes tumbos sobre el pavimento, los autos salen disparados hacia atrás a ambos lados, y la cámara captura una sensación de aceleración casi temeraria. Plano 2, 7-15s: Sin corte. La cámara sigue pegada al suelo como un skater en persecución; en el instante en que el adolescente supera una rampa improvisada de madera, aprovecha el impulso para elevarse en una parábola elegante. El carrito se va por el aire y la cámara pasa por debajo. Un enorme cartel publicitario inunda entonces todo el campo de visión, y la cámara avanza hacia su centro con una precisión de mira imposible. Plano 3, 16-24s: Sin corte. El adolescente y el carrito se incrustan de lleno en el cartel gigante como si rompieran la pared dimensional. Al contacto con el póster, el cuerpo tridimensional se aplana en una transformación material, y aparecen en el encuadre una textura real de papel rasgado y tinta de glitch en color. El adolescente mantiene su postura de deslizamiento, pero se ha convertido en una obra plana sobre el cartel. La cámara ejecuta aquí una órbita horizontal de 180 grados y luego cae en picada desde lo alto de vuelta al suelo. Plano 4, 25-30s: Sin corte. La cámara aterriza con suavidad en la calle, justo debajo del cartel, donde aparece otro adolescente «real». Se detiene, se baja lentamente la visera de la gorra y levanta la vista hacia esa versión de sí mismo congelada en el cartel, con una sonrisa ligeramente divertida. La cámara sigue su mirada en un zoom rápido de acercamiento y termina fijándose en el agujero rasgado que hay junto a las letras «WAN» del cartel. La banda sonora funde un hip-hop de alta energía con el sonido físico de la película corriendo por la bobina. La información visual es densísima y está cargada de rebeldía con estilo.
- HappyHorse 1.1
- Text to video
- 10s
- 1080P
Plano medio de un presentador de noticias profesional en una mesa elegante dentro de un estudio de televisión moderno, iluminación azul fría, pantallas con brillo suave al fondo. 0-5s: Mira a cámara y dice con voz clara y pausada: «Buenas noches. Esta noche, un avance que podría cambiar la forma de trabajar de millones de personas». 5-10s: Se gira ligeramente hacia una segunda cámara: «Tendremos la historia completa, y lo que significa para ti, justo después de esto». Sincronía labial precisa, tono de sala de estudio sutil, calidad broadcast nítida, poca profundidad de campo.
- MiniMax H3
- Text to video
- 15s
- 2K
Genera una secuencia de apertura de película criminal de suspenso ligero de 15 segundos en formato panorámico 16:9. El estilo general debe tomar como referencia el lenguaje visual de estos conceptos: aperturas de anime japonés retro, siluetas de bordes duros, collage estilo cómic, pantallas divididas asimétricas, bloques de color geométricos contundentes, créditos de título en inglés, un mínimo de katakana japonés como decoración y un aire de jazz criminal. La atmósfera debe ser 60% suspenso y 40% jazz: misteriosa, cool, ágil, con una sensación de crimen urbano — ni aterradora ni pesada, y desde luego no un video musical de jazz alegre. Los efectos de movimiento de la apertura deben sentirse como collages gráficos animados: primero aparece un marco de línea negra, los bordes de la pantalla dividida se trazan rápidamente, los bloques de color y los marcos se pegan pieza a pieza; siluetas de personajes, primeros planos de objetos y créditos en inglés se deslizan hacia dentro, rebotan hacia fuera o se revelan mediante máscaras al ritmo de la batería. Evita las animaciones narrativas realistas — esto debe tener el acabado pulido de una secuencia de apertura. Los créditos en inglés deben ser legibles, con efectos animados permitidos: los marcos de línea fina pueden trazarse primero, los nombres se deslizan dentro del marco, las letras aparecen una a una y se revelan con bloques de color en movimiento, antes de una breve pausa al final. No añadas texto en chino, evita el texto corrupto y asegúrate de que ningún nombre en inglés esté mal escrito. Reglas de la secuencia: cada crédito y título en inglés debe aparecer solo una vez. No repitas el mismo título, no repitas el mismo nombre y no asignes varios roles a la misma persona. Las transiciones deben ser variadas: máscaras circulares de disco de vinilo, cortes verticales a través de puertas de coche, sombras de personajes como cortinillas, cortes de línea roja, máscaras con grandes letras en inglés, reorganizaciones de bordes de pantalla dividida, cortes duros de bloques de color geométricos y revelados de collage fotograma a fotograma. Todas las transiciones deben sincronizarse con los golpes de batería — precisas, llenas de suspenso, ágiles y con un aire de collage de cómic. Evita los fundidos suaves y las transiciones fluidas. BGM: crea una música de fondo original.
- FLUX 3
- Text to video
- 15s
- 720P
historia en claymation sobre un hombre al que una enorme mano gigante que entra en escena aplasta una y otra vez, impidiéndole vivir su vida
¿Qué es la IA de texto a video?
La IA de texto a video genera un video solo a partir de una descripción escrita. Escribes el sujeto, la acción, el entorno, el movimiento de cámara y el sonido; el modelo inventa cada fotograma a partir de esas palabras — y, en la mayoría de los modelos, también la pista de audio. Nada se filma, se sube ni se edita. La entrada del glosario sobre texto a video cubre el término en sí; esta página es donde generas uno.
Molyin reúne todos los modelos líderes de texto a video en un solo estudio, así que el prompt que escribes una vez puede renderizarlo el modelo que mejor se adapte a la toma. Seedance 2.5 y Wan 3.0 convierten un solo prompt en secuencias de hasta 30 segundos; Kling 3.0 sostiene una toma cinematográfica de hasta 4K con diálogo y sincronización labial; HappyHorse entrega cabezas parlantes con movimiento de boca preciso; MiniMax H3 destaca en diseño de movimiento estilizado y tipografía en pantalla que se mantiene legible en 2K; LTX 2.5 ejecuta escenas guionizadas de hasta 20 segundos con varios personajes hablando; Veo 3.1 y FLUX 3 completan el catálogo. Todos generan sonido en la misma pasada que la imagen.
Texto a video es uno de los cuatro modos del generador de video con IA: imagen a video, referencia a video y edición de video comparten el mismo cuadro de prompt y el mismo saldo de créditos, así que cuando necesitas un clip que parta de una imagen concreta, cambias de modo en lugar de herramienta. Cada clip se cobra por segundo, las generaciones fallidas se reembolsan, y todos los planes de pago en la página de precios incluyen derechos de uso comercial.
Qué modelo para cada prompt
Todos los modelos de texto a video en Molyin, con lo que cada uno hace mejor cuando el punto de partida es solo un prompt. Elige según el tipo de toma que estás escribiendo y luego según la duración del clip y la resolución.
| Modelo | Mejor para | Duración | Salida |
|---|---|---|---|
| Seedance 2.5 | Movimiento fotorrealista y narrativa multiescena desde un solo prompt, secuencias de hasta 30 segundos | 4–30 s | 480P / 720P / 1080P, con audio |
| Seedance 2.0 (Standard / Fast / Mini) | La misma fórmula de prompt en tres niveles — Standard llega a 4K, Fast y Mini cambian resolución por velocidad | 4–15 s | Hasta 4K en Standard, 480P / 720P en Fast y Mini, con audio |
| Kling 3.0 | Tomas cinematográficas largas con diálogo hablado y sincronización labial; el texto en pantalla se mantiene legible durante el movimiento | 3–15 s | 720P / 1080P / 4K, audio nativo y sincronización labial |
| MiniMax H3 | Diseño de movimiento estilizado, secuencias de título y tipografía legible con música original, todo en una sola pasada | 4–15 s | 768P / 2K, siempre con audio |
| HappyHorse 1.1 | Diálogo de cabeza parlante con sincronización labial precisa; nueve relaciones de aspecto incluyendo 4:5, 5:4 y 9:21 | 3–15 s | 720P / 1080P, siempre con audio |
| Wan 3.0 | Tomas de 30 segundos en un solo plano dirigidas desde un guion con marcas de tiempo, audio opcional | 2–30 s | 480P / 720P / 1080P, audio opcional |
| Wan 2.7 | Clips cotidianos confiables con sonido en cada render | 2–15 s | 720P / 1080P, siempre con audio |
| LTX 2.5 (Fast / Pro) | Escenas guionizadas de hasta 20 segundos con movimientos de cámara, diseño de sonido y varios personajes hablando; Fast llega a 4K | 6–20 s (Pro: 6–10 s) | Hasta 4K en Fast, 720P / 1080P en Pro, con audio |
| Veo 3.1 (Standard / Fast) | Clips de 8 segundos pulidos con sonido cinematográfico en 16:9 o 9:16 | 8 s | 720P / 1080P / 4K, siempre con audio |
| FLUX 3 | Resultados ricos a partir de prompts muy cortos — monólogos, secuencias documentales, animación en plastilina — con sonido nativo | 5–20 s | 720P / 1080P, con audio |
La duración del clip y la salida indicadas corresponden al modo texto a video. Los mismos modelos también aceptan una imagen o una referencia como entrada en los otros modos del estudio.
Cómo generar un video a partir de texto
Tres pasos de una idea escrita a un MP4 terminado — la mayoría de los clips se renderizan en minutos.
Escribe el prompt
Describe una toma: el sujeto, qué hace, dónde está, un movimiento de cámara y el sonido o la línea de diálogo. Sustantivos concretos y un solo momento de acción siempre superan a los adjetivos. Copia un prompt de ejemplo de la galería de arriba si quieres un punto de partida ya probado.
Elige el modelo y los ajustes
Elige el modelo que se adapte a la toma — tomas largas, diálogo, tipografía estilizada o naturaleza fotorrealista — y luego ajusta la duración del clip, la relación de aspecto y la resolución. La estimación de créditos se actualiza antes de enviar.
Genera y descarga
El modelo renderiza cada fotograma y la pista de audio en minutos. Previsualiza el resultado, descarga el MP4 sin marca de agua, o usa Remix con un prompt ajustado para probar otra toma.
Texto a video vs. imagen a video
Los mismos modelos, un punto de partida distinto: uno empieza solo desde palabras, el otro desde una imagen que ya tienes.
| Texto a video | Imagen a video | |
|---|---|---|
| Punto de partida | Una descripción escrita — no hace falta imagen, material filmado ni ningún archivo | Una foto, un render o una ilustración que se convierte en el primer fotograma |
| Qué controlas | Todo mediante palabras — sujeto, escena, estilo, movimiento, sonido | El primer fotograma exacto; el prompt dirige el movimiento y el sonido |
| Consistencia | Cada generación reinterpreta la descripción — ideal para explorar, menos preciso para repetir la misma toma | Sujeto, encuadre y paleta fijados a tu imagen desde el primer fotograma |
| Ideal para | Conceptos, escenas que aún no existen, mundos estilizados, diálogo y narración | Fotos de producto, retratos, activos de marca, fotogramas de storyboard |
Muchos creadores hacen ambas cosas: primero bocetan la escena con texto a video, generan una imagen fija del fotograma exacto que quieren y luego la animan con imagen a video.
Créditos de texto a video, por segundo
Cada modelo se factura por segundo a la resolución que elijas, y las generaciones fallidas se reembolsan automáticamente.
| Modelo | Resolución | Créditos/seg | Video de 5s | Video de 5s + referencia de 3s |
|---|---|---|---|---|
| 480p | 25 | 125 créditos | 170 créditos | |
| 720p | 56 | 280 créditos | 381 créditos | |
| 1080p | 139 | 695 créditos | 946 créditos | |
| 480p | 11 | 55 créditos | 75 créditos | |
| 720p | 28 | 140 créditos | 191 créditos | |
| 1080p | 65 | 325 créditos | 442 créditos | |
| 4k | 135 | 675 créditos | 918 créditos | |
| 480p | 9 | 45 créditos | 62 créditos | |
| 720p | 20 | 100 créditos | 136 créditos | |
| 480p | 6 | 30 créditos | 41 créditos | |
| 720p | 12 | 60 créditos | 82 créditos | |
| 768p | 18 | 90 créditos | 144 créditos | |
| 2k | 29 | 145 créditos | 232 créditos | |
| 720p | 18 | 90 créditos | Solo imágenes de referencia | |
| 1080p | 24 | 120 créditos | Solo imágenes de referencia | |
Wan 2.7 | 720p | 18 | 90 créditos | 144 créditos |
| 1080p | 30 | 150 créditos | 240 créditos | |
| 480p | 10 | 50 créditos | 80 créditos | |
| 720p | 18 | 90 créditos | 144 créditos | |
| 1080p | 36 | 180 créditos | 288 créditos | |
| 720p | 22 | 110 créditos | Solo imágenes de referencia | |
| 1080p | 29 | 145 créditos | Solo imágenes de referencia | |
| 4k | 71 | 355 créditos | Solo imágenes de referencia | |
| 720p | 20 | 100 créditos | — | |
| 1080p | 29 | 145 créditos | — | |
| 1440p | 43 | 215 créditos | — | |
| 4k | 67 | 335 créditos | — | |
| 720p | 27 | 135 créditos | — | |
| 1080p | 38 | 190 créditos | — | |
Veo 3.1 | 720p | 41 | 205 créditos | — |
| 1080p | 42 | 210 créditos | — | |
| 4k | 60 | 300 créditos | — | |
Veo 3.1 Fast | 720p | 10 | 50 créditos | Solo imágenes de referencia |
| 1080p | 11 | 55 créditos | Solo imágenes de referencia | |
| 4k | 30 | 150 créditos | Solo imágenes de referencia | |
| 720p | 38 | 190 créditos | Solo imágenes de referencia | |
| 1080p | 65 | 325 créditos | Solo imágenes de referencia |
- Los videos de referencia subidos se facturan al 60% de la tarifa — una generación de 5s con un video de referencia de 10s factura 11 segundos, no 15.
- Excepción: los segundos de video de referencia de MiniMax H3 / Wan 2.7 / Wan 3.0 se facturan a la tarifa completa por segundo.
- MiniMax H3: las primeras 5 imágenes de referencia son gratis; cada imagen adicional añade 9 créditos.
Los planes de suscripción y los paquetes de créditos de pago único se comparan en la página de precios.
Consulta los precios de todos los modelos en la página de créditos
Preguntas frecuentes sobre texto a video con IA
Todo sobre generar video a partir de texto en Molyin.
Empieza a crear con Molyin hoy
Regístrate gratis y convierte tu primera idea en un video cinematográfico en minutos.