Texto a video (Text-to-Video)

Texto a video (T2V) es una técnica de IA que convierte un prompt en un clip de video en movimiento. Aprende cómo funciona y cómo escribir buenos prompts.

Abrir el generador completo

Míralo en acción

Un prompt real y el resultado que produjo en Molyin. Pulsa Remix para empezar desde aquí.

  • Wan 3.0
  • Text to video
  • 15s
  • 720P

En el patio de losas de piedra que hay detrás del Templo Shaolin, un grupo de jóvenes monjes novicios de Shaolin, con la cabeza rapada, forma una escuadra perfectamente alineada. A la orden del instructor, todos empiezan a repetir juntos los ejercicios de patadas: patada alta, patada lateral y patada giratoria, encadenadas sin interrupción, con una sincronía y una precisión absolutas. La cámara corta a un primer plano de uno de los monjes jóvenes en la postura del gallo dorado que se sostiene sobre una pata. Se mantiene en equilibrio sobre un solo pie, con las manos juntas en gesto de oración, completamente inmóvil y firme durante varios minutos. El instructor se acerca a él y observa con atención su postura. La punta de su bastón golpea con suavidad el codo del monje para corregir la posición y afinar el movimiento. La cámara corta después a una hilera de muñecos de madera de entrenamiento junto al muro. Varios discípulos veteranos practican contra los muñecos de madera; sus brazos se mueven ágiles y fluidos entre los brazos del muñeco, encadenando bloqueos defensivos y contraataques rápidos. En todo el patio de entrenamiento solo se oyen los golpes de la madera, los gritos potentes y los ecos de la práctica marcial que retumban por el recinto del templo.

Texto a video (T2V) es una técnica de IA generativa que convierte una descripción escrita —un prompt— en un clip de video con movimiento, iluminación y (en los modelos modernos) audio sincronizado. Tú describes la escena; el modelo la filma.

Cómo funciona

Por dentro, la mayoría de los modelos de texto a video son modelos de difusión entrenados con enormes bibliotecas de videos emparejados con descripciones. Durante la generación, el modelo parte de ruido puro y lo va "limpiando" progresivamente hasta convertirlo en fotogramas, guiado en cada paso por tu prompt. Como el modelo genera todos los fotogramas dentro de un mismo contexto temporal, el resultado se mantiene coherente: los objetos persisten, el movimiento fluye y la cámara se comporta como una cámara, no como una presentación de diapositivas.

En qué destaca

El texto a video brilla cuando partes de nada más que una idea:

  • Exploración de conceptos — visualiza una escena antes de comprometerte con un rodaje o un storyboard.

  • Contenido de formato corto — ganchos, B-roll, teasers de producto y clips para redes en formato vertical o panorámico.

  • Tomas imposibles — un dron atravesando el ojo de una cerradura, una ciudad hecha de cristal, un zorro en traje espacial. Si puedes describirlo, el modelo puede intentarlo.

Qué incluye un buen prompt

Los mejores prompts de T2V se leen como la nota de plano de un director, no como un deseo. Cubre cuatro cosas: el sujeto (quién o qué), la acción (qué ocurre en el tiempo), la cámara (encuadre y movimiento) y la atmósfera (iluminación, paleta, tono). Para un recorrido más a fondo, consulta nuestra guía sobre cómo escribir prompts de video con IA.

Preguntas sobre Texto a video (Text-to-Video)

¿Qué modelos de Molyin admiten texto a video?

Todos los modelos de video activos en el generador aceptan un prompt de texto: 14 en este momento. Elige uno y el precio por segundo se actualiza antes de generar; los modelos nuevos se incorporan en cuanto se lanzan.

¿Cuánto cuesta un clip de texto a video?

Pagas por segundo de salida y la tarifa depende del modelo y la resolución. Los precios empiezan en 3 créditos por segundo; el generador muestra el total exacto antes de que pulses Generar, y las generaciones fallidas se reembolsan automáticamente.

Sigue profundizando

¿Qué es Texto a video (Text-to-Video)? | Molyin