Imagen a video (Image-to-Video)

Imagen a video (I2V) es una técnica de IA que convierte una imagen fija en un clip de video usándola como primer fotograma. Aprende cómo y cuándo usarla.

Abrir el generador completo

Míralo en acción

Un prompt real y el resultado que produjo en Molyin. Pulsa Remix para empezar desde aquí.

  • Kling 3.0
  • Image to video
  • 15s
  • 1080P

Apertura con un plano general medio en ultra gran angular con travelling horizontal, el estabilizador se mueve a ras de suelo, con un tono cinematográfico romántico de alto contraste entre la noche azul fría y el cielo estrellado blanco plateado, que desprende un fuerte realismo poético y un temperamento épico clásico. La protagonista es una joven con un vestido largo verde oscuro que corre con todas sus fuerzas por el césped del jardín iluminado por la luna; su falda se hincha al viento formando curvas dinámicas y ondulantes, aprieta una pequeña flor blanca en la mano derecha y levanta el borde del vestido con la izquierda, con la respiración agitada pero la mirada firme. En el segundo 4, la cámara acelera hacia delante con ella, y varios hombres y mujeres con trajes de baile de época irrumpen en el encuadre uno tras otro desde los lados izquierdo y derecho del fondo, corriendo a su lado — algunos intentan acercarse, otros se giran para gritar, pero ninguno la toca realmente, insinuando persecución y huida. En el segundo 8, la cámara se acerca gradualmente a un plano medio, panea para seguirla de frente en su avance y se eleva ligeramente; ella lanza una breve mirada atrás hacia un joven personaje masculino que la sigue, sus miradas se cruzan una fracción de segundo, las emociones estallan en plena carrera, y la mujer y el hombre se toman de la mano para correr juntos. En el segundo 12, la música y el movimiento alcanzan el clímax; la cámara avanza pegada a su perfil y a su pelo al viento, ella suelta la flor blanca y la lanza al aire, la flor desciende flotando en cámara lenta mientras la multitud que viene detrás pasa rozándola. En los últimos 3 segundos, la cámara sigue avanzando, la mujer y el hombre atraviesan la multitud y se lanzan hacia el cielo estrellado al final del jardín, sus figuras adueñándose gradualmente del centro del encuadre. La atmósfera general es ardiente, romántica y resuelta, un estallido narrativo sobre el destino, la elección y la libertad.

Imagen a video (I2V) es una técnica de IA generativa que da vida a una imagen fija. Tú aportas una imagen —una foto de producto, un retrato, una ilustración— y el modelo genera un video que arranca exactamente desde esa imagen y la pone en movimiento, guiado por un prompt de texto opcional.

Cómo funciona

En la generación de imagen a video, tu imagen se usa como el primer fotograma: un ancla visual que el modelo debe respetar. A partir de ahí, un modelo de difusión de video predice cómo debe evolucionar la escena: el pelo se mueve con el viento, el vapor sube de la taza, la cámara avanza lentamente. El prompt de texto ya no necesita describir cómo se ven las cosas (la imagen ya lo dice); describe qué pasa después.

¿Por qué partir de una imagen?

Comparado con el texto a video, partir de una imagen te da algo muy valioso: control sobre el aspecto exacto. La composición, los colores, el rostro, la etiqueta del producto: todo queda fijado desde el primer fotograma. Esto convierte al I2V en el modo ideal cuando:

  • Tienes activos de marca — anima una foto de producto sin que el modelo reinvente tu empaque.

  • El sujeto debe ser exacto — una persona real, un lugar real, una obra o ilustración existente.

  • Quieres predictibilidad — el primer fotograma está fijo, así que las iteraciones solo varían el movimiento.

Consejos de prompting

Como la imagen ya se encarga del "qué", dedica tu prompt al "cómo": describe el movimiento (sutil, dramático, en bucle), la cámara (estática, avance lento, órbita) y la atmósfera que quieres desarrollar. Aquí, los prompts cortos y centrados en el movimiento suelen ganarles a las descripciones largas de escena. Más técnicas en nuestra guía para escribir prompts.

Preguntas sobre Imagen a video (Image-to-Video)

¿Qué imagen debo subir para imagen a video?

Usa la copia más nítida que tengas, con la relación de aspecto que quieras para el video. La mayoría de los modelos conservan el primer fotograma tal como lo subiste, así que cualquier zona borrosa o recortada se queda así en todos los fotogramas.

¿Puedo controlar lo que ocurre después del primer fotograma?

Sí. El prompt describe el movimiento, el movimiento de cámara y el audio; algunos modelos también aceptan un último fotograma o una pista de voz conductora. Omite la descripción del sujeto (la imagen ya lo dice) y dedica las palabras al movimiento.

Sigue profundizando

¿Qué es Imagen a video (Image-to-Video)? | Molyin