L’image vers vidéo (Image-to-Video, ou I2V) est une technique d’IA générative qui donne vie à une image fixe. Vous fournissez une image — photo produit, portrait, illustration — et le modèle génère une vidéo qui démarre exactement sur cette image et la met en mouvement, guidé par un prompt facultatif.
Comment ça fonctionne
En image vers vidéo, votre image sert de première image — un ancrage visuel que le modèle doit respecter. À partir de là, un modèle de diffusion vidéo prédit comment la scène doit évoluer : les cheveux bougent dans le vent, la vapeur monte de la tasse, la caméra avance lentement. Le prompt n’a plus besoin de décrire à quoi ressemblent les choses (l’image le dit déjà) ; il décrit ce qui se passe ensuite.
Pourquoi partir d’une image ?
Comparé au texte vers vidéo, partir d’une image vous donne quelque chose de précieux : le contrôle exact du rendu. La composition, les couleurs, le visage, l’étiquette du produit — tout est verrouillé dès la première image. L’I2V devient le mode de référence quand :
- Vous avez des assets de marque — animez une photo produit sans que le modèle réinvente votre packaging.
- Le sujet doit être exact — une vraie personne, un vrai lieu, une œuvre ou une illustration existante.
- Vous voulez de la prévisibilité — la première image est fixe, les itérations ne font varier que le mouvement.
Conseils de prompt
Puisque l’image gère le « quoi », consacrez le prompt au « comment » : décrivez le mouvement (subtil, spectaculaire, en boucle), la caméra (fixe, lent travelling avant, orbite) et l’atmosphère à faire naître. Ici, des prompts courts et centrés sur le mouvement battent généralement les longues descriptions de scène. Plus de techniques dans notre guide d’écriture de prompts.