Le texte vers image (Text-to-Image, ou T2I) est une technique d’IA générative qui transforme une description écrite — un prompt — en image finie : composition, lumière, style et détails, tout est rendu à partir de vos mots. Vous décrivez l’image ; le modèle la peint.
Comment ça fonctionne
Les modèles texte vers image actuels sont des modèles de diffusion entraînés sur d’immenses bibliothèques d’images associées à leurs légendes. La génération part d’un bruit pur que le modèle « débruite » progressivement en une image, guidé à chaque étape par votre prompt. La dernière génération associe au cœur de diffusion un modèle de langage qui lit votre prompt comme des instructions plutôt que comme un sac de mots-clés : les relations spatiales (« la tasse posée sur le livre »), le nombre d’objets et même le texte lisible dans l’image sortent juste bien plus souvent.
Ce qu’il réussit le mieux
Le texte vers image brille quand vous avez besoin d’un visuel et que vous n’avez que des mots :
- Concept art et moodboards — explorez styles, palettes et compositions avant de vous engager sur une direction.
- Visuels marketing — images hero, vignettes, bannières et visuels sociaux dans n’importe quel format, sans séance photo.
- Illustration en série — verrouillez la description de style et ne changez que le sujet pour obtenir une série cohérente.
Ce que contient un bon prompt
Un bon prompt T2I se lit comme le brief d’un directeur artistique. Couvrez quatre points : le sujet (ce qui est dans le cadre), la composition (cadrage, perspective, point focal), le style (médium, référence artistique, technique de rendu) et la lumière et l’ambiance (heure dorée, néon noir, lumière douce de studio). Le précis bat toujours le vague : « une théière en céramique sur une nappe en lin, vue de dessus, lumière douce de fenêtre, photographie produit minimaliste » surpasse « une jolie théière » à chaque fois.
