Le texte vers musique (Text-to-Music) est une IA générative qui transforme une description écrite en morceau de musique fini. Vous décrivez le genre, l’ambiance, le tempo et les instruments — et remettez des paroles si vous le souhaitez — et le modèle compose, arrange, interprète et mixe le morceau en une seule passe. Ce qui revient n’est ni du MIDI ni un pack de boucles, mais un fichier audio prêt à écouter, à télécharger et à poser sur une vidéo.
Comment ça marche
Les modèles musicaux sont entraînés sur d’immenses bibliothèques audio associées à des descriptions : ils apprennent à quoi ressemble vraiment « un lo-fi hip hop chaleureux avec un Rhodes poussiéreux ». À la génération, le modèle travaille sur une représentation compressée de l’audio plutôt que sur l’onde brute, ce qui lui permet de tenir la structure d’une chanson entière — couplet, refrain, pont — tout en rendant instruments et voix ensemble. Les modèles qui acceptent des paroles alignent la ligne vocale sur vos mots : le chanteur chante ce que vous avez écrit au lieu de marmonner des syllabes.
Ce qu’il fait de mieux
- Bandes-son pour vidéo — une musique de fond qui suit le rythme et l’ambiance d’un clip, sans fouiller une banque de sons.
- Chansons complètes avec voix — écrivez les paroles, nommez le style, et obtenez un morceau chanté avec couplets et refrain.
- Nappes instrumentales — boucles ambient, lo-fi, cinématiques ou électroniques pour podcasts, publicités et jeux.
- Exploration rapide de styles — testez dix directions pour un jingle de marque dans le temps qu’il fallait pour briefer un seul compositeur.
Ce qu’une bonne entrée contient
Décrivez la musique comme un producteur brieferait une session : genre et époque (« trip-hop des années 90 »), ambiance (« mélancolique mais pleine d’espoir »), tempo et énergie (« lent, autour de 80 BPM, qui monte vers le refrain »), instrumentation (« guitare acoustique, batterie aux balais, basse chaude ») et voix (« alto féminin, voix soufflée, micro proche ») — ou « instrumental » si vous n’en voulez pas. Quand vous fournissez des paroles, marquez la structure avec des balises comme [Verse], [Chorus] et [Bridge] ; le modèle s’en sert pour façonner l’arrangement.