Text-zu-Musik (Text-to-Music) ist generative KI, die eine geschriebene Beschreibung in ein fertiges Musikstück verwandelt. Du beschreibst Genre, Stimmung, Tempo und Instrumente — und gibst optional einen Songtext mit — und das Modell komponiert, arrangiert, spielt ein und mischt den Track in einem Durchgang. Zurück kommt kein MIDI und kein Loop-Paket, sondern eine gerenderte Audiodatei, die du abspielen, herunterladen und in ein Video legen kannst.
So funktioniert es
Musikmodelle werden auf riesigen Audiobibliotheken mit zugehörigen Beschreibungen trainiert und lernen so, wie „warmer lo-fi Hip-Hop mit staubigem Rhodes-Piano“ tatsächlich klingt. Bei der Generierung arbeitet das Modell nicht auf rohen Wellenformen, sondern auf einer komprimierten Darstellung von Audio — so behält es die Struktur eines ganzen Songs im Blick, Verse, Chorus, Bridge, während es Instrumente und Stimme gemeinsam rendert. Modelle mit Songtext-Unterstützung legen die Gesangslinie auf deine Worte: Der Sänger singt, was du geschrieben hast, statt Silben zu nuscheln.
Was es am besten kann
- Soundtracks für Video — Hintergrundmusik, die Tempo und Stimmung eines Clips trifft, ohne Stöbern in einer Stock-Bibliothek.
- Komplette Songs mit Gesang — Songtext schreiben, Stil benennen, einen gesungenen Track mit Verse und Chorus bekommen.
- Instrumentale Betten — Ambient-, lo-fi-, Cinematic- oder Electronic-Loops für Podcasts, Ads und Games.
- Schnelle Stilsuche — zehn Richtungen für einen Marken-Jingle anhören, in der Zeit, die früher ein einziges Briefing gekostet hat.
Was eine gute Eingabe enthält
Beschreibe die Musik so, wie ein Producer eine Session briefen würde: Genre und Ära („90s trip-hop“), Stimmung („melancholisch, aber hoffnungsvoll“), Tempo und Energie („langsam, etwa 80 BPM, steigert sich zum Chorus“), Instrumentierung („Akustikgitarre, Besen-Drums, warmer Bass“) und Gesang („weiblicher Alt, hauchig, nah am Mikro“) — oder „instrumental“, wenn du keinen willst. Wenn du einen Songtext mitgibst, markiere die Struktur mit Tags wie [Verse], [Chorus] und [Bridge]; das Modell formt danach das Arrangement.