**文生音乐(Text-to-Music)**是一种生成式 AI 技术:你用文字描述曲风、情绪、速度和乐器——还可以附上歌词——模型在同一次生成里完成作曲、编曲、演唱与混音。拿到的不是 MIDI 或采样包,而是一段能直接播放、下载、放进视频里的成品音频。
工作原理
音乐模型在海量“音频+文字描述”配对数据上训练,学会了“带着老式 Rhodes 电钢琴的温暖 lo-fi hip hop”到底是什么声音。生成时,模型操作的是音频的压缩表示而不是原始波形,因此能同时把握整首歌的结构——主歌、副歌、桥段——并把乐器和人声一起渲染出来。支持歌词的模型会把旋律线对齐到你写的每一句词,歌手唱的是你的词,而不是含混的音节。
擅长的场景
- 视频配乐 —— 与片段节奏和情绪匹配的背景音乐,不用再翻素材库找曲子。
- 带人声的完整歌曲 —— 写好歌词、定好风格,拿到一首有主歌有副歌的成品。
- 纯音乐铺底 —— 氛围、lo-fi、电影感或电子的循环乐段,给播客、广告和游戏用。
- 快速试风格 —— 给品牌 jingle 一口气试十个方向,比过去和作曲人对一次需求还快。
好的输入长什么样
像制作人给乐手讲需求那样描述:曲风与年代(“90 年代 trip-hop”)、情绪(“忧郁但带希望”)、速度与能量(“慢速,约 80 BPM,到副歌推起来”)、配器(“木吉他、鼓刷、温暖的贝斯”)、人声(“女中音,气声,近距离收音”),不要人声就写“纯音乐”。附歌词时用 [Verse]、[Chorus]、[Bridge] 这类标签标出结构,模型会据此安排编曲。