**文生音樂(Text-to-Music)**是一種生成式 AI 技術:你用文字描述曲風、情緒、速度和樂器——還可以附上歌詞——模型在同一次生成裡完成作曲、編曲、演唱與混音。拿到的不是 MIDI 或取樣包,而是一段能直接播放、下載、放進影片裡的成品音訊。
工作原理
音樂模型在海量「音訊+文字描述」配對資料上訓練,學會了「帶著老式 Rhodes 電鋼琴的溫暖 lo-fi hip hop」到底是什麼聲音。生成時,模型操作的是音訊的壓縮表示而不是原始波形,因此能同時掌握整首歌的結構——主歌、副歌、橋段——並把樂器和人聲一起渲染出來。支援歌詞的模型會把旋律線對齊到你寫的每一句詞,歌手唱的是你的詞,而不是含混的音節。
擅長的場景
- 影片配樂 —— 與片段節奏和情緒匹配的背景音樂,不用再翻素材庫找曲子。
- 帶人聲的完整歌曲 —— 寫好歌詞、定好風格,拿到一首有主歌有副歌的成品。
- 純音樂鋪底 —— 氛圍、lo-fi、電影感或電子的循環樂段,給 Podcast、廣告和遊戲用。
- 快速試風格 —— 給品牌 jingle 一口氣試十個方向,比過去和作曲人對一次需求還快。
好的輸入長什麼樣
像製作人給樂手講需求那樣描述:曲風與年代(「90 年代 trip-hop」)、情緒(「憂鬱但帶希望」)、速度與能量(「慢速,約 80 BPM,到副歌推起來」)、配器(「木吉他、鼓刷、溫暖的貝斯」)、人聲(「女中音,氣音,近距離收音」),不要人聲就寫「純音樂」。附歌詞時用 [Verse]、[Chorus]、[Bridge] 這類標籤標出結構,模型會據此安排編曲。