**テキスト音楽生成(Text-to-Music)**は、生成AIの一種です。ジャンル・雰囲気・テンポ・楽器を文章で描き——必要なら歌詞も添えて——モデルが作曲・編曲・演奏・ミックスを一度の生成で仕上げます。手に入るのはMIDIやループ素材ではなく、そのまま再生・ダウンロードして動画に載せられる完成した音声ファイルです。
仕組み
音楽モデルは膨大な「音声+文章による説明」のペアで学習しているため、「埃をかぶったRhodesピアノの温かいlo-fi hip hop」が実際にどう鳴るかを知っています。生成時、モデルは生の波形ではなく音声の圧縮表現を扱うので、曲全体の構造——ヴァース、コーラス、ブリッジ——を把握したまま、楽器と声を同時にレンダリングできます。歌詞に対応したモデルはボーカルラインをあなたの言葉に揃えるため、歌い手は曖昧な音節をつぶやくのではなく、書いた歌詞をそのまま歌います。
得意な場面
- 動画のサウンドトラック —— クリップのテンポと雰囲気に合ったBGMを、素材ライブラリを漁らずに。
- ボーカル入りの完成曲 —— 歌詞を書き、スタイルを指定すれば、ヴァースとコーラスのある歌ものが手に入ります。
- インストの下敷き —— ポッドキャスト、広告、ゲーム向けのアンビエント、lo-fi、シネマティック、エレクトロニックのループ。
- スタイルの高速検討 —— ブランドジングルの方向性を10案、作曲家に1回ブリーフする時間で聴き比べ。
良い入力の条件
プロデューサーがセッションをブリーフするように描写しましょう。ジャンルと年代(「90年代のtrip-hop」)、雰囲気(「憂いがあるが希望もある」)、テンポとエネルギー(「スロー、80 BPM前後、コーラスで盛り上がる」)、楽器編成(「アコースティックギター、ブラシのドラム、温かいベース」)、ボーカル(「女性アルト、息の多い声、近接マイク」)——不要なら「インストゥルメンタル」と書きます。歌詞を渡すときは [Verse]、[Chorus]、[Bridge] のタグで構成を示しましょう。モデルはそれを手がかりに編曲を組み立てます。