リップシンク(Lip Sync)

リップシンクは、人物の口の動きを音声に正確に合わせるAI技術です。ネイティブ音声生成と音声駆動の2つの方式、良い台詞プロンプトの書き方を解説します。

ジェネレーターを開く

実際の動作を見る

実際のプロンプトと、Molyin で生成された結果です。Remix を押せばここから始められます。

  • Kling 3.0
  • Image to video
  • 10s
  • 1080P

高層オフィスビルの中、男は背もたれに身を預け、疲れと侮りの入り混じった表情で、広東語でこう言う:「其实……我真系唔系好 buy 你呢个 logic 啰。成个 proposal 根本 align 唔到我哋个 core value。你个 flow 咁乱,点样去 convince 个 client 呀?不如你返去 re-think 下个 angle,听朝早我要见到个 final version。」

**リップシンク(Lip Sync)**は、画面内の人物の口の動きを音声に正確に一致させる技術です。AI動画生成では2つの方式があります。ネイティブ音声生成──プロンプトに書いた台詞から、声と口の動きを同時に生成する方式。音声駆動──アップロードした音声に合わせて、モデルが顔を動かして喋らせる方式です。

仕組み

音声は音素の連なりで、各音素は「ビゼーム」と呼ばれる口の形に対応します。現代の動画モデルは大量の会話映像からこの対応を直接学習しているため、口をパクパクさせるだけでなく、唇・顎・表情筋を音節ごとに一致させ、自然な瞬きや頭の動きも添えます。ネイティブ音声対応モデルは音声とフレームを一度に生成するため、タイミングが完全に揃います。

得意な場面

  • トーキングヘッド —— 撮影クルーなしで、スポークスパーソン動画やUGC風広告、商品解説を。
  • 対話シーン —— 書いた台詞どおりに、表情まで同期して喋るキャラクター。
  • 多言語展開 —— 同じキャラクターが異なる言語を、それぞれ正しい口の形で。
  • 写真を喋らせる —— 1枚のポートレートがあなたの原稿を読み上げます。

良い入力の条件

台詞は引用符でプロンプトに書き、短く保ちましょう──1ショットにつき1〜2文が最も自然です。トーン(「温かく、会話調で」)も指定を。音声駆動の場合は、BGMのないクリーンな音声を使いましょう。

リップシンク(Lip Sync)についてよくある質問

リップシンクには音声の録音が必要ですか?

必ずしも必要ではありません。ネイティブ音声対応モデルは、引用符で書いた台詞から声を生成します。録音がある場合は、画像動画生成に駆動音声を添えれば顔がその声で話します。

どの言語に対応していますか?

ネイティブ音声モデルは多言語と地域のアクセントに対応し、上のサンプルは広東語です。話させたい言語で台詞を書き、1 ショットにつき 1〜2 文に収めましょう。

さらに深く

リップシンク(Lip Sync)とは? | Molyin