リップシンク(Lip Sync)

August 20, 2026
リップシンクは、人物の口の動きを音声に正確に合わせるAI技術です。ネイティブ音声生成と音声駆動の2つの方式、良い台詞プロンプトの書き方を解説します。
AI Video

**リップシンク(Lip Sync)**は、画面内の人物の口の動きを音声に正確に一致させる技術です。AI動画生成では2つの方式があります。ネイティブ音声生成──プロンプトに書いた台詞から、声と口の動きを同時に生成する方式。音声駆動──アップロードした音声に合わせて、モデルが顔を動かして喋らせる方式です。

仕組み

音声は音素の連なりで、各音素は「ビゼーム」と呼ばれる口の形に対応します。現代の動画モデルは大量の会話映像からこの対応を直接学習しているため、口をパクパクさせるだけでなく、唇・顎・表情筋を音節ごとに一致させ、自然な瞬きや頭の動きも添えます。ネイティブ音声対応モデルは音声とフレームを一度に生成するため、タイミングが完全に揃います。

得意な場面

  • トーキングヘッド —— 撮影クルーなしで、スポークスパーソン動画やUGC風広告、商品解説を。
  • 対話シーン —— 書いた台詞どおりに、表情まで同期して喋るキャラクター。
  • 多言語展開 —— 同じキャラクターが異なる言語を、それぞれ正しい口の形で。
  • 写真を喋らせる —— 1枚のポートレートがあなたの原稿を読み上げます。

良い入力の条件

台詞は引用符でプロンプトに書き、短く保ちましょう──1ショットにつき1〜2文が最も自然です。トーン(「温かく、会話調で」)も指定を。音声駆動の場合は、BGMのないクリーンな音声を使いましょう。

Molyinでのリップシンク

Kling 3.0は、台詞どおりに口を動かして喋るキャラクターを多言語で生成します──方言にも対応。MiniMax H3は映像と同時にネイティブのステレオ音声を生成し、Wan 2.7の画像動画生成モードは駆動音声に対応──音声をアップロードすれば、静止画のポートレートが喋り出します。

関連用語

AI動画ジェネレーターで今すぐ試してみましょう。

リップシンク(Lip Sync) | Molyin