對嘴(Lip Sync)

August 20, 2026
對嘴(Lip Sync)是讓人物口型與語音精確匹配的 AI 技術。了解原生配音生成與音訊驅動兩種路線,以及怎麼寫台詞提示詞。
AI Video

**對嘴(Lip Sync)**指讓畫面中人物的口型與語音精確匹配。在 AI 影片生成裡它有兩條路線:原生配音生成——模型根據你寫在提示詞裡的台詞,同時生成聲音和匹配的口型;音訊驅動——上傳一段人聲錄音,模型讓畫面中的人臉開口說出來。

工作原理

語音由音素構成,每個音素對應一種可見的口型(視位)。現代影片模型從海量說話影片中直接學會了這種映射,因此不是讓嘴巴跟著節拍開合,而是讓嘴唇、下顎和臉部肌肉貼合每個音節,並配上自然的眨眼與頭部動作。支援原生音訊的模型在同一次生成裡同時輸出聲音與畫面,時間軸天然對齊。

擅長的場景

  • 口播內容 —— 代言人短片、UGC 風廣告、產品講解,不需要攝製組。
  • 對白場景 —— 角色按你寫的台詞開口,表情同步到位。
  • 多語言演繹 —— 同一個角色說不同語言,口型各自正確。
  • 讓照片開口 —— 一張人像照片念出你的稿子。

好的輸入長什麼樣

台詞用引號寫進提示詞,句子要短——每個鏡頭一兩句最自然。寫明語氣(「溫暖、聊天式」);走音訊驅動路線時,用乾淨的人聲錄音,不要帶背景音樂。

在 Molyin 上使用對嘴

Kling 3.0 能讓角色按你的台詞開口,對嘴支援多語言,連方言都能演繹;MiniMax H3 生成畫面時自帶立體聲原生音訊;Wan 2.7 的圖生影片模式支援驅動音訊——上傳一段人聲,讓靜態人像開口說話。

相關詞條

現在就用 AI 影片生成器試試看。

對嘴(Lip Sync) | Molyin