對嘴(Lip Sync)

對嘴(Lip Sync)是讓人物口型與語音精確匹配的 AI 技術。了解原生配音生成與音訊驅動兩種路線,以及怎麼寫台詞提示詞。

打開完整生成器

看它怎麼運作

一條真實提示詞和它在 Molyin 上生成的結果。點 Remix 從這裡起步。

  • Kling 3.0
  • Image to video
  • 10s
  • 1080P

高層辦公大樓裡,男人往後靠在椅背上,一臉疲憊與不屑,用粵語說道:「其實……我真係唔係好 buy 你個 logic 囉。成個 proposal 根本 align 唔到我哋個 core value。你個 flow 咁亂,點樣去 convince 個 client 呀?不如你返去 re-think 下個 angle,聽朝早我要見到個 final version。」

**對嘴(Lip Sync)**指讓畫面中人物的口型與語音精確匹配。在 AI 影片生成裡它有兩條路線:原生配音生成——模型根據你寫在提示詞裡的台詞,同時生成聲音和匹配的口型;音訊驅動——上傳一段人聲錄音,模型讓畫面中的人臉開口說出來。

工作原理

語音由音素構成,每個音素對應一種可見的口型(視位)。現代影片模型從海量說話影片中直接學會了這種映射,因此不是讓嘴巴跟著節拍開合,而是讓嘴唇、下顎和臉部肌肉貼合每個音節,並配上自然的眨眼與頭部動作。支援原生音訊的模型在同一次生成裡同時輸出聲音與畫面,時間軸天然對齊。

擅長的場景

  • 口播內容 —— 代言人短片、UGC 風廣告、產品講解,不需要攝製組。
  • 對白場景 —— 角色按你寫的台詞開口,表情同步到位。
  • 多語言演繹 —— 同一個角色說不同語言,口型各自正確。
  • 讓照片開口 —— 一張人像照片念出你的稿子。

好的輸入長什麼樣

台詞用引號寫進提示詞,句子要短——每個鏡頭一兩句最自然。寫明語氣(「溫暖、聊天式」);走音訊驅動路線時,用乾淨的人聲錄音,不要帶背景音樂。

關於對嘴(Lip Sync)的常見問題

對嘴一定要自己錄音嗎?

不一定。支援原生配音的模型能根據你寫在引號裡的台詞直接生成聲音;如果已經有錄音,用圖生影片加驅動人聲,就能讓人臉開口說出來。

支援哪些語言?

原生配音模型支援多語言和地方口音,上面的樣片說的就是粵語。台詞直接用你想讓它說的語言寫,每個鏡頭一兩句最自然。

再往下走

什麼是對嘴(Lip Sync)? | Molyin