**對嘴(Lip Sync)**指讓畫面中人物的口型與語音精確匹配。在 AI 影片生成裡它有兩條路線:原生配音生成——模型根據你寫在提示詞裡的台詞,同時生成聲音和匹配的口型;音訊驅動——上傳一段人聲錄音,模型讓畫面中的人臉開口說出來。
工作原理
語音由音素構成,每個音素對應一種可見的口型(視位)。現代影片模型從海量說話影片中直接學會了這種映射,因此不是讓嘴巴跟著節拍開合,而是讓嘴唇、下顎和臉部肌肉貼合每個音節,並配上自然的眨眼與頭部動作。支援原生音訊的模型在同一次生成裡同時輸出聲音與畫面,時間軸天然對齊。
擅長的場景
- 口播內容 —— 代言人短片、UGC 風廣告、產品講解,不需要攝製組。
- 對白場景 —— 角色按你寫的台詞開口,表情同步到位。
- 多語言演繹 —— 同一個角色說不同語言,口型各自正確。
- 讓照片開口 —— 一張人像照片念出你的稿子。
好的輸入長什麼樣
台詞用引號寫進提示詞,句子要短——每個鏡頭一兩句最自然。寫明語氣(「溫暖、聊天式」);走音訊驅動路線時,用乾淨的人聲錄音,不要帶背景音樂。
在 Molyin 上使用對嘴
Kling 3.0 能讓角色按你的台詞開口,對嘴支援多語言,連方言都能演繹;MiniMax H3 生成畫面時自帶立體聲原生音訊;Wan 2.7 的圖生影片模式支援驅動音訊——上傳一段人聲,讓靜態人像開口說話。
相關詞條
- 文生影片(Text-to-Video) —— 連台詞帶畫面,從提示詞一步生成。
- 圖生影片(Image-to-Video) —— 讓照片說話的起點。
現在就用 AI 影片生成器試試看。