口型同步(Lip Sync)

口型同步(Lip Sync)是让人物口型与语音精确匹配的 AI 技术。了解原生配音生成与音频驱动两种路线,以及怎么写台词提示词。

打开完整生成器

看它怎么工作

一条真实提示词和它在 Molyin 上生成的结果。点 Remix 从这里起步。

  • Kling 3.0
  • Image to video
  • 10s
  • 1080P

高层写字楼里,男人向后靠在椅背上,一脸疲惫和不屑,用粤语说道:「其实……我真系唔系好 buy 你呢个 logic 啰。成个 proposal 根本 align 唔到我哋个 core value。你个 flow 咁乱,点样去 convince 个 client 呀?不如你返去 re-think 下个 angle,听朝早我要见到个 final version。」

**口型同步(Lip Sync)**指让画面中人物的口型与语音精确匹配。在 AI 视频生成里它有两条路线:原生配音生成——模型根据你写在提示词里的台词,同时生成声音和匹配的口型;音频驱动——上传一段人声录音,模型让画面中的人脸开口说出来。

工作原理

语音由音素构成,每个音素对应一种可见的口型(视位)。现代视频模型从海量说话视频中直接学会了这种映射,因此不是让嘴巴跟着节拍开合,而是让嘴唇、下颌和面部肌肉贴合每个音节,并配上自然的眨眼与头部动作。支持原生音频的模型在同一次生成里同时输出声音与画面,时间轴天然对齐。

擅长的场景

  • 口播内容 —— 代言人短片、UGC 风广告、产品讲解,不需要摄制组。
  • 对白场景 —— 角色按你写的台词开口,表情同步到位。
  • 多语言演绎 —— 同一个角色说不同语言,口型各自正确。
  • 让照片开口 —— 一张人像照片念出你的稿子。

好的输入长什么样

台词用引号写进提示词,句子要短——每个镜头一两句最自然。写明语气(“温暖、聊天式”);走音频驱动路线时,用干净的人声录音,不要带背景音乐。

关于口型同步(Lip Sync)的常见问题

口型同步一定要自己录音吗?

不一定。支持原生配音的模型能根据你写在引号里的台词直接生成声音;如果已经有录音,用图生视频加驱动人声,就能让人脸开口说出来。

支持哪些语言?

原生配音模型支持多语言和地方口音,上面的样片说的就是粤语。台词直接用你想让它说的语言写,每个镜头一两句最自然。

再往下走

什么是口型同步(Lip Sync)? | Molyin