**口型同步(Lip Sync)**指让画面中人物的口型与语音精确匹配。在 AI 视频生成里它有两条路线:原生配音生成——模型根据你写在提示词里的台词,同时生成声音和匹配的口型;音频驱动——上传一段人声录音,模型让画面中的人脸开口说出来。
工作原理
语音由音素构成,每个音素对应一种可见的口型(视位)。现代视频模型从海量说话视频中直接学会了这种映射,因此不是让嘴巴跟着节拍开合,而是让嘴唇、下颌和面部肌肉贴合每个音节,并配上自然的眨眼与头部动作。支持原生音频的模型在同一次生成里同时输出声音与画面,时间轴天然对齐。
擅长的场景
- 口播内容 —— 代言人短片、UGC 风广告、产品讲解,不需要摄制组。
- 对白场景 —— 角色按你写的台词开口,表情同步到位。
- 多语言演绎 —— 同一个角色说不同语言,口型各自正确。
- 让照片开口 —— 一张人像照片念出你的稿子。
好的输入长什么样
台词用引号写进提示词,句子要短——每个镜头一两句最自然。写明语气(“温暖、聊天式”);走音频驱动路线时,用干净的人声录音,不要带背景音乐。