指南

Wan 2.7 指南

从基础公式到首尾帧、视频续写、音色参考与视频编辑的完整写法——每一章都配了可直接提交的示例提示词,点「试一下」即可预填进 Molyin 生成器。Wan 2.7 是阿里通义万相的 27B MoE 视频模型:电影级 1080p、2-15 秒连续时长、原生音频条条有声、支持首尾帧插值与视频续写——这份指南把这几件武器逐一讲透。

更新于 2026-08-06

01 基础公式

Wan 2.7 能听懂结构化的指令:谁、做什么、镜头怎么动、在哪、什么调性。本章把一条好提示词拆成五个可复用的零件,再讲透两件顺手的工具——5 档画面比例与 seed 种子。先立住骨架,后面所有章节都只是它的延伸。

1.1 基本提示词公式

一切从一句话开始:主体加动作是必需的两块,镜头、环境、风格按需叠加。先在脑子里把这条片子拍完,再按公式把它写出来。时长是 2-15 秒的连续拨盘——几秒就安排几秒的事。Wan 2.7 还有个贴心特性:提示词写得短也不用担心,模型会自动智能改写补全细节,但骨架清晰的原稿永远比它猜的更准。

[主体] + [动作] + 可选 [镜头] [环境] [风格]

必需

主体

画面里的主角——人物、动物或产品,描述越具体越好。

必需

动作

主体在做什么,写清肢体部位与快慢轻重;缓慢连贯的小动作最稳。

可选

镜头

景别与运镜:特写、推镜、横移;多镜头叙事直接写分镜,如「第1个镜头[0-3秒] 全景」。

可选

环境

场景与氛围:地点、时间、光线、天气。

可选

风格

美术调性与画质:色调、质感、清晰度。

雨夜霓虹下的骑手

提示词

雨夜的东京街头,一位穿黑色皮衣的女骑手跨坐在重型机车上,摘下头盔甩了甩被雨水打湿的长发,霓虹灯牌在湿漉漉的路面上投下粉蓝色的倒影。镜头从低角度缓慢推近至半身特写,细雨在逆光中清晰可见。电影质感,赛博朋克色调,画面细节丰富。

主体+动作两句起步,镜头与环境各补一句,风格词收尾——这就是一条合格的 Wan 2.7 基础提示词。建议分辨率 1080p、比例 16:9。

1.2 五档比例怎么选

Wan 2.7 提供 5 档画面比例:16:9、9:16、1:1、4:3、3:4。选法只有一条原则——按发布平台倒推:横屏长视频选 16:9,手机竖屏信息流选 9:16,正方形 feed 选 1:1,人像静物选 4:3 或 3:4。比例在生成前定,事后再裁只会白丢画质。注意图生视频没有比例选择器——输出比例自动跟随首帧素材。

老街转角的风衣

提示词

一条洒满午后阳光的老街,穿米色长风衣的模特从转角走来,步伐从容,风衣下摆随步伐摆动,她在橱窗前停下脚步侧头一笑。镜头中景跟拍随后缓推近,暖调复古胶片质感,街景细节丰富。

已预填 9:16 竖屏——手机信息流的标准画幅,人物全身构图刚好撑满竖屏。

1.3 用 seed 复现与迭代

seed 是 Wan 2.7 的随机种子:固定 seed,同一条提示词可以反复生成出高度接近的结果——调试提示词时改一个词就能看清这个词的影响;换掉 seed,同一条提示词又是一批新版本。两个习惯值得养成:跑出满意结果时记下 seed;做 A/B 对比时锁死 seed 只改描述词。注意生成有概率性,相同 seed 不保证逐像素一致,但构图与主体的稳定性远高于随机抽卡。

窗台上的纸鹤

提示词

一只折纸千纸鹤立在被晨光晒暖的窗台上,微风从窗缝钻进来,纸鹤的翅膀轻轻颤动,随后被风托着滑下窗台,在房间里打着旋儿飘向书架。镜头缓慢跟拍,木地板上光影斑驳,空气里有细小的尘埃浮动。

已预填 seed 42——改描述词、不动种子,就能对比每一版微调的效果。

1.4 配乐参考:让画面跟着音乐走

文生视频的音频输入位语义是「配乐」——上传一段音乐,模型把它当背景音乐,并让画面节奏、动作卡点跟着音乐情绪走。写法上只需在提示词里点名「配乐使用音频 1」,再补一句希望画面怎么响应音乐(卡点、情绪递进、氛围贴合)。这和「产物恒有声」是两回事:配乐位是你主动给的音乐方向,不写模型也会自己配乐。

滨海公路的黄昏兜风

提示词

一辆复古敞篷车行驶在黄昏的滨海公路上,副驾驶的女生迎着风轻轻哼唱,发丝飞扬,路边的棕榈树快速后退,海面反射着碎金般的夕阳。镜头从车侧跟拍缓慢环绕至车头前方,暖金色调,胶片质感。配乐使用音频 1,画面节奏与镜头运动跟随音乐情绪,在副歌处镜头环绕加速。

需在音频输入位上传 1 段音乐(t2v 音频位的语义是配乐);已预填 10 秒——给足音乐情绪递进与卡点的空间。

02 图生视频

一张首帧图片加一句运动描述,Wan 2.7 就能让画面动起来——提示词的重心从「描述画面」转向「描述运动」,因为画面已经有了。一条硬规则先记住:图生视频的输出比例自动跟随首帧图,没有比例选择器——想要 9:16 的成片,就上传 9:16 的图。

2.1 让照片动起来

图生视频的提示词只写三件事:谁动、怎么动、镜头动不动。图里没有的东西不要硬加,图里已有的东西可以「唤醒」——飘动的衣角、流动的水面、摇曳的灯火,都是高命中的小动作。补一句「延续原图质感」,画风就不会跑偏。

渔港的黄昏

提示词

让这张照片动起来:夕阳把渔港染成金红色,水面波光缓缓晃动,停泊的渔船随细浪轻轻起伏,桅杆上的旗子被海风吹得猎猎作响,几只海鸥掠过远处的防波堤。镜头保持固定,全程延续原图黄昏暖调的胶片质感。

需上传 1 张首帧图片;只写动作不重述场景,「延续原图质感」一句稳住画风;输出比例自动跟随首帧。

2.2 首尾帧:开头结尾都归你管

Wan 2.7 与 Seedance 家族、Kling 3.0、Veo 3.1 同属平台支持首尾帧的模型族——上传首帧和尾帧两张图,模型自动生成中间的过程。这改变了提示词的写法:不用描述起点和终点(图里已经有了),只写「怎么从 A 到 B」——变化的节奏、镜头怎么配合。两张图的比例要一致,构图差异越大越要给足过程描述。

墨滴晕成山水

提示词

一滴浓墨落进清水,缓缓晕开、舒展,墨丝在水中翻卷流动,逐渐化作一幅层峦叠嶂的水墨山水,留白处云雾缭绕。镜头缓慢推近墨团中心,全程流畅连贯,宣纸纹理与水墨质感贯穿始终。

需在图生视频模式打开「添加尾帧」开关并上传首帧+尾帧两张图(墨滴 → 山水);提示词只写变化过程,8 秒给足晕染时间。

2.3 驱动音频:让照片开口说话

图生视频的音频输入位语义是「驱动音频」——上传一段人声,照片里的人物会跟着这段语音开口,口型、表情与头部动作随语音节奏驱动。口播、带货、角色念白都靠它。写法上只需一句「口型与音频 1 的语音严格同步」,再照例描述镜头与氛围。

播客主播开麦

提示词

让这张照片动起来:播客主播对着麦克风自然地说话,表情生动,伴随轻微的点头与手势,口型与音频 1 的语音严格同步,声音的情绪变化带动面部神态起伏。背景书架上的暖光台灯静静亮着,镜头固定中景,全程延续原图的纪实摄影质感。

需上传 1 张人物照片 + 1 段人声音频(i2v 音频位的语义是驱动音频);音频建议清晰无杂音的人声,口型命中率最高。

2.4 视频续写:接着拍,不用重拍

图生视频还支持上传一段 2-10 秒的视频作为「续写底片」(first_clip)——模型从这段视频的结尾接着往下拍,动作、风格、光线自然延续。提示词只写新增的那一段内容,前情不用重述。三条边界记牢:续写底片与首帧图互斥(二选一)、可以同时配尾帧锁定结局、但不能同时配驱动音频。时长拨盘定的是续写后的总时长,按总时长计费。

续写:[新增内容描述] + 可选 [延续性要求]

必需

新增内容

只写底片结尾之后发生什么:新动作、新场景、新运镜。

可选

延续性

一句「动作衔接自然、风格与光线延续原视频」防止接茬处跳变。

滑板少年的第二跳

提示词

续写上传的视频:滑板少年落地后顺势向前滑行,镜头继续低角度跟随,他加速冲向前方的台阶,起跳、翻板,稳稳落在台阶下方的平地上,向镜头挥手后滑出画面。动作衔接自然流畅,风格与光线延续原视频。

需上传 1 段 2-10 秒视频作为续写底片(与首帧图互斥,不可同时配驱动音频);已预填总时长 10 秒——拨盘定的是续写后的全长。

03 参考生视频

文字说不清的长相与动作——角色、产品、招牌动作——直接交给参考素材。Wan 2.7 的参考生视频接受图片与视频混合参考:图片最多 5 张、视频最多 5 段,两类合计最多 5 个,按上传顺序用「图 1」「图 2」「视频 1」在提示词里分别点名(图与视频各自独立编号),模型照着素材锁定外观与动态,场景与剧情全部由你的文字决定。音频走独立的单音频输入位(音色参考,见 3.3),不占参考素材名额。注意 r2v 的时长上限恒为 10 秒——带不带参考视频都一样。

3.1 角色参考公式

参考生视频的提示词结构是三段式:先用「图 N」把素材请进场,再写新场景里发生什么,最后一句「保持一致」收口。上传顺序就是编号顺序——第一张图是图 1,第二段视频是视频 2。同一角色的多角度图效果最好;参考素材里只放一个角色,多人合照会让模型分不清谁是谁。

[参考素材:图 1…] + [场景描述] + 保持 [主体] 特征一致

必需

参考素材

图片或视频,图片 ≤5、视频 ≤5、合计 ≤5,用「图 N」「视频 N」分别按序引用。

可选

场景描述

新场景里发生什么:动作、环境、运镜——画面从零生成,全由文字决定。

可选

一致性

一句「与参考素材保持一致」强化外观锁定。

熊猫师傅的深夜食堂

提示词

图 1 中的大熊猫系着深蓝色围裙,在暖黄灯光的小厨房里颠勺翻炒,锅气升腾,它得意地尝了一口汤汁,满意地点点头。镜头环绕灶台半周后停在它的侧脸特写,厨房细节丰富,温馨治愈的日常氛围。熊猫的外观和参考图保持一致,3D 动画质感。

需上传 1 张以上参考图;「图 1」指代你上传的角色图,结尾「保持一致」是锁定外观的固定句式。

3.2 图+视频混合参考

Wan 2.7 的独门绝活:图片管长相、视频管动态,两种素材可以同场使用——「视频 1 的舞者走进图 1 的舞台」,模型各取所需。三条硬规则记牢:图片最多 5 张、视频最多 5 段、两类合计不超过 5 个;参考生视频的时长上限恒为 10 秒(带不带参考视频都一样);参考素材为主体角色时只放单一角色。

木偶师的登台时刻

提示词

图 1 中的提线木偶师牵着线走上图 2 中的复古剧场舞台,舞台追光打在他身上,他模仿视频 1 中的鞠躬动作向观众致意,随后提起手中的木偶开始表演,幕布在身后缓缓合拢。镜头从观众席中景缓慢推近,剧场氛围庄重而神秘。人物与场景的外观和参考素材保持一致。

需上传 2 张参考图 + 1 段参考视频(合计 3 ≤ 5);「图 1」「图 2」「视频 1」分别点名分工;r2v 时长上限恒为 10 秒,已预填 8 秒。

3.3 音色参考:让角色用你的声音说话

参考生视频的音频输入位语义是「音色参考」——上传一段目标人声的音频,生成的角色会用这个声线说话,口音、语气、情绪张力高保真复刻。品牌专属配音、虚拟人口播、多角色对白都靠它。写法上点名「用音频 1 的音色说出台词」,台词文本直接写进提示词,口型会与发音自动同步。

品牌代言人的新口号

提示词

图 1 中的品牌代言人站在图 2 的极简摄影棚里,面向镜头,用音频 1 的音色说出品牌口号:「让每一次出发,都成为风景。」语气温暖而坚定,口型与发音严格同步,说到「风景」时微微一笑。镜头缓慢推近至半身特写,人物外观与参考图保持一致,影棚柔光,画面干净高级。

需上传人物图 + 场景图 + 1 段参考音色音频(r2v 音频位的语义是音色参考);台词直接写进提示词,音色复刻交给音频。

3.4 首帧锚定:开场构图也归你管

参考生视频支持额外上传一张「首帧图」锚定开场画面——第一帧的构图、机位、光影由你精确控制,从第二帧起模型再按提示词展开。一个连带效应要知道:传入首帧后输出比例自动跟随首帧,比例选择器随之失效(此时比例参数会被直接忽略)。

咖啡师的新品开场

提示词

以上传的首帧为开场画面:图 1 中的咖啡师从吧台后转身面向镜头,举起图 2 中的新品特调,杯口热气升腾,他微笑着把特调推向镜头方向展示。开场构图严格锚定首帧,随后镜头缓慢推近至特调特写。人物与产品外观和参考图保持一致,暖调木质咖啡馆氛围。

需在 r2v 模式上传首帧图 + 1-2 张参考图;传了首帧比例就跟随首帧——比例选择器失效是预期行为。

04 视频编辑

用自然语言改视频——上传一段 2-10 秒的源视频,写一句大白话指令:换风格、换衣服、换道具,其余一切原样保留。输出时长自动跟随源视频(没有时长选择器);比例有六档可选:默认 auto 跟随源视频,也可强制 16:9、9:16 等显式比例。还可以附 1 张参考图,告诉模型「换成什么样」。声音控制是你的第二支笔:「保留原声」开关决定源视频声音的去留;设置弹窗里另有「智能改写」开关(prompt_extend,默认开),短指令会被自动补全细节。

4.1 风格变换

整条片子换一身美术皮肤:黏土、水彩、像素、赛博霓虹,一句话就够。写清目标风格的三个特征——笔触、材质、色调,再补一句「镜头运动与节奏保持原样」,模型就只动风格不动叙事。

把街拍变成黏土动画

提示词

把这段视频转换成黏土动画风格:手工捏制的圆润造型、可见的指纹肌理与陶土质感、柔和的微缩景观布光,人物与建筑的轮廓以黏土塑形呈现,镜头运动与画面节奏保持原样。

需上传 1 段 2-10 秒源视频;自动切换到 Wan 2.7 Video Edit,时长跟随源视频,比例默认 auto 跟随。风格特征点名「造型+材质+布光」三件套最稳。

4.2 元素替换

不动原片地换衣服、换道具、换产品:说清把 A 换成 B,再补一句「其余内容保持不变」。替换类编辑配 1 张参考图外观最准——「图 1 中的皮夹克」胜过一百个形容词。

给人物换件皮夹克

提示词

把视频中人物的外套替换成图 1 中的棕色皮夹克,衣物的褶皱随动作自然变化,质感与光影方向和原画面保持一致,其余内容保持不变。

需上传源视频,可附 1 张参考图;「把 A 替换成 B + 其余保持不变」是最稳的替换句式。

Wan 2.7 参数速查

以下是 Molyin 生成器为 Wan 2.7 家族实际开放的全部档位。

Wan 2.7Wan 2.7 Video Edit
模式文生视频 / 图生视频 / 参考生视频视频编辑
分辨率720p / 1080p720p / 1080p
时长2–15 秒跟随源视频
比例16:9 / 9:16 / 1:1 / 4:3 / 3:4跟随源视频
音频默认输出音频,无控制参数跟随源视频
首尾帧支持不支持
参考图数量1–5 张最多 1 张
参考视频数量最多 3 段不支持
参考音频数量不支持不支持
返回尾帧图不支持不支持

常见问题

八个最高频的疑问,以及我们验证过的答案。