延长 7 天

开始创作

Seedance 2.0 提示词实战指南:别再"形容",要像导演一样下指令

July 25, 2026
一篇拿来就能用的 Seedance 2.0 提示词教程:主体绑定、分镜时序、运镜语言、约束词,以及人物换脸、双胞胎、风格漂移等高频翻车问题的修复方法。
seedance
提示词
AI视频
视频生成



用过 Seedance 2.0 的人大多有同一个体感:随手写一句"一个男人在街头奔跑,画面很有电影感",出来的东西全靠抽卡;而有些人的提示词,一次就能出接近成片的结果。差距不在运气,在于有没有理解这个模型到底在读什么

Seedance 2.0 会同时读取你的文字、图片、视频和音频,并在内部把它们拆成两个维度来理解:空间层(画面里有什么)和时间层(事情如何随时间变化)。所以它不是一个"听你形容氛围"的文案助手,而是一个等你递工作单的多模态导演。好的提示词不是抒情散文,而是一份工程指令:谁、在哪、做什么、镜头怎么动、按什么顺序发生。

这篇文章把我们在大量生成实践中反复验证过的方法,提炼成五条规则和一套排查表,看完你就能少抽很多卡。

第一步:选对任务动词

如果你带着参考素材(图片/视频/音频)来生成,先想清楚自己在做哪类任务,因为句式直接决定模型怎么理解你:

任务你想做什么推荐句式
多模态参考从素材里提取元素(主体、动作、风格、音色),生成全新视频参考<图片1>中的主体,生成……
编辑视频在原视频上增、删、改元素,其余保持不变严格编辑<视频1>,将其中的 A 修改为 B
延长视频在时间上向前/向后续写原视频向后延长<视频1>,生成……

这里有个新手最容易踩的坑:编辑和延长任务,直接写"视频1",不要写"参考视频1"。多一个"参考",模型就可能把你的编辑任务误判成参考生成任务,产出一个和原视频貌合神离的新视频。

三类任务也可以组合,比如"参考<视频2>的运镜,严格编辑<视频1>……"。

核心公式

文生视频或复杂任务的提示词,按这个骨架组织:

精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件

顺序背后是有逻辑的:先锁定"谁在干什么"(时间层的主角),再交代"在哪、什么氛围"(空间层),然后告诉模型"怎么拍",最后用风格、画质和约束词把结果收紧。下面五条规则,就是这个公式的展开。

规则一:给你的"演员"起名字

一张参考图里往往有多个对象,模型不知道你说的"他"是谁。所以第一件事是定义主体

图片1中穿红色连衣裙、戴草帽的女人定义为张红

要点只有三个:

  • 2–3 个稳定的静态特征(服饰、发型、外观类别)来定义,确保唯一可识别;
  • 定义之后,全文持续使用同一个标签指代,不要一会儿"张红"一会儿"那个女人";
  • 没有提前定义的简单场景,每次提到主体都用 主体@图片N 的写法强调绑定关系,例如"张三@图片1"。

多个角色就分别定义、分别贴标签:"将视频1中的高个子男人定义为警察,将矮个子男人定义为小偷",后文追逐戏里两人永远叫警察和小偷,指代就不会乱。

一个进阶技巧:如果角色的脸很重要,额外准备一张只有头部的大头照,然后写明分工——"老周的面部特征参考图片1(大头照),妆造参考图片2(全身照)"。这是防止"生成到一半换脸"最有效的手段。

规则二:写分镜,不写"氛围"

模型内部是空间与时间解耦建模的,所以复杂视频最理想的提示词形态是时间轴化的分镜:把视频拆成镜头 1、镜头 2、镜头 3,按事件发生顺序写。

反面案例:"男人在街头紧张地奔跑,画面很有电影感。"——模型只能靠猜。

正面案例:

镜头 1:街巷侧拍,男人缓慢起跑,带有急促的呼吸感。
镜头 2:男人撞翻水果摊,镜头快速摇动并给到男人惊恐的特写。
镜头 3:男人翻过矮墙消失,镜头缓慢拉远定格在空荡的街道。

每个镜头内部,推荐按固定顺序交代四件事:

  1. 运镜或切换方式("中景缓慢推近""镜头切至……")
  2. 主体动作与表情
  3. 位置或空间变化
  4. 音频信息(音效、台词、配乐)

另外注意:不要写精确到秒的时间(如"0–3 秒")。模型对精确时间的支持不稳定,强行限制时长反而容易出异常,让它按剧情自然分配节奏即可。

规则三:动作要"编舞",不要"贴标签"

写动作的原则是:肢体细化 + 程度量化。动作具体到手、腿、头部,并补上幅度、速度、力度——"缓慢抬手""快速转头""用力蹬地",而不是一个笼统的"动了起来"。

两个经验之谈:

  • 优先低缓、连续的小动作。缓慢行走、轻轻抬手、顺势坐下,这类动作的成功率远高于狂奔、大跳、剧烈翻滚等高爆发动作;
  • 写出动作之间的承接。"借着转身惯性顺势抬手",比孤立地写两个动作衔接自然得多。

情绪也一样——不要写抽象词,把情绪外化成身体细节

抽象写法外化写法
她很悲伤低头,肩膀微微颤抖,手指无意识地攥紧衣角,泪水在眼眶里打转但没有落下
他很紧张频繁看手表,手指不停敲击桌面,呼吸急促,眼神闪躲
她如释重负长长舒了一口气,紧绷的肩膀完全放松,抬头望向远方

规则四:一个镜头只用一种运镜

Seedance 2.0 对标准运镜术语的理解力很强,直接用就行:中景、特写、全景、缓慢推镜、平稳横移、固定机位、手持跟拍……

唯一的铁律:一个镜头里只指定一种运镜方式。同时要求推、拉、摇、移,画面稳定性会明显下降。想要复杂的镜头调度,拆成多个镜头,或者干脆丢一段运镜参考视频给它。

规则五:用约束词收尾

提示词的最后一段,负责把随机性关进笼子里,三类词各司其职:

  • 画质:高清,细节丰富,电影质感,色彩自然,光影柔和;
  • 风格:明确写出目标画风——"2D 日漫风格""复古胶片""赛博朋克冷蓝紫色调"。这一条在参考图是写实风、但你想要动漫成片时尤其重要,不写就容易漂移成真人风格;
  • 约束:三件套建议常驻——"保持无字幕""不要生成水印""不要生成 Logo"。多人场景再加一句全局约束:"视频全程禁止出现外形、着装完全一致的重复人物。"

素材怎么配:4–5 个,各司其职

参考素材不是越多越好。把素材按四种功能角色来配置:

  1. 角色锚定:锁定人物外观(大头照 + 全身照,1–2 张)
  2. 场景定调:锁定环境与美术风格(1 张)
  3. 运镜参考:锁定镜头语言与动作节奏(1 段视频)
  4. 节奏氛围:用音频控制情绪与音色(1 段)

总计 4–5 个素材是甜点区。用满上限反而有害——素材过多时模型难以判断特征优先级,容易风格冲突、主体识别混乱。还有一条反直觉的:人物参考不要用三视图/多视图,模型容易把不同角度识别成不同的人,反而加剧换脸和"双胞胎"问题。

排序也有讲究:越需要精准还原的素材,在提示词里越靠前提及

符号速查表

Seedance 2.0 约定了一套符号来区分信息类型,正确使用能显著提升理解准确度:

信息类型符号示例
音乐()(背景中播放着快节奏的摇滚乐)
音效<><远处传来狗叫声>
台词{}{你好,世界};小语种需标注语种:用日语说道{こんにちは}
字幕/标题【】【第一章:启程】

台词语言要统一,避免中英文混用(专有名词除外)。

翻车排查表

症状修复方法
人物中途"换脸"单独准备只含头部的大头照;写明"面部参考图片1,妆造参考图片2";重要素材前置;弃用多视图
画面出现"双胞胎"每个角色绑定对应图片;加全局禁止重复人物约束;用单人照;不要把整个剧本直接当提示词
风格漂移成真人明确写风格词("3D 国风漫画");必要时先把参考图转成目标风格
莫名出现字幕加"保持无字幕";清除参考素材里的文字;横屏出字幕的概率明显低于竖屏
延长视频衔接处跳变续写时以切镜时刻结尾;剪辑时前段末尾删 6 帧、后段开头删 1 帧
多次续写画质劣化控制续写次数;用高清素材;进阶玩法是先把原视频转成白模视频再续写
角色超过 4 人就乱先分组生成图片(每张不超过 4 人),再用图生视频
特效不符合预期别用文字描述特效,直接丢一段特效参考视频

还有一个决策点值得单独说:什么时候用"延长",什么时候分段生成再剪辑? 单一场景内的文戏——长对话、情绪递进——用视频延长,做出一镜到底的沉浸感;剧情转折或激烈的武戏——追逐、打斗、蒙太奇——分段生成再拼接,保节奏和冲击力。实际项目里通常两者结合。

完整示例:一个夜市摊位短片

把以上规则全部用上,写一条完整的提示词。

素材准备:图片1 = 摊主大头照;图片2 = 摊主全身照;图片3 = 夜市摊位场景图;音频1 = 轻快的市井背景乐。

将图片1、图片2中的男人定义为老周,面部特征参考图片1(大头照),妆造参考图片2(全身照)。场景参考图片3的夜市炒面摊,背景音乐与音频1融合。

镜头 1:固定机位中景,老周站在炒面摊后颠锅,火苗窜起,他手腕快速抖动翻炒,额头渗出细汗。<铁锅翻炒的哗啦声>(背景中播放着轻快的市井音乐)

镜头 2:镜头缓慢推近至近景,老周把炒面装盘递出,嘴角上扬,对镜头外的顾客说{趁热吃}。

镜头 3:镜头缓慢拉远至全景,摊位灯牌在夜色中亮起,人流穿行,老周转身继续颠锅。

整体画面高清,细节丰富,暖色调,电影质感,光影柔和。保持无字幕,不要生成水印,不要生成 Logo。视频全程仅出现一个老周,禁止出现外形一致的重复人物。

逐段对照:任务动词(参考)、主体定义与分工(大头照管脸、全身照管妆造)、三个分镜各含运镜/动作/空间/音频、每镜一种运镜、符号规范、末尾画质 + 风格 + 约束三件套。

图生视频:再给两条现成的 prompt

夜市那条示例展示的是"完整素材包"的打法。但更多时候,图生视频的起点朴素得多:手里只有一两张图,想让它动起来。下面两条 prompt 一简一繁,正好演示一个容易被忽略的判断——不是所有提示词都需要分镜。单一场景里的一段连续动作,一段话直接写完就够;跨空间、多事件的叙事,才值得展开成"总设定 + 分镜 + 约束"的完整结构。

案例一:单图微动态,让老照片活过来

素材准备:图片1 = 一张老人坐在院中藤椅上的旧照片。

参考图片1中坐在藤椅上、穿深蓝布衫、头发花白的老人,生成她在午后院子里的画面:她先安静地望向前方,然后眼睛缓缓眨动,嘴角慢慢上扬露出浅浅笑意,微微侧头看向画面右侧,借着侧头的动作顺势抬起右手,轻轻拢了拢耳边的碎发;身后晾着的衣物和树影在微风中轻轻晃动。固定机位中近景。<院子里隐约的鸟鸣与风声> 复古胶片质感,色调温暖,光影柔和;人物面部稳定不变形,动作低缓连贯;保持无字幕,不要生成水印,不要生成 Logo。

对照检查:主体用三个静态特征锁定(藤椅、深蓝布衫、花白头发);动作全是低缓连续的小动作,还写了承接(借着侧头顺势抬手);全程只有一种运镜;末尾一句话把画质、稳定和约束三件套折叠收口。简单需求就该这么短——强行拆分镜反而是给模型加戏。

案例二:多图分镜,一支雨巷短片

素材准备:图片1 = 女子大头照;图片2 = 女子旗袍全身照;图片3 = 江南雨巷场景图。注意上传顺序:最需要精准还原的人脸放最前。

整体设定为烟雨朦胧的江南雨巷,电影写实风格。将图片1、图片2中的女子定义为阿澜:面部特征参考图片1(大头照),妆造参考图片2(全身照);场景参考图片3的青石板雨巷,图片3 作为首帧。

镜头 1:全景固定机位,细雨落在青石板上,阿澜撑着一把油纸伞从巷口缓缓走来,脚步轻缓,旗袍下摆随步伐轻轻摆动。<雨滴敲打伞面的沙沙声>

镜头 2:镜头缓慢推近至中近景,阿澜在一扇木门前停下,微微抬伞侧头,目光落在门上的铜环上,睫毛沾着细小的雨珠。

镜头 3:镜头平稳横移,阿澜借着抬手的惯性顺势收伞,转身走入门内,画面定格在雨巷深处朦胧的灯光。(背景中响起舒缓的古筝乐)

整体画面高清,细节丰富,电影胶片质感,冷调低饱和,光影层次丰富;人物面部稳定不变形,动作低缓连贯自然,无穿模无卡顿;保持无字幕,不要生成水印,不要生成 Logo;全程仅出现一位阿澜,禁止出现外形一致的重复人物。

这条把前面五条规则全部串了起来,还多演示了一个图生视频专属的技巧:声明首帧。"图片3 作为首帧"让视频从场景图的构图自然展开——先看到空巷,人物再入画,比让模型自己猜开场稳定得多。情绪的写法也值得留意:全文没有出现"惆怅"两个字,写的是"目光落在铜环上、睫毛沾着雨珠"。

文生视频:一张图都没有时怎么写

前面的例子都带着参考素材。可如果你手头什么都没有——纯文生视频——公式还是开头那套骨架,但有一个关键差别:没有图片可绑定,主体和风格全靠文字锁定,特征必须给得更足。同样一简一繁两条。

案例一:雪夜便利店的猫(一段话直组)

深夜的便利店门口,一只橘白相间的短毛猫蹲坐在台阶上,细小的雪花缓缓飘落。它的耳朵偶尔轻轻抖动,抖落落在耳尖的雪粒,尾巴尖不紧不慢地左右轻扫,呼吸在冷空气里凝成一小团白气;身后玻璃门内透出暖黄的灯光,雪花在光晕里缓缓下坠。固定机位近景。<便利店内隐约的电子门铃声与暖气低鸣> 高清,细节丰富,电影质感,冷暖对比的夜景色调,光影柔和;动物毛发细节稳定,动作低缓连贯;保持无字幕,不要生成水印,不要生成 Logo。

没有参考图,"橘白相间、短毛、蹲坐台阶"就是这只猫仅有的身份证——特征密度直接决定主体稳定度。动作依旧全是低缓小动作(抖耳、扫尾、呼气),这在动物题材里尤其重要。

案例二:咖啡店广告(分镜 + 画面出字)

整体设定为清晨的独立咖啡店,暖调电影质感,自然光从大面玻璃窗斜射进来。

镜头 1:特写固定机位,深棕色咖啡豆从上方缓缓倾泻进磨豆机的金属料斗,豆粒碰撞弹跳,细小的粉尘在逆光中浮动。<咖啡豆哗啦啦的碰撞声>

镜头 2:镜头缓慢推近,白色陶瓷杯中,拿铁拉花从杯心缓缓晕开成一片叶子,蒸汽袅袅上升,在窗光里若隐若现。<牛奶注入的细微水流声>

镜头 3:镜头缓慢拉远至全景,晨光中的咖啡店干净安静,吧台上那杯拿铁冒着热气;画面下三分之一处淡入白色手写体文字"先喝一口,再开始今天"。(背景中响起轻柔的原声吉他)

整体画面高清,细节丰富,暖色调,电影质感,光影柔和;液体与蒸汽形态自然,无畸变;除指定文字外不出现其他任何文字,不要生成水印,不要生成 Logo。

这条藏着一个容易踩反的点:想让画面出字时,约束词要反着用。不能再挂"保持无字幕",而是把文字的四件套写清——内容、出现时机、出现位置、出现方式——再补一句"除指定文字外不出现其他任何文字"兜底。广告语是文生视频最常见的商用场景,这个反转值得记住。

写在最后

Seedance 2.0 把视频生成的瓶颈从"模型能力"挪到了"表达能力"上。你不需要会拍电影,但需要学会像导演写工作单一样写提示词:给演员起名字、按镜头讲故事、把动作编成舞、一镜一种运镜、用约束词收口。

剩下的,就是打开生成器试一条。上面那条夜市提示词,欢迎直接拿去改。