用过 Seedance 2.0 的人大多有同一个体感:随手写一句"一个男人在街头奔跑,画面很有电影感",出来的东西全靠抽卡;而有些人的提示词,一次就能出接近成片的结果。差距不在运气,在于有没有理解这个模型到底在读什么。
Seedance 2.0 会同时读取你的文字、图片、视频和音频,并在内部把它们拆成两个维度来理解:空间层(画面里有什么)和时间层(事情如何随时间变化)。所以它不是一个"听你形容氛围"的文案助手,而是一个等你递工作单的多模态导演。好的提示词不是抒情散文,而是一份工程指令:谁、在哪、做什么、镜头怎么动、按什么顺序发生。
这篇文章把我们在大量生成实践中反复验证过的方法,提炼成五条规则和一套排查表,看完你就能少抽很多卡。
第一步:选对任务动词
如果你带着参考素材(图片/视频/音频)来生成,先想清楚自己在做哪类任务,因为句式直接决定模型怎么理解你:
| 任务 | 你想做什么 | 推荐句式 |
|---|---|---|
| 多模态参考 | 从素材里提取元素(主体、动作、风格、音色),生成全新视频 | 参考<图片1>中的主体,生成…… |
| 编辑视频 | 在原视频上增、删、改元素,其余保持不变 | 严格编辑<视频1>,将其中的 A 修改为 B |
| 延长视频 | 在时间上向前/向后续写原视频 | 向后延长<视频1>,生成…… |
这里有个新手最容易踩的坑:编辑和延长任务,直接写"视频1",不要写"参考视频1"。多一个"参考",模型就可能把你的编辑任务误判成参考生成任务,产出一个和原视频貌合神离的新视频。
三类任务也可以组合,比如"参考<视频2>的运镜,严格编辑<视频1>……"。
核心公式
文生视频或复杂任务的提示词,按这个骨架组织:
精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件
顺序背后是有逻辑的:先锁定"谁在干什么"(时间层的主角),再交代"在哪、什么氛围"(空间层),然后告诉模型"怎么拍",最后用风格、画质和约束词把结果收紧。下面五条规则,就是这个公式的展开。
规则一:给你的"演员"起名字
一张参考图里往往有多个对象,模型不知道你说的"他"是谁。所以第一件事是定义主体:
将图片1中穿红色连衣裙、戴草帽的女人定义为张红
要点只有三个:
- 用 2–3 个稳定的静态特征(服饰、发型、外观类别)来定义,确保唯一可识别;
- 定义之后,全文持续使用同一个标签指代,不要一会儿"张红"一会儿"那个女人";
- 没有提前定义的简单场景,每次提到主体都用
主体@图片N的写法强调绑定关系,例如"张三@图片1"。
多个角色就分别定义、分别贴标签:"将视频1中的高个子男人定义为警察,将矮个子男人定义为小偷",后文追逐戏里两人永远叫警察和小偷,指代就不会乱。
一个进阶技巧:如果角色的脸很重要,额外准备一张只有头部的大头照,然后写明分工——"老周的面部特征参考图片1(大头照),妆造参考图片2(全身照)"。这是防止"生成到一半换脸"最有效的手段。
规则二:写分镜,不写"氛围"
模型内部是空间与时间解耦建模的,所以复杂视频最理想的提示词形态是时间轴化的分镜:把视频拆成镜头 1、镜头 2、镜头 3,按事件发生顺序写。
反面案例:"男人在街头紧张地奔跑,画面很有电影感。"——模型只能靠猜。
正面案例:
镜头 1:街巷侧拍,男人缓慢起跑,带有急促的呼吸感。
镜头 2:男人撞翻水果摊,镜头快速摇动并给到男人惊恐的特写。
镜头 3:男人翻过矮墙消失,镜头缓慢拉远定格在空荡的街道。
每个镜头内部,推荐按固定顺序交代四件事:
- 运镜或切换方式("中景缓慢推近""镜头切至……")
- 主体动作与表情
- 位置或空间变化
- 音频信息(音效、台词、配乐)
另外注意:不要写精确到秒的时间(如"0–3 秒")。模型对精确时间的支持不稳定,强行限制时长反而容易出异常,让它按剧情自然分配节奏即可。
规则三:动作要"编舞",不要"贴标签"
写动作的原则是:肢体细化 + 程度量化。动作具体到手、腿、头部,并补上幅度、速度、力度——"缓慢抬手""快速转头""用力蹬地",而不是一个笼统的"动了起来"。
两个经验之谈:
- 优先低缓、连续的小动作。缓慢行走、轻轻抬手、顺势坐下,这类动作的成功率远高于狂奔、大跳、剧烈翻滚等高爆发动作;
- 写出动作之间的承接。"借着转身惯性顺势抬手",比孤立地写两个动作衔接自然得多。
情绪也一样——不要写抽象词,把情绪外化成身体细节:
| 抽象写法 | 外化写法 |
|---|---|
| 她很悲伤 | 低头,肩膀微微颤抖,手指无意识地攥紧衣角,泪水在眼眶里打转但没有落下 |
| 他很紧张 | 频繁看手表,手指不停敲击桌面,呼吸急促,眼神闪躲 |
| 她如释重负 | 长长舒了一口气,紧绷的肩膀完全放松,抬头望向远方 |
规则四:一个镜头只用一种运镜
Seedance 2.0 对标准运镜术语的理解力很强,直接用就行:中景、特写、全景、缓慢推镜、平稳横移、固定机位、手持跟拍……
唯一的铁律:一个镜头里只指定一种运镜方式。同时要求推、拉、摇、移,画面稳定性会明显下降。想要复杂的镜头调度,拆成多个镜头,或者干脆丢一段运镜参考视频给它。
规则五:用约束词收尾
提示词的最后一段,负责把随机性关进笼子里,三类词各司其职:
- 画质:高清,细节丰富,电影质感,色彩自然,光影柔和;
- 风格:明确写出目标画风——"2D 日漫风格""复古胶片""赛博朋克冷蓝紫色调"。这一条在参考图是写实风、但你想要动漫成片时尤其重要,不写就容易漂移成真人风格;
- 约束:三件套建议常驻——"保持无字幕""不要生成水印""不要生成 Logo"。多人场景再加一句全局约束:"视频全程禁止出现外形、着装完全一致的重复人物。"
素材怎么配:4–5 个,各司其职
参考素材不是越多越好。把素材按四种功能角色来配置:
- 角色锚定:锁定人物外观(大头照 + 全身照,1–2 张)
- 场景定调:锁定环境与美术风格(1 张)
- 运镜参考:锁定镜头语言与动作节奏(1 段视频)
- 节奏氛围:用音频控制情绪与音色(1 段)
总计 4–5 个素材是甜点区。用满上限反而有害——素材过多时模型难以判断特征优先级,容易风格冲突、主体识别混乱。还有一条反直觉的:人物参考不要用三视图/多视图,模型容易把不同角度识别成不同的人,反而加剧换脸和"双胞胎"问题。
排序也有讲究:越需要精准还原的素材,在提示词里越靠前提及。
符号速查表
Seedance 2.0 约定了一套符号来区分信息类型,正确使用能显著提升理解准确度:
| 信息类型 | 符号 | 示例 |
|---|---|---|
| 音乐 | () | (背景中播放着快节奏的摇滚乐) |
| 音效 | <> | <远处传来狗叫声> |
| 台词 | {} | {你好,世界};小语种需标注语种:用日语说道{こんにちは} |
| 字幕/标题 | 【】 | 【第一章:启程】 |
台词语言要统一,避免中英文混用(专有名词除外)。
翻车排查表
| 症状 | 修复方法 |
|---|---|
| 人物中途"换脸" | 单独准备只含头部的大头照;写明"面部参考图片1,妆造参考图片2";重要素材前置;弃用多视图 |
| 画面出现"双胞胎" | 每个角色绑定对应图片;加全局禁止重复人物约束;用单人照;不要把整个剧本直接当提示词 |
| 风格漂移成真人 | 明确写风格词("3D 国风漫画");必要时先把参考图转成目标风格 |
| 莫名出现字幕 | 加"保持无字幕";清除参考素材里的文字;横屏出字幕的概率明显低于竖屏 |
| 延长视频衔接处跳变 | 续写时以切镜时刻结尾;剪辑时前段末尾删 6 帧、后段开头删 1 帧 |
| 多次续写画质劣化 | 控制续写次数;用高清素材;进阶玩法是先把原视频转成白模视频再续写 |
| 角色超过 4 人就乱 | 先分组生成图片(每张不超过 4 人),再用图生视频 |
| 特效不符合预期 | 别用文字描述特效,直接丢一段特效参考视频 |
还有一个决策点值得单独说:什么时候用"延长",什么时候分段生成再剪辑? 单一场景内的文戏——长对话、情绪递进——用视频延长,做出一镜到底的沉浸感;剧情转折或激烈的武戏——追逐、打斗、蒙太奇——分段生成再拼接,保节奏和冲击力。实际项目里通常两者结合。
完整示例:一个夜市摊位短片
把以上规则全部用上,写一条完整的提示词。
素材准备:图片1 = 摊主大头照;图片2 = 摊主全身照;图片3 = 夜市摊位场景图;音频1 = 轻快的市井背景乐。
将图片1、图片2中的男人定义为老周,面部特征参考图片1(大头照),妆造参考图片2(全身照)。场景参考图片3的夜市炒面摊,背景音乐与音频1融合。
镜头 1:固定机位中景,老周站在炒面摊后颠锅,火苗窜起,他手腕快速抖动翻炒,额头渗出细汗。<铁锅翻炒的哗啦声>(背景中播放着轻快的市井音乐)
镜头 2:镜头缓慢推近至近景,老周把炒面装盘递出,嘴角上扬,对镜头外的顾客说{趁热吃}。
镜头 3:镜头缓慢拉远至全景,摊位灯牌在夜色中亮起,人流穿行,老周转身继续颠锅。
整体画面高清,细节丰富,暖色调,电影质感,光影柔和。保持无字幕,不要生成水印,不要生成 Logo。视频全程仅出现一个老周,禁止出现外形一致的重复人物。
逐段对照:任务动词(参考)、主体定义与分工(大头照管脸、全身照管妆造)、三个分镜各含运镜/动作/空间/音频、每镜一种运镜、符号规范、末尾画质 + 风格 + 约束三件套。
图生视频:再给两条现成的 prompt
夜市那条示例展示的是"完整素材包"的打法。但更多时候,图生视频的起点朴素得多:手里只有一两张图,想让它动起来。下面两条 prompt 一简一繁,正好演示一个容易被忽略的判断——不是所有提示词都需要分镜。单一场景里的一段连续动作,一段话直接写完就够;跨空间、多事件的叙事,才值得展开成"总设定 + 分镜 + 约束"的完整结构。
案例一:单图微动态,让老照片活过来
素材准备:图片1 = 一张老人坐在院中藤椅上的旧照片。
参考图片1中坐在藤椅上、穿深蓝布衫、头发花白的老人,生成她在午后院子里的画面:她先安静地望向前方,然后眼睛缓缓眨动,嘴角慢慢上扬露出浅浅笑意,微微侧头看向画面右侧,借着侧头的动作顺势抬起右手,轻轻拢了拢耳边的碎发;身后晾着的衣物和树影在微风中轻轻晃动。固定机位中近景。<院子里隐约的鸟鸣与风声> 复古胶片质感,色调温暖,光影柔和;人物面部稳定不变形,动作低缓连贯;保持无字幕,不要生成水印,不要生成 Logo。
对照检查:主体用三个静态特征锁定(藤椅、深蓝布衫、花白头发);动作全是低缓连续的小动作,还写了承接(借着侧头顺势抬手);全程只有一种运镜;末尾一句话把画质、稳定和约束三件套折叠收口。简单需求就该这么短——强行拆分镜反而是给模型加戏。
案例二:多图分镜,一支雨巷短片
素材准备:图片1 = 女子大头照;图片2 = 女子旗袍全身照;图片3 = 江南雨巷场景图。注意上传顺序:最需要精准还原的人脸放最前。
整体设定为烟雨朦胧的江南雨巷,电影写实风格。将图片1、图片2中的女子定义为阿澜:面部特征参考图片1(大头照),妆造参考图片2(全身照);场景参考图片3的青石板雨巷,图片3 作为首帧。
镜头 1:全景固定机位,细雨落在青石板上,阿澜撑着一把油纸伞从巷口缓缓走来,脚步轻缓,旗袍下摆随步伐轻轻摆动。<雨滴敲打伞面的沙沙声>
镜头 2:镜头缓慢推近至中近景,阿澜在一扇木门前停下,微微抬伞侧头,目光落在门上的铜环上,睫毛沾着细小的雨珠。
镜头 3:镜头平稳横移,阿澜借着抬手的惯性顺势收伞,转身走入门内,画面定格在雨巷深处朦胧的灯光。(背景中响起舒缓的古筝乐)
整体画面高清,细节丰富,电影胶片质感,冷调低饱和,光影层次丰富;人物面部稳定不变形,动作低缓连贯自然,无穿模无卡顿;保持无字幕,不要生成水印,不要生成 Logo;全程仅出现一位阿澜,禁止出现外形一致的重复人物。
这条把前面五条规则全部串了起来,还多演示了一个图生视频专属的技巧:声明首帧。"图片3 作为首帧"让视频从场景图的构图自然展开——先看到空巷,人物再入画,比让模型自己猜开场稳定得多。情绪的写法也值得留意:全文没有出现"惆怅"两个字,写的是"目光落在铜环上、睫毛沾着雨珠"。
文生视频:一张图都没有时怎么写
前面的例子都带着参考素材。可如果你手头什么都没有——纯文生视频——公式还是开头那套骨架,但有一个关键差别:没有图片可绑定,主体和风格全靠文字锁定,特征必须给得更足。同样一简一繁两条。
案例一:雪夜便利店的猫(一段话直组)
深夜的便利店门口,一只橘白相间的短毛猫蹲坐在台阶上,细小的雪花缓缓飘落。它的耳朵偶尔轻轻抖动,抖落落在耳尖的雪粒,尾巴尖不紧不慢地左右轻扫,呼吸在冷空气里凝成一小团白气;身后玻璃门内透出暖黄的灯光,雪花在光晕里缓缓下坠。固定机位近景。<便利店内隐约的电子门铃声与暖气低鸣> 高清,细节丰富,电影质感,冷暖对比的夜景色调,光影柔和;动物毛发细节稳定,动作低缓连贯;保持无字幕,不要生成水印,不要生成 Logo。
没有参考图,"橘白相间、短毛、蹲坐台阶"就是这只猫仅有的身份证——特征密度直接决定主体稳定度。动作依旧全是低缓小动作(抖耳、扫尾、呼气),这在动物题材里尤其重要。
案例二:咖啡店广告(分镜 + 画面出字)
整体设定为清晨的独立咖啡店,暖调电影质感,自然光从大面玻璃窗斜射进来。
镜头 1:特写固定机位,深棕色咖啡豆从上方缓缓倾泻进磨豆机的金属料斗,豆粒碰撞弹跳,细小的粉尘在逆光中浮动。<咖啡豆哗啦啦的碰撞声>
镜头 2:镜头缓慢推近,白色陶瓷杯中,拿铁拉花从杯心缓缓晕开成一片叶子,蒸汽袅袅上升,在窗光里若隐若现。<牛奶注入的细微水流声>
镜头 3:镜头缓慢拉远至全景,晨光中的咖啡店干净安静,吧台上那杯拿铁冒着热气;画面下三分之一处淡入白色手写体文字"先喝一口,再开始今天"。(背景中响起轻柔的原声吉他)
整体画面高清,细节丰富,暖色调,电影质感,光影柔和;液体与蒸汽形态自然,无畸变;除指定文字外不出现其他任何文字,不要生成水印,不要生成 Logo。
这条藏着一个容易踩反的点:想让画面出字时,约束词要反着用。不能再挂"保持无字幕",而是把文字的四件套写清——内容、出现时机、出现位置、出现方式——再补一句"除指定文字外不出现其他任何文字"兜底。广告语是文生视频最常见的商用场景,这个反转值得记住。
写在最后
Seedance 2.0 把视频生成的瓶颈从"模型能力"挪到了"表达能力"上。你不需要会拍电影,但需要学会像导演写工作单一样写提示词:给演员起名字、按镜头讲故事、把动作编成舞、一镜一种运镜、用约束词收口。
剩下的,就是打开生成器试一条。上面那条夜市提示词,欢迎直接拿去改。