用過 Seedance 2.0 的人大多有同一個體感:隨手寫一句「一個男人在街頭奔跑,畫面很有電影感」,出來的東西全靠抽卡;而有些人的提示詞,一次就能出接近成片的結果。差距不在運氣,在於有沒有理解這個模型到底在讀什麼。
Seedance 2.0 會同時讀取你的文字、圖片、影片和音訊,並在內部把它們拆成兩個維度來理解:空間層(畫面裡有什麼)和時間層(事情如何隨時間變化)。所以它不是一個「聽你形容氛圍」的文案助手,而是一個等你遞工作單的多模態導演。好的提示詞不是抒情散文,而是一份工程指令:誰、在哪、做什麼、鏡頭怎麼動、按什麼順序發生。
這篇文章把我們在大量生成實踐中反覆驗證過的方法,提煉成五條規則和一套排查表,看完你就能少抽很多卡。
第一步:選對任務動詞
如果你帶著參考素材(圖片/影片/音訊)來生成,先想清楚自己在做哪類任務,因為句式直接決定模型怎麼理解你:
| 任務 | 你想做什麼 | 推薦句式 |
|---|---|---|
| 多模態參考 | 從素材裡提取元素(主體、動作、風格、音色),生成全新影片 | 參考<圖片1>中的主體,生成…… |
| 編輯影片 | 在原影片上增、刪、改元素,其餘保持不變 | 嚴格編輯<影片1>,將其中的 A 修改為 B |
| 延長影片 | 在時間上向前/向後續寫原影片 | 向後延長<影片1>,生成…… |
這裡有個新手最容易踩的坑:編輯和延長任務,直接寫「影片1」,不要寫「參考影片1」。多一個「參考」,模型就可能把你的編輯任務誤判成參考生成任務,產出一個和原影片貌合神離的新影片。
三類任務也可以組合,比如「參考<影片2>的運鏡,嚴格編輯<影片1>……」
核心公式
文生影片或複雜任務的提示詞,按這個骨架組織:
精準主體 + 動作細節 + 場景環境 + 光影色調 + 鏡頭運鏡 + 視覺風格 + 畫質 + 約束條件
順序背後是有邏輯的:先鎖定「誰在幹什麼」(時間層的主角),再交代「在哪、什麼氛圍」(空間層),然後告訴模型「怎麼拍」,最後用風格、畫質和約束詞把結果收緊。下面五條規則,就是這個公式的展開。
規則一:給你的「演員」起名字
一張參考圖裡往往有多個對象,模型不知道你說的「他」是誰。所以第一件事是定義主體:
將圖片1中穿紅色連身裙、戴草帽的女人定義為張紅
要點只有三個:
- 用 2–3 個穩定的靜態特徵(服飾、髮型、外觀類別)來定義,確保唯一可識別;
- 定義之後,全文持續使用同一個標籤指代,不要一會兒「張紅」一會兒「那個女人」;
- 沒有提前定義的簡單場景,每次提到主體都用
主體@圖片N的寫法強調綁定關係,例如「張三@圖片1」。
多個角色就分別定義、分別貼標籤:「將影片1中的高個子男人定義為警察,將矮個子男人定義為小偷」,後文追逐戲裡兩人永遠叫警察和小偷,指代就不會亂。
一個進階技巧:如果角色的臉很重要,額外準備一張只有頭部的大頭照,然後寫明分工——「老周的面部特徵參考圖片1(大頭照),妝造參考圖片2(全身照)」。這是防止「生成到一半換臉」最有效的手段。
規則二:寫分鏡,不寫「氛圍」
模型內部是空間與時間解耦建模的,所以複雜影片最理想的提示詞形態是時間軸化的分鏡:把影片拆成鏡頭 1、鏡頭 2、鏡頭 3,按事件發生順序寫。
反面案例:「男人在街頭緊張地奔跑,畫面很有電影感。」——模型只能靠猜。
正面案例:
鏡頭 1:街巷側拍,男人緩慢起跑,帶有急促的呼吸感。
鏡頭 2:男人撞翻水果攤,鏡頭快速搖動並給到男人驚恐的特寫。
鏡頭 3:男人翻過矮牆消失,鏡頭緩慢拉遠定格在空蕩的街道。
每個鏡頭內部,推薦按固定順序交代四件事:
- 運鏡或切換方式(「中景緩慢推近」「鏡頭切至……」)
- 主體動作與表情
- 位置或空間變化
- 音訊資訊(音效、台詞、配樂)
另外注意:不要寫精確到秒的時間(如「0–3 秒」)。模型對精確時間的支援不穩定,強行限制時長反而容易出異常,讓它按劇情自然分配節奏即可。
規則三:動作要「編舞」,不要「貼標籤」
寫動作的原則是:肢體細化 + 程度量化。動作具體到手、腿、頭部,並補上幅度、速度、力度——「緩慢抬手」「快速轉頭」「用力蹬地」,而不是一個籠統的「動了起來」。
兩個經驗之談:
- 優先低緩、連續的小動作。緩慢行走、輕輕抬手、順勢坐下,這類動作的成功率遠高於狂奔、大跳、劇烈翻滾等高爆發動作;
- 寫出動作之間的承接。「藉著轉身慣性順勢抬手」,比孤立地寫兩個動作銜接自然得多。
情緒也一樣——不要寫抽象詞,把情緒外化成身體細節:
| 抽象寫法 | 外化寫法 |
|---|---|
| 她很悲傷 | 低頭,肩膀微微顫抖,手指不自覺地攥緊衣角,淚水在眼眶裡打轉但沒有落下 |
| 他很緊張 | 頻繁看手錶,手指不停敲擊桌面,呼吸急促,眼神閃躲 |
| 她如釋重負 | 長長舒了一口氣,緊繃的肩膀完全放鬆,抬頭望向遠方 |
規則四:一個鏡頭只用一種運鏡
Seedance 2.0 對標準運鏡術語的理解力很強,直接用就行:中景、特寫、全景、緩慢推鏡、平穩橫移、固定機位、手持跟拍……
唯一的鐵律:一個鏡頭裡只指定一種運鏡方式。同時要求推、拉、搖、移,畫面穩定性會明顯下降。想要複雜的鏡頭調度,拆成多個鏡頭,或者乾脆丟一段運鏡參考影片給它。
規則五:用約束詞收尾
提示詞的最後一段,負責把隨機性關進籠子裡,三類詞各司其職:
- 畫質:高清,細節豐富,電影質感,色彩自然,光影柔和;
- 風格:明確寫出目標畫風——「2D 日漫風格」「復古底片」「賽博龐克冷藍紫色調」。這一條在參考圖是寫實風、但你想要動漫成片時尤其重要,不寫就容易漂移成真人風格;
- 約束:三件套建議常駐——「保持無字幕」「不要生成浮水印」「不要生成 Logo」。多人場景再加一句全域約束:「影片全程禁止出現外形、著裝完全一致的重複人物。」
素材怎麼配:4–5 個,各司其職
參考素材不是越多越好。把素材按四種功能角色來配置:
- 角色錨定:鎖定人物外觀(大頭照 + 全身照,1–2 張)
- 場景定調:鎖定環境與美術風格(1 張)
- 運鏡參考:鎖定鏡頭語言與動作節奏(1 段影片)
- 節奏氛圍:用音訊控制情緒與音色(1 段)
總計 4–5 個素材是甜點區。用滿上限反而有害——素材過多時模型難以判斷特徵優先級,容易風格衝突、主體識別混亂。還有一條反直覺的:人物參考不要用三視圖/多視圖,模型容易把不同角度識別成不同的人,反而加劇換臉和「雙胞胎」問題。
排序也有講究:越需要精準還原的素材,在提示詞裡越靠前提及。
符號速查表
Seedance 2.0 約定了一套符號來區分資訊類型,正確使用能顯著提升理解準確度:
| 資訊類型 | 符號 | 示例 |
|---|---|---|
| 音樂 | () | (背景中播放著快節奏的搖滾樂) |
| 音效 | <> | <遠處傳來狗叫聲> |
| 台詞 | {} | {你好,世界};小語種需標註語種:用日語說{こんにちは} |
| 字幕/標題 | 【】 | 【第一章:啟程】 |
台詞語言要統一,避免中英文混用(專有名詞除外)。
翻車排查表
| 症狀 | 修復方法 |
|---|---|
| 人物中途「換臉」 | 單獨準備只含頭部的大頭照;寫明「面部參考圖片1,妝造參考圖片2」;重要素材前置;棄用多視圖 |
| 畫面出現「雙胞胎」 | 每個角色綁定對應圖片;加全域禁止重複人物約束;用單人照;不要把整個劇本直接當提示詞 |
| 風格漂移成真人 | 明確寫風格詞(「3D 國風漫畫」);必要時先把參考圖轉成目標風格 |
| 莫名出現字幕 | 加「保持無字幕」;清除參考素材裡的文字;橫式出字幕的機率明顯低於直式 |
| 延長影片銜接處跳變 | 續寫時以切鏡時刻結尾;剪輯時前段末尾刪 6 幀、後段開頭刪 1 幀 |
| 多次續寫畫質劣化 | 控制續寫次數;用高清素材;進階玩法是先把原影片轉成白模影片再續寫 |
| 角色超過 4 人就亂 | 先分組生成圖片(每張不超過 4 人),再用圖生影片 |
| 特效不符合預期 | 別用文字描述特效,直接丟一段特效參考影片 |
還有一個決策點值得單獨說:什麼時候用「延長」,什麼時候分段生成再剪輯? 單一場景內的文戲——長對話、情緒遞進——用影片延長,做出一鏡到底的沉浸感;劇情轉折或激烈的武戲——追逐、打鬥、蒙太奇——分段生成再拼接,保住節奏和衝擊力。實際專案裡通常兩者結合。
完整示例:一個夜市攤位短片
把以上規則全部用上,寫一條完整的提示詞。
素材準備:圖片1 = 攤主大頭照;圖片2 = 攤主全身照;圖片3 = 夜市攤位場景圖;音訊1 = 輕快的市井背景音樂。
將圖片1、圖片2中的男人定義為老周,面部特徵參考圖片1(大頭照),妝造參考圖片2(全身照)。場景參考圖片3的夜市炒麵攤,背景音樂與音訊1融合。
鏡頭 1:固定機位中景,老周站在炒麵攤後翻鍋,火苗竄起,他手腕快速抖動翻炒,額頭滲出細汗。<鐵鍋翻炒的嘩啦聲>(背景中播放著輕快的市井音樂)
鏡頭 2:鏡頭緩慢推近至近景,老周把炒麵裝盤遞出,嘴角上揚,對鏡頭外的顧客說{趁熱吃}。
鏡頭 3:鏡頭緩慢拉遠至全景,攤位燈牌在夜色中亮起,人潮穿行,老周轉身繼續翻鍋。
整體畫面高清,細節豐富,暖色調,電影質感,光影柔和。保持無字幕,不要生成浮水印,不要生成 Logo。影片全程僅出現一個老周,禁止出現外形一致的重複人物。
逐段對照:任務動詞(參考)、主體定義與分工(大頭照管臉、全身照管妝造)、三個分鏡各含運鏡/動作/空間/音訊、每鏡一種運鏡、符號規範、末尾畫質 + 風格 + 約束三件套。
圖生影片:再給兩條現成的 prompt
夜市那條示例展示的是「完整素材包」的打法。但更多時候,圖生影片的起點樸素得多:手裡只有一兩張圖,想讓它動起來。下面兩條 prompt 一簡一繁,正好演示一個容易被忽略的判斷——不是所有提示詞都需要分鏡。單一場景裡的一段連續動作,一段話直接寫完就夠;跨空間、多事件的敘事,才值得展開成「總設定 + 分鏡 + 約束」的完整結構。
案例一:單圖微動態,讓老照片活過來
素材準備:圖片1 = 一張老人坐在院中藤椅上的舊照片。
參考圖片1中坐在藤椅上、穿深藍布衫、頭髮花白的老人,生成她在午後院子裡的畫面:她先安靜地望向前方,然後眼睛緩緩眨動,嘴角慢慢上揚露出淺淺笑意,微微側頭看向畫面右側,藉著側頭的動作順勢抬起右手,輕輕攏了攏耳邊的碎髮;身後晾著的衣物和樹影在微風中輕輕晃動。固定機位中近景。<院子裡隱約的鳥鳴與風聲> 復古底片質感,色調溫暖,光影柔和;人物面部穩定不變形,動作低緩連貫;保持無字幕,不要生成浮水印,不要生成 Logo。
對照檢查:主體用三個靜態特徵鎖定(藤椅、深藍布衫、花白頭髮);動作全是低緩連續的小動作,還寫了承接(藉著側頭順勢抬手);全程只有一種運鏡;末尾一句話把畫質、穩定和約束三件套摺疊收口。簡單需求就該這麼短——強行拆分鏡反而是給模型加戲。
案例二:多圖分鏡,一支雨巷短片
素材準備:圖片1 = 女子大頭照;圖片2 = 女子旗袍全身照;圖片3 = 江南雨巷場景圖。注意上傳順序:最需要精準還原的人臉放最前。
整體設定為煙雨朦朧的江南雨巷,電影寫實風格。將圖片1、圖片2中的女子定義為阿瀾:面部特徵參考圖片1(大頭照),妝造參考圖片2(全身照);場景參考圖片3的青石板雨巷,圖片3 作為首幀。
鏡頭 1:全景固定機位,細雨落在青石板上,阿瀾撐著一把油紙傘從巷口緩緩走來,腳步輕緩,旗袍下襬隨步伐輕輕擺動。<雨滴敲打傘面的沙沙聲>
鏡頭 2:鏡頭緩慢推近至中近景,阿瀾在一扇木門前停下,微微抬傘側頭,目光落在門上的銅環上,睫毛沾著細小的雨珠。
鏡頭 3:鏡頭平穩橫移,阿瀾藉著抬手的慣性順勢收傘,轉身走入門內,畫面定格在雨巷深處朦朧的燈光。(背景中響起舒緩的古箏樂)
整體畫面高清,細節豐富,電影底片質感,冷調低飽和,光影層次豐富;人物面部穩定不變形,動作低緩連貫自然,無穿模無卡頓;保持無字幕,不要生成浮水印,不要生成 Logo;全程僅出現一位阿瀾,禁止出現外形一致的重複人物。
這條把前面五條規則全部串了起來,還多演示了一個圖生影片專屬的技巧:標明首幀。「圖片3 作為首幀」讓影片從場景圖的構圖自然展開——先看到空巷,人物再入畫,比讓模型自己猜開場穩定得多。情緒的寫法也值得留意:全文沒有出現「惆悵」兩個字,寫的是「目光落在銅環上、睫毛沾著雨珠」。
文生影片:一張圖都沒有的時候怎麼寫
前面的例子都帶著參考素材。可如果你手頭什麼都沒有——純文生影片——公式還是開頭那套骨架,但有一個關鍵差別:沒有圖片可綁定,主體和風格全靠文字鎖定,特徵必須給得更足。同樣一簡一繁兩條。
案例一:雪夜便利商店的貓(一段話直組)
深夜的便利商店門口,一隻橘白相間的短毛貓蹲坐在台階上,細小的雪花緩緩飄落。牠的耳朵偶爾輕輕抖動,抖落落在耳尖的雪粒,尾巴尖不緊不慢地左右輕掃,呼吸在冷空氣裡凝成一小團白氣;身後玻璃門內透出暖黃的燈光,雪花在光暈裡緩緩下墜。固定機位近景。<便利商店內隱約的電子門鈴聲與暖氣低鳴> 高清,細節豐富,電影質感,冷暖對比的夜景色調,光影柔和;動物毛髮細節穩定,動作低緩連貫;保持無字幕,不要生成浮水印,不要生成 Logo。
沒有參考圖,「橘白相間、短毛、蹲坐台階」就是這隻貓僅有的身分證——特徵密度直接決定主體穩定度。動作依舊全是低緩小動作(抖耳、掃尾、呼氣),這在動物題材裡尤其重要。
案例二:咖啡店廣告(分鏡 + 畫面出字)
整體設定為清晨的獨立咖啡店,暖調電影質感,自然光從大片玻璃窗斜射進來。
鏡頭 1:特寫固定機位,深棕色咖啡豆從上方緩緩傾瀉進磨豆機的金屬料斗,豆粒碰撞彈跳,細小的粉塵在逆光中浮動。<咖啡豆嘩啦啦的碰撞聲>
鏡頭 2:鏡頭緩慢推近,白色陶瓷杯中,拿鐵拉花從杯心緩緩暈開成一片葉子,蒸汽裊裊上升,在窗光裡若隱若現。<牛奶注入的細微水流聲>
鏡頭 3:鏡頭緩慢拉遠至全景,晨光中的咖啡店乾淨安靜,吧檯上那杯拿鐵冒著熱氣;畫面下三分之一處淡入白色手寫體文字「先喝一口,再開始今天」。(背景中響起輕柔的原聲吉他)
整體畫面高清,細節豐富,暖色調,電影質感,光影柔和;液體與蒸汽形態自然,無畸變;除指定文字外不出現其他任何文字,不要生成浮水印,不要生成 Logo。
這條藏著一個容易踩反的點:想讓畫面出字時,約束詞要反著用。不能再掛「保持無字幕」,而是把文字的四件套寫清——內容、出現時機、出現位置、出現方式——再補一句「除指定文字外不出現其他任何文字」兜底。廣告詞是文生影片最常見的商用場景,這個反轉值得記住。
寫在最後
Seedance 2.0 把影片生成的瓶頸從「模型能力」挪到了「表達能力」上。你不需要會拍電影,但需要學會像導演寫工作單一樣寫提示詞:給演員起名字、按鏡頭講故事、把動作編成舞、一鏡一種運鏡、用約束詞收口。
剩下的,就是打開生成器試一條。上面那條夜市提示詞,歡迎直接拿去改。