指南

Wan 2.7 指南

從基礎公式到首尾幀、影片續寫、音色參考與影片編輯的完整寫法——每一章都配了可直接提交的範例提示詞,點「試試看」即可預填進 Molyin 生成器。Wan 2.7 是阿里通義萬相的 27B MoE 影片模型:電影級 1080p、2-15 秒連續時長、原生音訊條條有聲、支援首尾幀插值與影片續寫——這份指南把這幾件武器逐一講透。

更新於 2026-08-06

01 基礎公式

Wan 2.7 聽得懂結構化的指令:誰、做什麼、鏡頭怎麼動、在哪、什麼調性。本章把一條好提示詞拆成五個可複用的零件,再講透兩件順手的工具——5 檔長寬比與 seed 種子。先立住骨架,後面所有章節都只是它的延伸。

1.1 基本提示詞公式

一切從一句話開始:主體加動作是必需的兩塊,鏡頭、環境、風格按需疊加。先在腦子裡把這條片子拍完,再按公式把它寫出來。時長是 2-15 秒的連續撥盤——幾秒就安排幾秒的事。Wan 2.7 還有個貼心特性:提示詞寫得短也不用擔心,模型會自動智慧改寫補全細節,但骨架清晰的原稿永遠比它猜的更準。

[主體] + [動作] + 可選 [鏡頭] [環境] [風格]

必填

主體

畫面裡的主角——人物、動物或產品,描述越具體越好。

必填

動作

主體在做什麼,寫清肢體部位與快慢輕重;緩慢連貫的小動作最穩。

可選

鏡頭

景別與運鏡:特寫、推鏡、橫移;多鏡頭敘事直接寫分鏡,如「第1個鏡頭[0-3秒] 全景」。

可選

環境

場景與氛圍:地點、時間、光線、天氣。

可選

風格

美術調性與畫質:色調、質感、清晰度。

雨夜霓虹下的騎手

提示詞

雨夜的東京街頭,一位穿黑色皮衣的女騎手跨坐在重型機車上,摘下頭盔甩了甩被雨水打濕的長髮,霓虹燈牌在濕漉漉的路面上投下粉藍色的倒影。鏡頭從低角度緩慢推近至半身特寫,細雨在逆光中清晰可見。電影質感,賽博龐克色調,畫面細節豐富。

主體+動作兩句起步,鏡頭與環境各補一句,風格詞收尾——這就是一條合格的 Wan 2.7 基礎提示詞。建議解析度 1080p、比例 16:9。

1.2 五檔比例怎麼選

Wan 2.7 提供 5 檔長寬比:16:9、9:16、1:1、4:3、3:4。選法只有一條原則——按發布平台倒推:橫式長影片選 16:9,手機直式訊息流選 9:16,正方形 feed 選 1:1,人像靜物選 4:3 或 3:4。比例在生成前定,事後再裁只會白丟畫質。注意圖生影片沒有比例選擇器——輸出比例自動跟隨首幀素材。

老街轉角的風衣

提示詞

一條灑滿午後陽光的老街,穿米色長風衣的模特從轉角走來,步伐從容,風衣下擺隨步伐擺動,她在櫥窗前停下腳步側頭一笑。鏡頭中景跟拍隨後緩推近,暖調復古底片質感,街景細節豐富。

已預填 9:16 直式——手機訊息流的標準畫幅,人物全身構圖剛好撐滿直式畫面。

1.3 用 seed 復現與疊代

seed 是 Wan 2.7 的隨機種子:固定 seed,同一條提示詞可以反覆生成出高度接近的結果——除錯提示詞時改一個詞就能看清這個詞的影響;換掉 seed,同一條提示詞又是一批新版本。兩個習慣值得養成:跑出滿意結果時記下 seed;做 A/B 對比時鎖死 seed 只改描述詞。注意生成有機率性,相同 seed 不保證逐像素一致,但構圖與主體的穩定性遠高於隨機抽卡。

窗台上的紙鶴

提示詞

一隻摺紙千紙鶴立在被晨光曬暖的窗台上,微風從窗縫鑽進來,紙鶴的翅膀輕輕顫動,隨後被風托著滑下窗台,在房間裡打著旋兒飄向書架。鏡頭緩慢跟拍,木地板上光影斑駁,空氣裡有細小的塵埃浮動。

已預填 seed 42——改描述詞、不動種子,就能對比每一版微調的效果。

1.4 配樂參考:讓畫面跟著音樂走

文生影片的音訊輸入位語義是「配樂」——上傳一段音樂,模型把它當背景音樂,並讓畫面節奏、動作卡點跟著音樂情緒走。寫法上只需在提示詞裡點名「配樂使用音訊1」,再補一句希望畫面怎麼響應音樂(卡點、情緒遞進、氛圍貼合)。這和「產物恆有聲」是兩回事:配樂位是你主動給的音樂方向,不寫模型也會自己配樂。

濱海公路的黃昏兜風

提示詞

一輛復古敞篷車行駛在黃昏的濱海公路上,副駕駛的女生迎著風輕輕哼唱,髮絲飛揚,路邊的棕櫚樹快速後退,海面反射著碎金般的夕陽。鏡頭從車側跟拍緩慢環繞至車頭前方,暖金色調,底片質感。配樂使用音訊1,畫面節奏與鏡頭運動跟隨音樂情緒,在副歌處鏡頭環繞加速。

需在音訊輸入位上傳 1 段音樂(t2v 音訊位的語義是配樂);已預填 10 秒——給足音樂情緒遞進與卡點的空間。

02 圖生影片

一張首幀圖片加一句運動描述,Wan 2.7 就能讓畫面動起來——提示詞的重心從「描述畫面」轉向「描述運動」,因為畫面已經有了。一條硬規則先記住:圖生影片的輸出比例自動跟隨首幀圖,沒有比例選擇器——想要 9:16 的成片,就上傳 9:16 的圖。

2.1 讓照片動起來

圖生影片的提示詞只寫三件事:誰動、怎麼動、鏡頭動不動。圖裡沒有的東西不要硬加,圖裡已有的東西可以「喚醒」——飄動的衣角、流動的水面、搖曳的燈火,都是高命中的小動作。補一句「延續原圖質感」,畫風就不會跑偏。

漁港的黃昏

提示詞

讓這張照片動起來:夕陽把漁港染成金紅色,水面波光緩緩晃動,停泊的漁船隨細浪輕輕起伏,桅杆上的旗子被海風吹得獵獵作響,幾隻海鷗掠過遠處的防波堤。鏡頭保持固定,全程延續原圖黃昏暖調的底片質感。

需上傳 1 張首幀圖片;只寫動作不重述場景,「延續原圖質感」一句穩住畫風;輸出比例自動跟隨首幀。

2.2 首尾幀:開頭結尾都歸你管

Wan 2.7 與 Seedance 家族、Kling 3.0、Veo 3.1 同屬平台支援首尾幀的模型族——上傳首幀和尾幀兩張圖,模型自動生成中間的過程。這改變了提示詞的寫法:不用描述起點和終點(圖裡已經有了),只寫「怎麼從 A 到 B」——變化的節奏、鏡頭怎麼配合。兩張圖的比例要一致,構圖差異越大越要給足過程描述。

墨滴暈成山水

提示詞

一滴濃墨落進清水,緩緩暈開、舒展,墨絲在水中翻捲流動,逐漸化作一幅層巒疊嶂的水墨山水,留白處雲霧繚繞。鏡頭緩慢推近墨團中心,全程流暢連貫,宣紙紋理與水墨質感貫穿始終。

需在圖生影片模式打開「新增尾幀」開關並上傳首幀+尾幀兩張圖(墨滴 → 山水);提示詞只寫變化過程,8 秒給足暈染時間。

2.3 驅動音訊:讓照片開口說話

圖生影片的音訊輸入位語義是「驅動音訊」——上傳一段人聲,照片裡的人物會跟著這段語音開口,口型、表情與頭部動作隨語音節奏驅動。口白、帶貨、角色唸白都靠它。寫法上只需一句「口型與音訊1的語音嚴格同步」,再照例描述鏡頭與氛圍。

播客主持人開麥

提示詞

讓這張照片動起來:播客主持人對著麥克風自然地說話,表情生動,伴隨輕微的點頭與手勢,口型與音訊1的語音嚴格同步,聲音的情緒變化帶動面部神態起伏。背景書架上的暖光檯燈靜靜亮著,鏡頭固定中景,全程延續原圖的紀實攝影質感。

需上傳 1 張人物照片 + 1 段人聲音訊(i2v 音訊位的語義是驅動音訊);音訊建議清晰無雜音的人聲,口型命中率最高。

2.4 影片續寫:接著拍,不用重拍

圖生影片還支援上傳一段 2-10 秒的影片作為「續寫底片」(first_clip)——模型從這段影片的結尾接著往下拍,動作、風格、光線自然延續。提示詞只寫新增的那一段內容,前情不用重述。三條邊界記牢:續寫底片與首幀圖互斥(二選一)、可以同時配尾幀鎖定結局、但不能同時配驅動音訊。時長撥盤定的是續寫後的總時長,按總時長計費。

續寫:[新增內容描述] + 可選 [延續性要求]

必填

新增內容

只寫底片結尾之後發生什麼:新動作、新場景、新運鏡。

可選

延續性

一句「動作銜接自然、風格與光線延續原影片」防止接茬處跳變。

滑板少年的第二跳

提示詞

續寫上傳的影片:滑板少年落地後順勢向前滑行,鏡頭繼續低角度跟隨,他加速衝向前方的階梯,起跳、翻板,穩穩落在階梯下方的平地上,向鏡頭揮手後滑出畫面。動作銜接自然流暢,風格與光線延續原影片。

需上傳 1 段 2-10 秒影片作為續寫底片(與首幀圖互斥,不可同時配驅動音訊);已預填總時長 10 秒——撥盤定的是續寫後的全長。

03 參考生影片

文字說不清的長相與動作——角色、產品、招牌動作——直接交給參考素材。Wan 2.7 的參考生影片接受圖片與影片混合參考:圖片最多 5 張、影片最多 5 段,兩類合計最多 5 個,按上傳順序用「圖片1」「圖片2」「影片1」在提示詞裡分別點名(圖片與影片各自獨立編號),模型照著素材鎖定外觀與動態,場景與劇情全部由你的文字決定。音訊走獨立的單音訊輸入位(音色參考,見 3.3),不佔參考素材名額。注意 r2v 的時長上限恆為 10 秒——帶不帶參考影片都一樣。

3.1 角色參考公式

參考生影片的提示詞結構是三段式:先用「圖片N」把素材請進場,再寫新場景裡發生什麼,最後一句「保持一致」收口。上傳順序就是編號順序——第一張圖是圖片1,第二段影片是影片2。同一角色的多角度圖效果最好;參考素材裡只放一個角色,多人合照會讓模型分不清誰是誰。

[參考素材:圖片1…] + [場景描述] + 保持 [主體] 特徵一致

必填

參考素材

圖片或影片,圖片 ≤5、影片 ≤5、合計 ≤5,用「圖片N」「影片N」分別按序引用。

可選

場景描述

新場景裡發生什麼:動作、環境、運鏡——畫面從零生成,全由文字決定。

可選

一致性

一句「與參考素材保持一致」強化外觀鎖定。

熊貓師傅的深夜食堂

提示詞

圖片1中的大熊貓繫著深藍色圍裙,在暖黃燈光的小廚房裡顛勺翻炒,鍋氣升騰,牠得意地嚐了一口湯汁,滿意地點點頭。鏡頭環繞灶台半周後停在牠的側臉特寫,廚房細節豐富,溫馨療癒的日常氛圍。熊貓的外觀和參考圖保持一致,3D 動畫質感。

需上傳 1 張以上參考圖;「圖片1」指代你上傳的角色圖,結尾「保持一致」是鎖定外觀的固定句式。

3.2 圖+影片混合參考

Wan 2.7 的獨門絕活:圖片管長相、影片管動態,兩種素材可以同場使用——「影片1的舞者走進圖片1的舞台」,模型各取所需。三條硬規則記牢:圖片最多 5 張、影片最多 5 段、兩類合計不超過 5 個;參考生影片的時長上限恆為 10 秒(帶不帶參考影片都一樣);參考素材為主體角色時只放單一角色。

木偶師的登台時刻

提示詞

圖片1中的提線木偶師牽著線走上圖片2中的復古劇場舞台,舞台追光打在他身上,他模仿影片1中的鞠躬動作向觀眾致意,隨後提起手中的木偶開始表演,幕布在身後緩緩闔攏。鏡頭從觀眾席中景緩慢推近,劇場氛圍莊重而神祕。人物與場景的外觀和參考素材保持一致。

需上傳 2 張參考圖 + 1 段參考影片(合計 3 ≤ 5);「圖片1」「圖片2」「影片1」分別點名分工;r2v 時長上限恆為 10 秒,已預填 8 秒。

3.3 音色參考:讓角色用你的聲音說話

參考生影片的音訊輸入位語義是「音色參考」——上傳一段目標人聲的音訊,生成的角色會用這個聲線說話,口音、語氣、情緒張力高保真復刻。品牌專屬配音、虛擬人口白、多角色對白都靠它。寫法上點名「用音訊1的音色說出台詞」,台詞文本直接寫進提示詞,口型會與發音自動同步。

品牌代言人的新口號

提示詞

圖片1中的品牌代言人站在圖片2的極簡攝影棚裡,面向鏡頭,用音訊1的音色說出品牌口號:「讓每一次出發,都成為風景。」語氣溫暖而堅定,口型與發音嚴格同步,說到「風景」時微微一笑。鏡頭緩慢推近至半身特寫,人物外觀與參考圖保持一致,影棚柔光,畫面乾淨高級。

需上傳人物圖 + 場景圖 + 1 段參考音色音訊(r2v 音訊位的語義是音色參考);台詞直接寫進提示詞,音色復刻交給音訊。

3.4 首幀錨定:開場構圖也歸你管

參考生影片支援額外上傳一張「首幀圖」錨定開場畫面——第一幀的構圖、機位、光影由你精確控制,從第二幀起模型再按提示詞展開。一個連帶效應要知道:傳入首幀後輸出比例自動跟隨首幀,比例選擇器隨之失效(此時比例參數會被直接忽略)。

咖啡師的新品開場

提示詞

以上傳的首幀為開場畫面:圖片1中的咖啡師從吧台後轉身面向鏡頭,舉起圖片2中的新品特調,杯口熱氣升騰,他微笑著把特調推向鏡頭方向展示。開場構圖嚴格錨定首幀,隨後鏡頭緩慢推近至特調特寫。人物與產品外觀和參考圖保持一致,暖調木質咖啡館氛圍。

需在 r2v 模式上傳首幀圖 + 1-2 張參考圖;傳了首幀比例就跟隨首幀——比例選擇器失效是預期行為。

04 影片編輯

用自然語言改影片——上傳一段 2-10 秒的源影片,寫一句大白話指令:換風格、換衣服、換道具,其餘一切原樣保留。輸出時長自動跟隨源影片(沒有時長選擇器);比例有六檔可選:預設 auto 跟隨源影片,也可強制 16:9、9:16 等顯式比例。還可以附 1 張參考圖,告訴模型「換成什麼樣」。聲音控制是你的第二支筆:「保留原聲」開關決定源影片聲音的去留;設定彈窗裡另有「智慧改寫」開關(prompt_extend,預設開),短指令會被自動補全細節。

4.1 風格變換

整條片子換一身美術皮膚:黏土、水彩、像素、賽博霓虹,一句話就夠。寫清目標風格的三個特徵——筆觸、材質、色調,再補一句「鏡頭運動與節奏保持原樣」,模型就只動風格不動敘事。

把街拍變成黏土動畫

提示詞

把這段影片轉換成黏土動畫風格:手工捏製的圓潤造型、可見的指紋肌理與陶土質感、柔和的微縮景觀布光,人物與建築的輪廓以黏土塑形呈現,鏡頭運動與畫面節奏保持原樣。

需上傳 1 段 2-10 秒源影片;自動切換到 Wan 2.7 Video Edit,時長跟隨源影片,比例預設 auto 跟隨。風格特徵點名「造型+材質+布光」三件套最穩。

4.2 元素替換

不動原片地換衣服、換道具、換產品:說清把 A 換成 B,再補一句「其餘內容保持不變」。替換類編輯配 1 張參考圖外觀最準——「圖片1中的皮夾克」勝過一百個形容詞。

給人物換件皮夾克

提示詞

把影片中人物的外套替換成圖片1中的棕色皮夾克,衣物的皺褶隨動作自然變化,質感與光影方向和原畫面保持一致,其餘內容保持不變。

需上傳源影片,可附 1 張參考圖;「把 A 替換成 B + 其餘保持不變」是最穩的替換句式。

Wan 2.7 參數速查

以下是 Molyin 生成器為 Wan 2.7 家族實際開放的全部檔位。

Wan 2.7Wan 2.7 Video Edit
模式文生影片 / 圖生影片 / 參考生影片影片編輯
解析度720p / 1080p720p / 1080p
時長2–15 秒跟隨源影片
長寬比16:9 / 9:16 / 1:1 / 4:3 / 3:4跟隨源影片
音訊預設輸出音訊,無控制參數跟隨源影片
首尾幀支援不支援
參考圖數量1–5 張最多 1 張
參考影片數量最多 3 段不支援
參考音訊數量不支援不支援
返回尾幀圖不支援不支援

常見問題

八個最高頻的疑問,以及我們驗證過的答案。