01 基本公式
Wan 2.7 は構造化された指示を理解します:誰が、何をするか、カメラはどう動くか、どこで、どんな調子か。この章では良いプロンプトを 5 つの再利用可能な部品に分解し、2 つの便利な道具——5 段階のアスペクト比と seed——を解説します。まず骨格を固めれば、後の章はすべてその延長です。
1.1 基本プロンプト公式
すべては一文から始まります:主体と動作が必須の 2 要素で、カメラ・環境・スタイルは必要に応じて重ねます。頭の中で先に撮影してから、公式に沿って書き出しましょう。時間は 2〜15 秒の連続ダイヤル——秒数に見合う内容だけを詰め込みます。Wan 2.7 には短いプロンプトを LLM が自動でスマートリライトしてくれる機能もありますが、構造の整った原稿は AI の推測より常に正確です。
[主体] + [動作] + 任意 [カメラ] [環境] [スタイル]
主体
画面の主人公——人物、動物、プロダクト。具体的であればあるほど良い。
動作
主体が何をするか、体の部位と速さ・強弱を明確に。ゆっくり連続した小さな動きが最も安定。
カメラ
ショットサイズとカメラワーク:クローズアップ、プッシュイン、パン。マルチショットの物語は「第1ショット[0-3秒] ロング」など絵コンテを直接記述。
環境
シーンと雰囲気:場所、時間、光、天気。
スタイル
美術調と画質:色調、質感、精細さ。
ネオンの雨夜のライダー
プロンプト
雨夜の東京の街角、黒いレザージャケットの女性ライダーが大型バイクにまたがり、ヘルメットを脱いで雨に濡れた長い髪を払う。濡れたアスファルトにネオンサインがピンクと青の影を落としている。カメラはローアングルからゆっくりプッシュインして半身のクローズアップへ、逆光の中に細かい雨粒がはっきり見える。シネマ品質、サイバーパンクの色調、豊かなディテール。
主体+動作の 2 文から始め、カメラと環境を 1 文ずつ足し、スタイル語で締める——これが合格ラインの Wan 2.7 基本プロンプトです。推奨:1080p・16:9。
1.2 5 段階のアスペクト比の選び方
Wan 2.7 は 5 段階のアスペクト比を提供します:16:9、9:16、1:1、4:3、3:4。選び方の原則は一つ——公開プラットフォームから逆算:横長動画は 16:9、モバイルの縦フィードは 9:16、正方形フィードは 1:1、ポートレートや静物は 4:3 か 3:4。比率は生成前に決めます。後から切り抜くと画質を捨てるだけです。なお画像から動画(i2v)に比率セレクターはありません——出力比率は先頭フレームに自動追従します。
角を曲がるトレンチコート
プロンプト
午後の日差しが降り注ぐ古い街並み、ベージュのロングトレンチコートのモデルが角から歩いてくる。落ち着いた足取りで、コートの裾が歩くたびに揺れ、ショーウィンドウの前で立ち止まり横を向いて微笑む。カメラはミドルショットで追いかけ、その後ゆっくりプッシュイン。暖かみのあるレトロなフィルム質感、豊かな街のディテール。
9:16 縦型を設定済み——モバイルフィードの標準キャンバスで、全身構図がちょうど画面を埋めます。
1.3 seed で再現と反復
seed は Wan 2.7 の乱数ダイヤルです:固定すれば同じプロンプトで非常に近い結果を繰り返し生成でき、言葉を 1 つ変えたときの影響が正確に分かります。seed を変えれば、同じプロンプトで全く新しいバリエーションが得られます。2 つの習慣を:気に入った結果が出たら seed を控えること、A/B 比較では seed を固定して記述だけを変えること。生成は確率的で、同じ seed でもピクセル完全一致は保証されませんが、構図と主体の安定性はランダム生成を大きく上回ります。
窓辺の折り鶴
プロンプト
朝日で温まった窓辺に立つ折り鶴。窓の隙間からそよ風が入り、鶴の翼がかすかに震え、やがて風に乗って窓辺を滑り降り、部屋の中を旋回しながら本棚へ向かう。カメラはゆっくり追従し、木の床に光と影が斑に映り、空気中に細かな塵が舞う。
seed 42 を設定済み——言葉を変え、種を変えず、微調整ごとの効果を比較できます。
1.4 BGM参照:映像を音楽に乗せる
テキストから動画の音声入力スロットの意味は「BGM」——楽曲をアップロードすると、モデルはそれをバックグラウンドミュージックとして扱い、映像のリズムや動作のキレを音楽の感情に合わせます。書き方は、プロンプトで「BGM に音声 1 を使用」と指名し、映像を音楽にどう反応させたいか(ビート合わせ、感情の高まり、雰囲気のフィット)を 1 文添えるだけ。これは「成果物には常に音声がある」とは別の話です:BGM スロットはあなたが能動的に与える音楽の方向性で、書かなくてもモデルが自動で曲を付けます。
夕暮れの海岸ドライブ
プロンプト
黄昏の海岸道路を走るレトロなオープンカー。助手席の女性が風を受けて軽く口ずさみ、髪がなびき、路傍のヤシの木が速く後ろへ流れ、海面には砕けた金のような夕日が反射する。カメラは車の側面を追いかけ、ゆっくりとフロントへ回り込む。暖かな金色の色調、フィルム質感。BGM に音声 1 を使用し、映像のリズムとカメラワークは音楽の感情に追従し、サビでカメラの旋回を加速させる。
音声入力スロットに楽曲を 1 本アップロード(t2v の音声スロットの意味は BGM)。10 秒を設定済み——音楽の感情の高まりとビート合わせに十分な余裕を。
02 画像から動画
1 枚の先頭フレーム画像と動きの説明だけで、Wan 2.7 は絵を動かします——プロンプトの重心は「画面の描写」から「動きの描写」へ移ります。画面はもうあるのですから。最初に覚えるべきルール:画像から動画の出力比率は先頭フレームに自動追従し、比率セレクターはありません——9:16 の成果物が欲しければ、9:16 の画像をアップロードしてください。
2.1 写真に命を吹き込む
画像から動画のプロンプトが書くのは 3 つだけ:何が動くか、どう動くか、カメラは動くか。絵にないものを無理に足さないこと。絵にあるものを「呼び覚ます」こと——なびく裾、流れる水面、揺れる灯りは、どれも命中率の高い小さな動きです。「元画像の質感を維持」の一文を添えれば、画風はぶれません。
漁港の黄昏
プロンプト
この写真を動かしてください:夕日が漁港を金紅色に染め、水面のきらめきがゆっくり揺れ、停泊する漁船が小波に軽く上下し、マストの旗が海風にはためき、何羽かのカモメが沖の防波堤をかすめて飛ぶ。カメラは固定のまま、終始この写真の黄昏の暖かいフィルム質感を維持する。
先頭フレーム画像を 1 枚アップロード。シーンを再描写せず動きだけを書き、「質感を維持」で画風を固定。出力比率は先頭フレームに追従します。
2.2 先頭・最終フレーム:始まりと終わりをあなたの手に
Wan 2.7 は Seedance ファミリー、Kling 3.0、Veo 3.1 と並ぶ、Molyin 内で先頭・最終フレームに対応するモデルファミリーの一つです——先頭フレームと最終フレームの 2 枚をアップロードすれば、中間の過程はモデルが自動生成します。これでプロンプトの書き方が変わります:起点と終点は書かなくていい(絵にある)ので、「A から B へどう変わるか」——変化のテンポとカメラの合わせ方だけを書きます。2 枚の比率は揃え、構図の差が大きいほど過程の描写を十分に。
墨滴が山水に滲む
プロンプト
清水に濃い墨の一滴が落ち、ゆっくりと滲み広がり、墨の筋が水の中で翻り流れ、次第に重なり合う山々の水墨山水へと姿を変え、余白には雲霧が漂う。カメラは墨の塊の中心へゆっくりプッシュインし、終始なめらかに、宣紙の質感と水墨の風合いが一貫する。
画像から動画モードで「最終フレームを追加」スイッチをオンにし、先頭フレーム+最終フレームの 2 枚(墨滴 → 山水)をアップロード。プロンプトは変化の過程だけを書き、8 秒で滲みに十分な時間を与えます。
2.3 口パク用音声:写真に声を吹き込む
画像から動画の音声入力スロットの意味は「口パク用音声」——人の声の録音をアップロードすると、写真の人物がその音声に合わせて口を開き、リップシンク・表情・頭の動きが音声のリズムに合わせて動きます。ナレーション、商品紹介、キャラクターのセリフはすべてこれ。書き方は「リップシンクを音声 1 の音声と厳密に同期」の一文を添え、あとはいつも通りカメラと雰囲気を描写するだけ。
ポッドキャストの開演
プロンプト
この写真を動かしてください:ポッドキャストのホストがマイクに向かって自然に話し、表情は生き生きと、軽い頷きとジェスチャーを伴い、リップシンクは音声 1 の音声と厳密に同期し、声の感情の変化が顔の表情の起伏を動かす。背景の本棚では暖かい光のスタンドが静かに灯り、カメラはミドルショットで固定、終始この写真のドキュメンタリー写真の質感を維持する。
人物写真 1 枚 + 人の声の録音 1 本をアップロード(i2v の音声スロットの意味は口パク用音声)。音声はクリアで雑音のない人の声がおすすめ——リップシンクの命中率が最も高くなります。
2.4 動画の延長:撮り直さず、続きを撮る
画像から動画では、2〜10 秒の動画を「続編の元フィルム」(first_clip)としてアップロードできます——モデルはその動画の結末から続きを撮影し、動作・スタイル・光が自然に引き継がれます。プロンプトには新しく追加される部分だけを書き、前説は不要です。3 つの境界を覚えておきましょう:続編元フィルムと先頭フレーム画像は排他(どちらか一つ)、最終フレームと組み合わせて結末を固定できる、ただし口パク用音声との併用は不可。時間ダイヤルが決めるのは続編後の合計時間で、料金も合計時間ベースです。
続編:[新規内容の描写] + 任意 [一貫性の要求]
新規内容
元フィルムの結末の後に何が起きるかだけを書く:新しい動作、新しいシーン、新しいカメラワーク。
一貫性
「動作のつながりは自然に、スタイルと光は元の動画を継続」の一文で継ぎ目の跳躍を防止。
スケーター少年の 2 本目のジャンプ
プロンプト
アップロードした動画の続き:スケートボードの少年が着地後そのまま前方へ滑り、カメラはローアングルで追い続け、少年は前方の階段へ加速し、ジャンプ、板を宙に返し、階段下の平地にしっかり着地、カメラに手を振ってから画面の外へ滑り去る。動作のつながりは自然でなめらかに、スタイルと光は元の動画を継続する。
続編元フィルムとして 2〜10 秒の動画を 1 本アップロード(先頭フレーム画像と排他、口パク用音声との併用不可)。合計時間 10 秒を設定済み——ダイヤルが決めるのは続編後の全長です。
03 参照から動画
言葉では伝えきれない姿や動き——キャラクター、プロダクト、決めポーズ——は参照素材に任せましょう。Wan 2.7 の参照から動画は画像と動画の混合参照に対応:画像は最大 5 枚、動画は最大 5 本、2 種合計で最大 5 点まで。アップロード順に「画像 1」「画像 2」「動画 1」とプロンプト内でそれぞれ指名(画像と動画は独立に採番)すれば、モデルは素材から外見と動きをロックし、シーンと物語はすべてあなたの言葉で決まります。音声は独立した単一の音声入力スロット(声色参照、3.3 参照)を使い、参照素材の枠を消費しません。なお r2v の時間上限は常に 10 秒——参照動画の有無に関わらず同じです。
3.1 キャラクター参照公式
参照から動画のプロンプトは 3 段構成:まず「画像 N」で素材を登場させ、新しいシーンで何が起きるかを書き、最後に「一致させる」の一文で締めます。アップロード順がそのまま採番順——最初の画像が画像 1、2 本目の動画が動画 2。同一キャラクターの多角度画像が最も効果的です。参照素材 1 点につきキャラクターは 1 人に——集合写真ではモデルが主人公を見失います。
[参照素材:画像 1…] + [シーン描写] + [主体] の特徴を一致させる
参照素材
画像または動画、画像 ≤5、動画 ≤5、合計 ≤5。「画像 N」「動画 N」でそれぞれ順に参照。
シーン描写
新しいシーンで何が起きるか:動作、環境、カメラワーク——画面はゼロから生成、すべて言葉で決定。
一貫性
「参照素材と一致させる」の一文で外見のロックを強化。
パンダ師匠の深夜食堂
プロンプト
画像 1 のジャイアントパンダが紺色のエプロンを着て、暖かい黄色い灯りの小さな厨房で鍋を振るい、湯気が立ちのぼる中、得意げに汁を一口味見して満足そうに頷く。カメラは竈の周りを半周し、横顔のクローズアップに。豊かな厨房のディテール、心温まる日常の空気。パンダの外見は参照画像と一致、3D アニメ質感。
参照画像を 1 枚以上アップロード。「画像 1」はアップしたキャラクター画像を指し、締めの「一致させる」が外見ロックの定型句です。
3.2 画像+動画の混合参照
Wan 2.7 ならではの芸当:画像は外見担当、動画は動き担当、2 種の素材を同時に使えます——「動画 1 のダンサーが画像 1 の舞台に歩み入る」、モデルがそれぞれから必要なものを取り出します。3 つのハードルールを:画像は最大 5 枚、動画は最大 5 本、2 種合計は 5 点まで。参照から動画の時間上限は常に 10 秒(参照動画の有無に関わらず同じ)。参照素材の主体キャラクターは 1 点につき 1 人に。
人形遣いの舞台挨拶
プロンプト
画像 1 の糸操り人形師が糸を手に画像 2 のレトロな劇場の舞台に上がり、スポットライトを浴びながら動画 1 のお辞儀を真似て観客に挨拶し、手にした人形を持ち上げて演目を始めると、背後で幕がゆっくりと閉まっていく。カメラは客席のミドルショットからゆっくりプッシュイン。劇場の空気は荘厳で神秘的。人物と場の外見は参照素材と一致させる。
参照画像 2 枚+参照動画 1 本(合計 3 点 ≤ 5)をアップロード。「画像 1」「画像 2」「動画 1」で役割を分担。r2v の時間上限は常に 10 秒、8 秒を設定済み。
3.3 声色参照:キャラクターにあなたの声で話させる
参照から動画の音声入力スロットの意味は「声色参照」——目標とする人の声の録音をアップロードすると、生成されるキャラクターがその声質で話します。アクセント、話し口調、感情の張りを忠実に再現。ブランド専属のナレーション、スポークス動画、複数キャラクターの対話はすべてこれ。書き方は「音声 1 の声色でセリフを言う」と指名し、セリフのテキストはプロンプトに直接書き込みます——リップシンクは発音に自動で同期します。
ブランドアンバサダーの新スローガン
プロンプト
画像 1 のブランドアンバサダーが画像 2 のミニマルなスタジオに立ち、カメラに向かい、音声 1 の声色でブランドスローガンを言う:「すべての出発を、ひとつの風景に。」声の調子は温かく、それでいて力強く、リップシンクは発音と厳密に同期し、「風景」と言う瞬間に微笑む。カメラはゆっくりと半身のクローズアップへプッシュイン。人物の外見は参照画像と一致、スタジオの柔らかな光、クリーンで上質な画面。
人物画像 + シーン画像 + 声色参照の音声 1 本をアップロード(r2v の音声スロットの意味は声色参照)。セリフはプロンプトに直接書き、声色の再現は音声に任せます。
3.4 先頭フレーム固定:オープニング構図もあなたの手に
参照から動画では、追加で「先頭フレーム画像」を 1 枚アップロードしてオープニング画面を固定できます——第 1 フレームの構図・カメラ位置・光と影をあなたが精密に制御し、第 2 フレームからモデルがプロンプトに沿って展開します。知っておくべき連鎖効果:先頭フレームを渡すと出力比率が先頭フレームに自動追従し、比率セレクターは無効になります(このとき比率パラメータは無視されます)。
バリスタの新メニュー開幕
プロンプト
アップロードした先頭フレームをオープニング画面として:画像 1 のバリスタがカウンターの奥から振り返ってカメラに向かい、画像 2 の新作スペシャルドリンクを掲げ、カップの縁から湯気が立ちのぼり、微笑みながらドリンクをカメラ方向へ差し出して見せる。オープニング構図は先頭フレームに厳密に固定し、その後カメラはゆっくりとドリンクのクローズアップへプッシュイン。人物とプロダクトの外見は参照画像と一致、暖かな木のカフェの空気。
r2v モードで先頭フレーム画像 + 参照画像 1〜2 枚をアップロード。先頭フレームを渡すと比率は先頭フレームに追従——比率セレクターの無効化は想定どおりの挙動です。
04 動画編集
自然言語で動画を編集——2〜10 秒のソース動画をアップロードし、スタイル変更・衣装替え・小道具替えの指示を一言。それ以外はすべてそのまま残ります。出力時間はソース動画に自動追従(時間セレクターなし)。比率は 6 段階から選べます:デフォルトの auto はソースに追従、16:9 や 9:16 などの明示的な比率への強制も可能です。参照画像を 1 枚添えて「何に変えるか」をモデルに教えることもできます。音声コントロールはもう一本のペン:「元の音声を保持」スイッチがソース音声の扱いを決めます。設定ダイアログにはさらに「スマートリライト」スイッチ(prompt_extend、デフォルトでオン)があり、短い指示は自動で詳細が補完されます。
4.1 スタイル変換
クリップ全体の美術の皮を替える:クレイアニメ、水彩、ピクセル、サイバーネオン——一言で十分。目指すスタイルの 3 つの特徴——筆触、材質、色調——を挙げ、「カメラの動きとテンポはそのままに」と添えれば、モデルは物語に触れず見た目だけを変えます。
街の風景をクレイアニメに
プロンプト
この動画をクレイアニメ風に変換してください:手で捏ねたような丸みのある造形、指紋の跡が見える粘土の質感、柔らかなミニチュアセットの照明、人物と建物は粘土細工のように表現し、カメラの動きと画面のテンポは元のままに。
2〜10 秒のソース動画をアップロード。Wan 2.7 Video Edit に自動切替で、時間はソースに追従、比率はデフォルト auto で追従。「造形+材質+照明」の 3 点セットが最も安定したスタイル指定です。
4.2 要素の置き換え
元のショットを変えずに服・小道具・プロダクトを入れ替える:A を B に替えると明確に述べ、「それ以外は変更しない」と添えるだけ。置き換え系の編集は参照画像があると最も正確——「画像 1 の革ジャケット」は百の形容詞に勝ります。
革ジャケットに着替える
プロンプト
動画の人物のジャケットを画像 1 の茶色の革ジャケットに置き換え、布の皺が動きに合わせて自然に変化し、質感と光の方向は元の画面と一致させ、それ以外は変更しないでください。
ソース動画をアップロード、参照画像を 1 枚添付可能。「A を B に替える+それ以外は変更しない」が最も安定した置換フレーズです。