01 3 トラック公式
多くの動画モデルは映像を生成しますが、H3 は一本の映画を生成します——画・環境音・音楽が同じ生成パスから出てきます。だから書き方が変わります:良い H3 プロンプトは、何が見えるか、シーンはどう聞こえるか、そして(任意で)どんな音楽が流れるかをカバーします。この章でその骨格を立て、続いてどの仕事にも必要な 2 つのダイヤル——解像度と長さ——を見ていきます。
1.1 目と耳のために同時に書く
「主体 + 動作」の一文から始め、必要に応じてカメラ、環境、そして H3 特有の習慣——音——を重ねます。音声は映像と同時生成されるため、書かなかった部分はモデルが勝手に埋めてしまいます。環境音一文と音楽一文で、たいてい主導権を取り戻せます。自然な文章がそのまま使え、より厳密な構造化フォーマットも訓練されています——第 3 章で登場します。
[主体] + [動作] + 任意 [スタイル] [カメラ] [環境音] [音楽]
主体
このショットの主役は誰か・何か——描写が具体的なほど結果は安定する。
動作
主体が何をするか、1 拍ずつ明確に。曖昧な動詞は曖昧な動きしか生まない。
スタイル
冒頭で全体の質感を宣言:実写シネマティック、2D アニメ、クレイアニメ、ヴィンテージフィルム。
カメラ
ショットサイズとカメラワーク。H3 は明示的なカメラ言語によく従う——第 2 章に完全な語彙集。
環境音
シーン自体の音:雨、交通、油の弾ける音。登場人物にも聞こえる層。
音楽
観客だけに聞こえる音楽。楽器とテンポで書き、ムード語は使わない。
深夜の麺屋台
プロンプト
実写、シネマティック。深夜の路上麺屋台が一つの吊り電球の下で光る。店主が煮え立つ湯から麺の入ったザルを引き上げ、湯気がフレームに溢れ、待ち構えた丼に麺を放り込む。カメラはミディアムショットを保ち、それから丼へゆっくりプッシュイン。湯が轟々と沸き、ザルが鍋の縁に当たってガランと鳴り、遠くをスクーターが通り過ぎる。孤独な二胡の旋律がシーンの下に静かに流れる。
一つの主体、一つの明確な動作、一つのカメラワーク——そして 2 層の音をそれぞれ指名しています。これが H3 プロンプトの基本形です。
嵐の灯台
プロンプト
実写、シネマティック、冷たいブルーグレーの色調。黄色いレインコートの灯台守が回廊デッキで風に向かって身を傾け、手すりを握りしめる。飛沫が彼に炸裂し、灯台の光線が二度掃過する。カメラは大きな幅でゆっくり右へトラックし、荒れ狂う海を背に彼をフレームに収め続ける。風が咆哮し、波が下の岩に叩きつけ、レインコートがバタバタとはためく。低く持続する弦楽がゆっくり積み上がり、解決しないまま保たれる。
6 要素すべてが揃った形です——スタイルを先頭に、主体、動作、明示的なカメラワーク、環境音と音楽が一文ずつ入っています。
1.2 解像度と長さ:768p で試作、2K で仕上げ
解像度は 768p とネイティブ 2K の 2 段階、長さは 4〜15 秒の連続ダイヤルで任意の整数を受け付けます。作業のリズム:768p で反復——1 秒あたりのコストは 2K の何分の一かで済みます——構図とテンポが固まったら、同じプロンプトを 2K で再実行して完成カットにします。動作量は秒数に合わせます:4〜5 秒に 1 拍が確実、15 秒なら 3 拍のミニシーンが収まります。H3 は全段階 24fps・ステレオ音声で出力します。
2K の錦鯉の池
プロンプト
実写、マクロドキュメンタリー風。雨上がりの錦鯉の池:橙と白の錦鯉が水滴の散った水面下を滑り、魚が通るたび睡蓮の葉がかすかに震え、一枚の紅葉が流れの中でゆっくり回る。カメラはまずスローでティルトダウンし、その後固定ショットで、三匹の錦鯉が漂うパンくずへ集まってくるのを捉える。雨音がフェードアウトし、水が石を打ち、一匹が水面を割る水音がひとつ。音楽なし。
15 秒 2K でプリロード——水面・鱗・枝葉のようなテクスチャ密度の高い被写体こそ、ネイティブ 2K が目に見えて効く場所です。「音楽なし」もそれ自体が指示です:スコアトラックを空に保ちます。
02 マルチショットタイムライン
H3 はカット編集をネイティブにモデリングします——ワンカットだけでなく、編集済みのシーケンスを演出できます。約束事:[Shot 1] で開き、以降のショットはタグとタイムコードで始めます。例:[Shot 2] At 00:04.000。タイムコードは厳密に増加させ、動画の長さの内側に収めます。この章ではショットリストと、ショット内部を動かすカメラ語彙を扱います。
2.1 ショットリスト:タグ + タイムコード
各ショットを独立した文ブロックとして書きます:タグ、カット時刻、そして新しいショットに何が映るか。カットは本当に新しい情報——新しい主体、空間、視点——を導入するために使います。距離が変わるだけならカットではなくカメラワークにします。秒数の配分は現実的に:12 秒の動画に 3 ショットは余裕、5 ショットは無理があります。
[Shot 1] オープニングショット … [Shot N] At MM:SS.mmm, the camera cuts to …
ショットタグ
[Shot 1] はタイムコードなしで開幕。以降のショットはすべて番号付きタグを持つ。
カット時刻
後続ショットの冒頭に置く MM:SS.mmm——厳密に増加し、常に総尺の内側に。
カット表現
"the camera cuts to" が主力。"the shot transitions to" などの同類も使える。ディゾルブやフェードは本当に必要なときだけ。
新情報
このカットが前のショットでは見せられなかった何を明かすか——新しい主体、空間、視点。新情報のないカットはカメラワークにすべき。
3 ショットの朝市
プロンプト
実写、シネマティック、暖かい朝の光。[Shot 1] ワイドショット:屋根付き市場が目覚めていく。店主たちがシャッターを巻き上げ、オレンジの箱がピラミッドに積まれ、屋根の隙間から陽光が差し込む。[Shot 2] At 00:04.000, the camera cuts to 魚屋の両手のクローズアップ:艶やかなサバが砕氷の上に並べられ、水滴が飛び散る。[Shot 3] At 00:08.000, the camera cuts to 年配の客がオレンジを鼻先へ持ち上げ、目を閉じて微笑む。シャッターがガラガラと鳴り、氷が軋み、群衆のざわめきが徐々に膨らむ。軽やかなアコースティックギターが歩くテンポで爪弾かれる。
12 秒で 3 ショット——ワイドで状況説明、クローズアップでディテール、顔でリアクション。サウンドスケープと音楽の 2 文はショットリストの後に置き、動画全体をカバーします。
2.2 カメラ語彙:種類 × 幅 × 速度
H3 は精密なカメラ語彙を理解します——パン、トラック、ティルト、ペデスタル、プッシュイン、プルアウト、ズーム、アークショット、トラッキング、固定、POV、手持ちの揺れ、ロール——各動きには 2 つの任意修飾語が付きます:幅(小/大)と速度(遅/速)。カメラワークは文末のタグの山ではなく、ショット内の自然な動作として書きます。中程度の幅・通常速度がデフォルトで、意味があるときだけ明記します。
彫刻家を巡る
プロンプト
実写、シネマティック、連続するワンショット。窓光が溢れる埃っぽいアトリエで、彫刻家が大理石像の顔を鑿で刻み、手を止めて頬骨の石粉を吹き払う。カメラは大きな幅でゆっくり彼の周りをアークし、周回が完了して初めて像の顔が完全にフレームに入る。鑿が石を打つ音が澄んで響き、石粉がさらさらと落ち、天窓で鳩が鳴く。音楽なし。
ワンショット、一周のアーク——幅と速度を明記し、顔が見える瞬間をカメラの軌道に結びつけます。これほど意図的な演出こそ、3 次元カメラ語彙の出番です。
03 ネイティブステレオの演出
H3 は毎回の生成でステレオ音声を出力します——音声スイッチは存在しません。だから本当の問いは、サウンドトラックを自分で演出するか、成り行きに任せるかです。音声は映像と同時生成され、口の動きは自動で同期します。この章では 3 つの音声技法を扱います:画面内のセリフ、画面外のナレーション、そしてサウンドスケープと音楽の 2 層分離。
3.1 セリフ:誰が、何を、どう言うか
確実なレシピは 3 段階です:話者を確立し(年齢・声の特徴)、セリフの原文を与え、話し方を演出します。H3 のネイティブ記法は各話者に (S1) のような安定 ID を与え、セリフを <d>[Japanese] …</d> で包みます——タグは話される言語を示し、中のセリフは一字一句保持されます。引用符でも動きますが、タグ付きの形が最も確実です。セリフは短く:10 秒あたり 1〜2 文。画面に映すべき文字——看板、ラベル——は英語の二重引用符に入れます。
古書店のおすすめ
プロンプト
実写、シネマティック、暖かいタングステン光。手狭な古書店で、店主——低くゆったりした声の 60 代の女性 (S1)——が高い棚から布装丁の小説を抜き出し、表紙を二度軽く叩いて、カウンター越しに差し出しながら、静かな確信を込めて言う:<d>[Japanese] みなさん有名な方を探しに来るんです。でも残るのは、こちらなんですよ。</d> カメラは肩越しのミディアムクローズアップを保つ。ページがかさかさと鳴り、床板がきしみ、雨が店の窓を叩く。音楽なし。
話者は年齢と声の特徴で確立し、(S1) でタグ付け、セリフは <d>[Japanese] …</d> で包み、話し方は「静かな確信」で演出しています——セリフのレシピが一本のプロンプトに全部入っています。
3.2 ナレーション:映像に重なる声
ナレーションには、そのまま使う価値のある固定表現があります:話者が "says in an off-screen voiceover" と書き、セリフを続けます——その直後に、画面内の人物の唇は閉じたままだと明記します。この最後の一節は飾りではありません:ナレーションを画面の人物の口にリップシンクさせないための、まさにその装置です。
山からの手紙
プロンプト
実写、シネマティック、抑えた色調。若い男が霧の満ちた谷の上、つづら折りの山道を登っていく。冷たい空気に吐息が白く見える。年老いた男のしわがれた声 (S1) says in an off-screen voiceover:<d>[Japanese] おまえの祖父は毎年秋にこの道を歩いた。いま、その理由がわかっただろう。</d> while the hiker's lips remain completely closed. カメラは背後から小さな幅でゆっくり追い、それから尾根線へティルトアップ。風が枯れ草を渡り、登山靴が砂利を踏み、遠くで鷹が一声鳴く。まばらなピアノの音、スローテンポ、動画が終わる前にフェードアウト。
ナレーションの定型句と「唇は閉じたまま」の一節がペアで、ナレーションと画面内セリフの境界線になります——後半を落とすと、登山者が口パクを始めかねません。
3.3 2 層分離:サウンドスケープ vs 音楽
H3 は音声を 2 層で捉えます。サウンドスケープは登場人物に聞こえうるすべて——環境音、動作音、呼吸。音楽は観客だけに聞こえるものです——楽器編成、テンポ、強弱変化で記述し、ムード語は決して使いません。H3 のネイティブ構造化フォーマットでは、これらは文字通りのフィールドになります:タイムラインは integrated_multimodal_description、サウンドスケープは overall_soundscape、音楽は non_diegetic_music(無音は N/A)。Molyin はプロンプトをそのまま透過するので、完全な 3 フィールド形式をプロンプト欄に貼り付けられます——下のサンプルがその一本で、そのまま送信できます。
integrated_multimodal_description: [Shot 1] … ⏎ overall_soundscape: [環境音 + 動作音] ⏎ non_diegetic_music: [楽器 + テンポ + 強弱、または N/A]
環境音
シーンの持続的な音の土台:雨、室内のノイズ、交通。1〜4 文で動画全体をカバー。
動作音
音を立てる物理イベント——足音、衝突、布擦れ。セリフはタイムラインフィールドに残し、ここには書かない。
音楽仕様
楽器、テンポ、強弱の推移——「まばらなピアノ、スロー、弦が膨らむ」。「感情的な音楽」とは書かない。N/A は無音。
屋上の雨、完全ネイティブ形式
プロンプト
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a woman standing under a corrugated awning on an apartment rooftop as evening rain falls, holding a chipped mug of tea. She watches the city lights blur below, then closes her eyes and breathes out slowly. [Shot 2] At 00:05.000, the camera cuts to a close-up of the mug: steam curls up through the rain-light, a drop from the awning strikes the rim and splashes. overall_soundscape: Steady rain drums on the corrugated awning and hisses on the streets below. The mug clinks once against her ring, and a long exhale is audible under the rain. non_diegetic_music: A muted felt-piano motif at a slow tempo, repeating with a slight swell in the second half and no resolution.
これが完全なネイティブ 3 フィールド形式です——そのままプロンプト欄へ。フレーム精度の制御が要るときはこれを、日常タスクには第 1 章の流れる書き方で十分です。
04 画像から動画へ
H3 に最初のフレームを渡すと、まさにその画像からシーンを前へ展開します——人物の同一性、服装、レイアウト、スタイルのすべてがアップロードした画に固定されます。出力のアスペクト比は元画像に従うので、公開したい画角で静止画を構図しておきましょう。最後のフレームも加えれば、H3 が 2 枚の間の道のりを補間します。
4.1 最初のフレーム:まず固定、それから展開
実証済みの構造:先にアンカー、後に動きです。画像がすでに確立したもの——主体、位置、雰囲気——を冒頭で確認し、それから次の動作、カメラの振る舞い、音を描写します。画像のピクセルを描写し直さない、画像と矛盾しない。その議論は最初のフレームがすでに勝っています。小さく具体的な物理の動きが最も命中率が高くなります。
古い自転車が目覚める
プロンプト
このフレームから、画が動き出す:自転車の前輪がゆっくり回り始め、スポークに挟まれたトランプが次第に速くカタカタと鳴り、ハンドルの色とりどりのテープが起き上がる風になびく。カメラは小さな幅でゆっくり、回転するスポークへプッシュイン。トランプの音が細かい連打に育ち、風が路地を抜け、遠くで犬が一声吠える。音楽なし。
最初のフレーム画像を 1 枚アップロードします。プロンプトは自転車の描写に一語も使っていません——見た目は画像が、動きと音は言葉が受け持ちます。
4.2 最初 + 最後のフレーム:道のりを描く
両方のフレームをアップロードしたら、プロンプトの仕事は反転します:始点と終点は飛ばします——もう固定されています——2 枚の間の経路だけを書きます。主体はどう動き、姿勢はどう変わり、構図はどう進化し、2 枚の差はどう段階的に縮まっていくか。モデルがきれいに補間できるよう単一の連続ショットに保ち、フレーム間の視覚差が大きいほど多くの秒数を与えます。
器が形になる
プロンプト
回るろくろの上で、濡れた粘土の塊が陶芸家の包み込む両手の下で立ち上がる:親指が中心に窪みを押し込み、器壁が伸び上がって外へ開き、泥漿が手首を伝って流れ、フォルムが完成した器のシルエットへ落ち着いていく。カメラは終始、ろくろ盤への固定クローズショット。ろくろが一定の音で唸り、濡れた粘土が掌の下でぐちゅりと鳴り、指先から水滴が受け皿へ落ちる。
粘土の塊を最初のフレームに、完成した器を最後のフレームに——プロンプトは変形そのものだけを語ります。8 秒が補間に呼吸の余地を与えます。フレーム間の差が大きければさらに足します。
05 参照キャスティング
H3 の看板能力:最大 9 枚の画像、3 本の動画(各 2〜15 秒、合計 15 秒以内)、3 本の音声を 1 リクエストで読み込む統一コンテキスト——そして各素材が何を提供するかをプロンプトで伝えます。素材は種類とアップロード順で命名します——Image 1、Video 1、Audio 1——そして各自に役割を割り当てます。これはキャスティングであって飾りではありません:外見はある素材から、動きは別の素材から、声は第三の素材から。
5.1 すべての素材に名前を、すべてに役割を
マルチ参照を機能させるルール:アップロードした素材はすべて名指しし、仕事を与えます。「Video 1 のカメラワークを使い、Image 1 のキャラクターを画面に出す」——種類 + アップロード番号、役割は率直に。役割のない参照はモデルに推測を招きます。画像は同一性・シーン・スタイルを、動画はカメラワーク・リズム・構造を、音声は声質と音楽の気配を運びます。参照画像は 5 枚まで無料で、6 枚目からは 1 枚ごとの少額の追加料金がかかります——送信前に見積もりに表示されます。
[Image/Video/Audio N] が [役割] を提供 + 目標の画の描写 + 任意 [一貫性ロック]
名指しの素材
Image 1、Video 1、Audio 1——種類 + アップロード順。番号は種類ごとに独立。
役割
各素材が提供するもの:外見、シーン、カメラワーク、テンポ、声質、音楽スタイル。
一貫性ロック
生き残るべき特徴:髪型、衣装、パレット、照明。画像に写っていても、言葉でもう一度釘を打つ。
トレンチコートの歩き
プロンプト
Image 1 の女性が雨のネオン街をカメラへ向かって歩いてくる。カメラワークとテンポは Video 1 を参照——彼女を中央に保ちながらゆっくり後退するトラッキングショット。同一性を維持:銀色のショートヘア、襟を立てた深緑のトレンチコート、急がない落ち着いた歩調。ブーツが水たまりを跳ね上げ、雨がネオン看板の上でジュッと鳴り、シンセベースのラインがスローテンポで脈打つ。
キャラクター画像 1 枚とカメラ参照クリップ 1 本をアップロードします。素材はすべて名指しされ、それぞれ一つの仕事を持ち、一貫性ロックがずれてはいけない特徴を言葉で再度固定します。
5.2 一貫したキャラクター、借りてきた声
レギュラーキャラクターを作るなら、参照が重労働を、言語が施錠を担います:画像参照のそばに同一性の特徴を明記すれば、ショットをまたいで保持されます。音声参照はこの仕組みを声へ拡張します——話者をアップロードした音声トラックへ向ければ、H3 は録音をコピーせず、その声質と語り口をマッチさせます。生成キャラクターにシリーズを通して一貫した声を与える方法がこれです。音声参照にサーチャージはありません。
ストリートシンガー
プロンプト
Image 1 のストリートミュージシャン——若い男性、ゆるい巻き毛、白 T シャツにデニムジャケット、使い込んだアコースティックギター——が夕暮れの石造りのアーチの下で演奏する。彼は弦を二度かき鳴らし、目を閉じ、Audio 1 の声質とリラックスした歌い回しで歌い出す (S1):<d>[Japanese] また一日が畳まれていく、僕はまだ町のこちら側にいる。</d> カメラはワイドショットからミディアムクローズアップへゆっくりプッシュインし、通行人が足を緩めて聴き入る。ギターの弦がアーチの天然リバーブの中で鳴り、硬貨が開いたケースにチャリンと落ち、夕方の交通が遠くでざわめく。
キャラクター画像 1 枚とボーカルトラック 1 本をアップロードします。話者 (S1) が音声の声質にマッピングされます——録音が声の質感を、<d> の中の言葉が歌う内容を決めます。演奏のディテールのため 12 秒・2K でプリロードします。