指南

MiniMax H3 指南

MiniMax H3 一次生成畫面與立體聲——4 到 15 秒、768p 或原生 2K,原生多鏡頭剪接、對嘴台詞,以及能同時讀入 9 張圖、3 段影片、3 條音軌的統一參考上下文。這份指南以真實創作任務為骨架:從三軌公式、分鏡時間線,到音訊執導、關鍵幀與參考選角——每個範例都能一鍵載入 Molyin 生成器。

更新於 2026-08-09

01 三軌公式

多數影片模型生成的是畫面,H3 生成的是整支片子——畫面、環境音、配樂出自同一次生成。這改變了提示詞的寫法:一條好的 H3 提示詞,要覆蓋我們看到什麼、場景聽起來是什麼樣,以及(可選)底下墊什麼音樂。本章先立起這副骨架,再講每個任務都繞不開的兩個旋鈕:解析度與時長。

1.1 同時為眼睛和耳朵而寫

從一句「主體 + 動作」起步,再依序疊上鏡頭、環境,以及 H3 特有的習慣——聲音。因為音訊與畫面是聯合生成的,你沒寫的部分,模型會替你編。通常一句環境音加一句配樂,就足以奪回控制權。自然語言直接可用;H3 也受過一套更嚴謹的結構化格式訓練,第 3 章會見到它。

[主體] + [動作] + 可選 [風格] [鏡頭] [環境音] [配樂]

必填

主體

這條鏡頭拍的是誰或什麼——描述越具體,結果越穩定。

必填

動作

主體在做什麼,一次一個清晰的動作節拍。模糊的動詞只會產出模糊的運動。

可選

風格

開頭就定下整體質感:實拍電影感、2D 動畫、黏土動畫、復古底片。

可選

鏡頭

景別與運鏡。H3 對明確的鏡頭語言響應得很好——第 2 章給出完整詞表。

可選

環境音

場景本身的聲音:雨聲、車流、鍋裡的滋滋油響。角色聽得見這一層。

可選

配樂

只有觀眾聽得見的音樂。寫樂器和節奏,不要寫情緒詞。

深夜麵攤

提示詞

實拍,電影感。深夜的街邊麵攤在一顆吊燈下發著光;攤主從滾沸的鍋裡提起一笊籬麵條,蒸氣湧滿畫面,他把麵甩進等著的碗裡。鏡頭先保持中景,再慢慢向碗推近。沸水咕嘟作響,笊籬在鍋沿噹啷一響,遠處機車駛過。一段孤單的二胡旋律輕輕墊在場景底下。

一個主體、一個乾淨的動作、一次運鏡——兩層聲音各自點名。這就是 H3 提示詞的基準形態。

風暴中的燈塔

提示詞

實拍,電影感,冷藍灰色調。穿黃色雨衣的燈塔看守人頂著風站在環廊上,緊抓欄杆,浪花迎面炸開撲過他;塔頂光束掃過兩次。鏡頭以大幅度、慢速向右橫移,把他框在翻湧的海面前。風聲怒吼,海浪砸在下方礁石上,雨衣啪嗒甩動。低沉的弦樂持續鋪底,緩慢堆疊,始終懸而不決。

六個元素全部到位——風格開頭,然後是主體、動作、一次明確的運鏡,環境音與配樂各佔一句。

1.2 解析度與時長:768p 打樣,2K 交付

兩檔解析度——768p 與原生 2K——加上一根 4–15 秒的連續刻度,接受任意整數。工作節奏:在 768p 上疊代,每秒成本只有 2K 的一小部分;構圖和節奏過關後,同一條提示詞換 2K 重跑出成片。動作量要跟秒數匹配:每 4–5 秒一個動作節拍最穩;15 秒能裝下一個三拍的微型場景。H3 全檔位都是 24fps 立體聲。

2K 錦鯉池

提示詞

實拍,微距紀錄片風格。雨後的錦鯉池:橙白相間的錦鯉在綴滿水珠的水面下滑行,魚游過時荷葉輕輕顫動,一片楓葉在水流裡慢慢打轉。鏡頭先以慢速下搖,然後固定機位,三尾錦鯉向一片漂浮的麵包屑聚攏。雨聲輕輕淡出,水拍石岸,一尾錦鯉破水濺起一聲水花。沒有音樂。

預載 15 秒、2K——水面、鱗片、枝葉這類紋理密集的主體,正是原生 2K 最有感的地方。注意「沒有音樂」本身就是一條指令:它讓配樂軌保持空白。

02 多鏡頭時間線

H3 原生建模剪接——你能執導一支剪好的序列,而不只是一個長鏡頭。慣例是:以 [Shot 1] 開場,之後每個鏡頭都以標籤加時間碼起頭,例如 [Shot 2] At 00:04.000。時間碼必須嚴格遞增,而且落在影片總時長之內。本章講分鏡清單,以及每個鏡頭內部的運鏡詞表。

2.1 分鏡清單:標籤 + 時間碼

把每個鏡頭寫成獨立的句塊:標籤、切換時間、然後是新鏡頭拍到什麼。用切鏡引入真正的新資訊——新主體、新空間、新視角;如果只是距離變了,就用運鏡代替切鏡。老實分配秒數:12 秒的影片裝三個鏡頭很從容,五個就勉強了。

[Shot 1] 開場鏡頭 … [Shot N] At MM:SS.mmm, the camera cuts to …

必填

鏡頭標籤

[Shot 1] 開場鏡頭不帶時間碼;之後每個鏡頭都有自己的編號。

必填

切換時間

每個後續鏡頭開頭的 MM:SS.mmm——嚴格遞增,始終在總時長之內。

可選

切鏡措辭

「the camera cuts to」是主力;「the shot transitions to」這類寫法也行。疊化、淡入淡出,只在真的需要時才寫。

可選

新資訊

這次切鏡揭露了上個鏡頭給不了的什麼——新主體、新空間、新視角。沒有新資訊的切鏡,應該改成運鏡。

三鏡頭的早市

提示詞

實拍,電影感,溫暖的晨光。[Shot 1] 大全景:有頂棚的市場正在醒來,攤販捲起鐵捲門,一箱箱柳橙堆成金字塔,陽光從屋頂的縫隙間切進來。[Shot 2] At 00:04.000, the camera cuts to 魚販雙手的特寫:油亮的鯖魚被碼上碎冰,水珠四濺。[Shot 3] At 00:08.000, the camera cuts to 一位上了年紀的顧客把柳橙舉到鼻尖,閉上眼,笑了。鐵捲門嘩啦作響,碎冰咯吱,人群的嗡嗡聲逐漸漲起。輕快的木吉他節奏,散步般的速度。

12 秒三個鏡頭——全景交代、特寫給細節、面孔給反應。場景音與配樂兩句放在分鏡之後,覆蓋整支影片。

2.2 運鏡詞表:類型 × 幅度 × 速度

H3 聽得懂一套精確的運鏡詞表——搖鏡(pan)、橫移(truck)、俯仰(tilt)、升降(pedestal)、推近(push in)、拉遠(pull out)、變焦(zoom)、環繞(arc)、跟拍(tracking)、固定(static)、主觀視角(POV)、手持晃動(handheld shake)、滾轉(roll)——每種動作還帶兩個可選修飾:幅度(小/大)與速度(慢/快)。把運鏡寫成鏡頭裡的自然動作,不要堆在句尾當標籤。中等幅度、正常速度是預設值,只有在關鍵時才寫出來。

環繞雕塑家

提示詞

實拍,電影感,一個連續長鏡頭。塵土飛揚、灑滿窗光的工作室裡,雕塑家正在鑿一尊大理石像的面部,停下來吹掉顴骨上的石粉。鏡頭以大幅度、慢速繞著他環繞,直到整圈走完,石像的臉才第一次完整入畫。鑿子敲在石頭上叮叮作響,石粉從表面簌簌落下,天窗上一隻鴿子咕咕叫。沒有音樂。

一個鏡頭、一次環繞——幅度與速度都寫明,揭示的時機綁在運鏡路徑上。這麼刻意的調度,正是三維運鏡詞表的用武之地。

03 執導原生立體聲

H3 每次生成都輸出立體聲——沒有音訊開關,所以真正的問題是:聲軌由你來導,還是任它自生。語音與畫面聯合生成,嘴型自動和說話人對齊。本章講三種音訊手法:畫內台詞、畫外音旁白,以及場景音與配樂的雙層分離。

3.1 台詞:誰說、說什麼、怎麼說

可靠的配方分三步:先確立說話人(年齡、嗓音特質),再給出台詞原文,最後執導語氣。H3 的原生記法給每個說話人一個穩定編號,例如 (S1),台詞包在 <d>[Chinese] …</d> 裡——標籤註明所說的語言,內部的台詞逐字保留。用引號也可以,但帶標籤的寫法最穩定。台詞要短:每 10 秒一到兩句。要出現在畫面裡的文字——招牌、標籤——則放進雙引號裡。

舊書店的推薦

提示詞

實拍,電影感,溫暖的鎢絲燈光。逼仄的二手書店裡,店主——一位六十多歲、嗓音低沉不疾不徐的女性 (S1)——從高處書架抽出一本布面精裝小說,在封面上輕敲兩下,隔著櫃台遞過去,語氣篤定而平靜地說:<d>[Chinese] 人人都來找那本出名的。這本,才是他們留下的。</d> 鏡頭保持過肩的中近景。書頁沙沙響,地板吱呀一聲,雨點敲著店鋪櫥窗。沒有音樂。

說話人帶年齡與嗓音特質、標註 (S1)、台詞包進 <d>[Chinese] …</d>、語氣用「篤定而平靜」執導——一條提示詞集齊台詞配方的全部要素。

3.2 畫外音:蓋在畫面之上的旁白

寫旁白時,H3 有一個值得逐字照用的固定措辭:說話人「says in an off-screen voiceover」,後接台詞——緊接著再聲明畫面中角色的嘴唇保持閉合。最後這個子句不是裝飾:正是它阻止模型把旁白對嘴到畫面裡那個人身上。

山裡的信

提示詞

實拍,電影感,低飽和色調。年輕人沿著之字形山徑向上走,山谷裡灌滿濃霧,呼出的白氣在冷空氣裡清晰可見。一個歷經風霜的男性嗓音 (S1) says in an off-screen voiceover:<d>[Chinese] 你爺爺每年秋天都走這條路。現在你知道為什麼了。</d> while the hiker's lips remain completely closed。鏡頭從背後以小幅度、慢速跟拍,然後上搖到山脊線。風穿過枯草,靴子碾過碎石,遠處一聲鷹唳。稀疏的鋼琴音符,慢速,在影片結束前淡出。

畫外音固定措辭加上「嘴唇保持閉合」這個子句,是旁白與畫內台詞的分界線——少了後半句,登山者可能就會開始對嘴。

3.3 雙層分離:場景音 vs 配樂

H3 把音訊分成兩層來理解。場景音是角色可能聽見的一切——環境聲、動作聲、呼吸聲。配樂是只有觀眾聽得見的音樂——用樂器、節奏與力度來描述,永遠不用情緒詞。在 H3 的原生結構化格式裡,這就是字面上的欄位:時間線寫在 integrated_multimodal_description,場景音寫在 overall_soundscape,配樂寫在 non_diegetic_music(靜音寫 N/A)。Molyin 會把你的提示詞原樣傳遞,所以三欄位的完整格式可以直接貼進提示詞框——下面的範例就是一條,可以直接送出。

integrated_multimodal_description: [Shot 1] … ⏎ overall_soundscape: [環境音 + 動作聲] ⏎ non_diegetic_music: [樂器 + 節奏 + 力度,或 N/A]

必填

環境音

場景持續的聲音底床:雨聲、室內底噪、車流。1–4 句覆蓋整支影片。

可選

動作聲

會發出聲音的物理事件——腳步、碰撞、布料摩擦。台詞留在時間線欄位裡,不寫在這裡。

可選

配樂規格

樂器、節奏、力度走向——「稀疏鋼琴,慢速,弦樂漸強」。不是「有情緒的音樂」。N/A 表示無配樂。

屋頂雨夜,完整原生格式

提示詞

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a woman standing under a corrugated awning on an apartment rooftop as evening rain falls, holding a chipped mug of tea. She watches the city lights blur below, then closes her eyes and breathes out slowly. [Shot 2] At 00:05.000, the camera cuts to a close-up of the mug: steam curls up through the rain-light, a drop from the awning strikes the rim and splashes. overall_soundscape: Steady rain drums on the corrugated awning and hisses on the streets below. The mug clinks once against her ring, and a long exhale is audible under the rain. non_diegetic_music: A muted felt-piano motif at a slow tempo, repeating with a slight swell in the second half and no resolution.

這就是完整的原生三欄位格式,原樣貼進提示詞框即可。需要幀級控制時用它;日常快速任務,第 1 章的流暢寫法就夠了。

04 圖生影片

給 H3 一張首幀圖,它會從那張圖往前發展出整個場景——人物身分、服裝、佈局、風格,全部錨定在你上傳的畫面上。輸出比例跟隨源圖,所以先把靜幀構圖在你打算發佈的畫幅裡。再加一張尾幀,H3 會插值出兩幀之間的完整旅程。

4.1 首幀:先錨定,再發展

經過驗證的結構:先錨定,後運動。開頭先確認圖片已經確立的東西——主體、位置、氛圍——然後描述接下來的動作、鏡頭的行為和聲音。不要把每個像素再描述一遍,也不要跟圖片唱反調;這場爭論,首幀已經贏了。小而具體的物理動作命中率最高。

老腳踏車醒了

提示詞

從這一幀開始,畫面活了:腳踏車的前輪開始慢慢轉動,夾在輻條上的撲克牌越轉越快,車把上的彩帶在漸起的風裡揚起來。鏡頭以小幅度、慢速向轉動的輻條推近。撲克牌的嗒嗒聲密集成一陣輕響,風穿過巷子,遠處一聲狗吠。沒有音樂。

上傳一張首幀圖。提示詞沒有花任何字描述腳踏車——畫面歸圖片管,運動與聲音歸文字管。

4.2 首幀 + 尾幀:描述那段旅程

兩幀都上傳後,提示詞的任務反轉:跳過起點與終點——它們已經定死——只寫兩幀之間的路徑。主體怎麼運動、姿態怎麼變化、構圖怎麼演進、兩幀的差異如何逐步收攏?保持單一連續鏡頭,模型才能乾淨地插值;視覺差距越大,給的秒數越多。

碗成形了

提示詞

轉動的拉坯輪上,濕黏土團在陶藝師拱起的雙手下升起:拇指往中心壓出凹槽,坯壁攀升、向外展開,泥漿順著她的手腕流下,坯體逐漸落進成品碗的輪廓。鏡頭全程對住輪盤,保持固定近景。輪盤穩定地嗡嗡轉動,濕黏土在掌心下咕啾作響,水珠從她指間滴進托盤。

用泥團當首幀、成品碗當尾幀——提示詞只敘述轉變本身。8 秒給插值留足空間;兩幀差距更大就再加秒數。

05 參考選角

H3 的招牌能力:統一上下文,一次請求讀入最多 9 張圖、3 段影片片段(每段 2–15 秒、合計不超過 15 秒)和 3 條音軌——再用一條提示詞告訴它每份素材貢獻什麼。素材按類型加上傳順序命名——Image 1、Video 1、Audio 1——並各自指派角色。這是選角,不是裝飾:外形取自一份素材,運動取自另一份,聲音取自第三份。

5.1 每份素材都點名,每個角色都指派

讓多參考真正有效的規則:每份上傳的素材都要點名、派活。「用 Video 1 的運鏡,讓 Image 1 的角色出鏡」——類型加上傳順序,角色直接說明。沒派活的參考,等於邀請模型自由發揮。圖片承載身分、場景與風格;影片承載運鏡、節奏與結構;音訊承載音色與音樂質感。前 5 張參考圖免費;從第 6 張起,每張有一筆小額附加費——送出前預估器會先顯示。

[Image/Video/Audio N] 提供 [角色] + 目標畫面描述 + 可選 [一致性鎖]

必填

點名素材

Image 1、Video 1、Audio 1——類型加上傳順序。每個類型內部獨立編號。

必填

角色

每份素材貢獻什麼:外形、場景、運鏡、節奏、音色、音樂風格。

可選

一致性鎖

必須存活的特徵:髮型、服裝、色調、光線。即使圖片裡已經有,也要用文字再釘一遍。

風衣走秀

提示詞

讓 Image 1 裡的女人穿過雨夜的霓虹街道朝鏡頭走來,運鏡與節奏跟隨 Video 1——一個緩慢的倒退跟拍,讓她前進時始終居中。保持她的身分一致:銀色短髮、立起衣領的墨綠色風衣、從容不迫的步伐。靴子踩碎水窪,雨打在霓虹招牌上嘶嘶作響,合成器貝斯線以慢速脈動。

上傳一張角色圖和一段運鏡參考片段。每份素材都點名、各領一份差事,一致性鎖再用文字把不許漂移的特徵釘死。

5.2 角色一致,聲音借用

要打造常駐角色,參考圖幹重活,語言來上鎖:在圖片參考旁把身分特徵逐條寫明,它們就能跨鏡頭存活。音訊參考把這套邏輯延伸到聲音——讓某個說話人指向一條上傳的音軌,H3 會匹配它的音色與語感,而不是複製那段錄音。這就是給生成角色一把跨系列一致嗓音的方法。音訊參考不收附加費。

街頭歌手

提示詞

讓 Image 1 裡的街頭藝人——年輕男性、蓬鬆捲髮、白 T 恤外搭牛仔外套、一把彈舊了的木吉他——在黃昏的石拱門下演出。他刷了兩下弦,閉上眼,用 Audio 1 的音色和鬆弛的唱腔開口唱 (S1):<d>[Chinese] 又一天落幕了,我還留在城的這一頭。</d> 鏡頭從全景慢慢推成中近景,路人放慢腳步停下來聽。琴弦在拱門的天然殘響中嗡鳴,硬幣叮噹落入敞開的琴盒,暮色裡遠方車流低語。

上傳一張角色圖和一條人聲音軌。(S1) 說話人映射到音軌的音色——錄音決定嗓音聽起來如何,<d> 裡的台詞決定他唱什麼。預載 12 秒、2K,把演出細節拉滿。

MiniMax H3 參數速查表

Molyin 生成器為 MiniMax H3 實際開放的完整檔位。

模式文生影片 / 圖生影片 / 參考生影片
解析度768p / 2k
時長4–15 秒
長寬比16:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:1
音訊每次生成都輸出立體聲,無開關
首尾幀支援
參考圖1–9 張
參考影片最多 3 段
參考音訊最多 3 條
返回尾幀圖不支援

常見問題

最常被問的八個問題,答案都是我們親自驗證過的。