MiniMax H3(Hailuo 3)
全模態影片模型:文字、圖片、影片、音訊裝進同一個上下文,一句話描述它們的關係,輸出一部原生 2K、內建立體聲、單鏡最長 15 秒的成片。已在 Molyin 上線,在下方就能生成。
- 生成失敗自動退積分
- 積分包永不過期
- 每個模型都明碼標價
- 一鍵取消訂閱
- 2K
- 原生解析度
- 24 fps
- 幀率
- 4–15 秒
- 時長任意取
- 立體聲
- 每條都帶聲音
官方樣片
全部來自 MiniMax 發布現場——懸停預覽,點擊音量圖示聽原生立體聲。
- MiniMax H3
- Reference to video
- 15s
- 2K
圖片1作為整體質感與氛圍的參考,圖片2作為角色外形的參考。製作一支 15 秒、16:9 寬銀幕的潮流時尚短片。保持角色設定的一致性:鉑金色長髮、窄框黑色復古墨鏡、黑色亮面漆皮風衣、冷峻自信的時尚表情,漆皮風衣表面映出橙色的火焰反光。整體風格是快切的電影感時尚廣告,融合夜間火焰場景、黑煙、橙紅色火焰、VHS 故障效果、CCTV 轉播中斷、90 年代類比底片顆粒、掃描線、色差、漏光、閃白轉場,以及貫穿全片的輕微鏡頭晃動等元素。
- MiniMax H3
- Reference to video
- 15s
- 2K
製作一支 16:9 寬銀幕的高端時尚品牌影片。整體氛圍、場景與電影感質感參考圖片1;包袋素材參考圖片3;角色素材參考圖片2;品牌片尾 logo 參考圖片4。這是一支銷售服裝與包袋的時尚廣告片。整體氣質要高級、冷酷、克制,但剪接不能顯得沉悶——需要更有動感,注入強烈的時尚節奏感。避免一般敘事片或電商廣告的感覺。 核心故事保持簡單:沙漠公路上,一輛老式汽車旁,一位女人走到車尾,打開後車廂,取出一只黑色包袋。她與站在車旁的男人之間有一瞬短暫而安靜的默契。隨後,她拎著包走遠。包袋與服裝要自然融入角色的動作,成為其人物氣質的內在部分。
- MiniMax H3
- Text to video
- 15s
- 2K
節奏更快,宏大但不拖沓。快速硬切、艦橋震動、強烈的光線閃爍、短暫黑場與曲速跳躍。文字設計類似電影預告片的寬字距字型,避免純白,帶克制的輝光與質感處理,邊緣有細微高光。文字動畫包括:從深空虛空中浮現、被星光掃掠照亮、字距逐漸展開、殘影、微妙的輝光,以及黑場閃爍。
- MiniMax H3
- Reference to video
- 15s
- 2K
風格:一支暗黑流行/賽博垃圾搖滾/饒舌風格的音樂 MV,兼具高級時裝感與寫實質感,散發電影雜誌般的美學氣息。畫面高對比但不顯廉價。整體參考 90 年代末至 2000 年代初的獨立雜誌、影印 zine、底片掃描件、地下音樂海報與拼貼美學。視覺元素包括粗顆粒、輕微底片抖動、半調網點、印刷毛邊與掃描錯位。剪接節奏快,只用硬切,不用淡入淡出或柔和轉場。文字設計的風格與質感參考所附圖片。
- MiniMax H3
- Text to video
- 15s
- 2K
一支 15 秒、16:9 橫式短片。實拍的深夜自助洗衣房場景,融合手繪發光動畫。場景是一間小型自助洗衣房,日光燈微微閃爍。店內有運轉中的洗衣機、塑膠洗衣籃、一條舊長凳,地上丟著一只襪子。整體空間安靜,帶著淡淡的懷舊感。 用手機單手手持拍攝,畫面有明顯晃動;白色日光燈導致曝光波動;玻璃面板上可見表面反光;鏡頭貼近物體時對焦略有遲滯。畫面不能像商業廣告那樣精緻考究。整體質感應像一段隨手抓拍的即興紀錄——彷彿深夜誤入洗衣房,本能地用生猛的紀實感拍下超現實的幻象。
- MiniMax H3
- Text to video
- 15s
- 2K
生成一段 15 秒、16:9 寬銀幕的輕懸疑犯罪片開場序列。整體風格參考以下概念的視覺語言:復古日式動畫片頭、硬邊剪影、漫畫風拼貼、不對稱分屏、強烈的幾何色塊、英文片頭字幕、少量作裝飾的日文片假名,以及爵士犯罪氛圍。氛圍為六成懸疑、四成爵士:神秘、冷峻、靈動,帶都市犯罪感——既不恐怖也不沉重,更絕不是歡快的爵士 MV。開場的動態效果要像動態圖形拼貼:先出現黑色線框,分屏邊框快速繪出,色塊與畫框逐塊貼入;角色剪影、道具特寫與英文片頭字幕隨鼓點滑入、彈出或經遮罩顯現。避免寫實的敘事動畫——要有片頭序列的精緻感。英文字幕必須清晰可讀,允許動畫效果:細線框先繪出,名字滑入框內,字母逐個出現並由移動色塊揭示,最後短暫停頓。不要新增中文文字,避免亂碼,確保英文人名無拼寫錯誤。序列規則:每條英文字幕與頭銜只出現一次。不要重複相同頭銜,不要重複相同名字,不要給同一個人分配多個職務。轉場必須多樣:黑膠唱片圓形遮罩、車門豎切、角色影子作劃像、紅線切割、大號英文字母遮罩、分屏邊框重組、硬幾何色塊切換,以及逐幀拼貼顯現。所有轉場都與鼓點同步——精準、懸疑、靈動,帶漫畫拼貼氣質。避免柔和疊化與流體轉場。BGM:創作一段原創 BGM。
一個上下文,一部成片
這是 MiniMax 官方的旗艦範例:三份素材——運鏡參考影片、角色圖、人聲錄音——加上一句描述它們關係的話。MiniMax H3 把它們當作同一個上下文來讀,交付一條角色開口唱歌的完整鏡頭。

提示詞原文
參考影片1中的希區考克式運鏡,讓圖片2中的角色開口唱歌,人聲與音訊3保持一致。
MiniMax H3 是什麼?
MiniMax H3 是 MiniMax H 系列的第三代模型,2026 年 7 月 31 日發布——它不只是一支影片模型,而是通用的全模態生成模型:文字、圖片、影片片段、音訊在同一個統一上下文裡被一起理解,素材之間的關係用自然語言描述即可。你可以在一句提示詞裡要求它:借用某段影片的運鏡,讓某張圖裡的角色出鏡,唱出某段音訊裡的人聲。
輸出端同樣激進。MiniMax H3 預設輸出原生 2K——不是超分放大,而是基座模型的上下文內重新生成,小字號文字這類細節因此得以保留。每次生成都內建原生立體聲:配樂、對白、音效與畫面聯合生成,而非事後貼上去。再加上原生多鏡頭建模、精準的文字與品牌元素渲染、參考影片的動作遷移,MiniMax H3 明顯是為商業內容而生的模型——廣告、電商、產品片、UI 動效都在它的射程內。MiniMax 還宣布將開放模型權重。
在 MiniMax H3 全面開放之前,它對標的每一項能力在 Molyin 都已上線:去 AI 影片生成器試試線上模型,看看定價,或瀏覽完整的模型庫。
MiniMax H3 vs Hailuo 02
MiniMax H3 用全新架構接替 Hailuo 02 一代,真正的變化在這裡。
| 能力 | Hailuo 02 | MiniMax H3 |
|---|---|---|
| 模型設計 | 影片優先架構 | 全模態統一上下文,全新架構 |
| 解析度 | 768P / 1080P | 預設原生 2K,另有 768P 經濟檔 |
| 時長 | 固定 6 秒或 10 秒 | 4-15 秒任意取 |
| 音訊 | 無聲輸出 | 每條內建原生立體聲 |
| 參考輸入 | 首幀圖 | 9 圖+3 影片+3 音訊 |
| 計費 | 按固定條數 | 按秒計費——生成多長付多長 |
規格核驗於 2026-08-02。
MiniMax H3 vs Molyin 線上模型
| 模型 | 定位 | 發布時間 | 在 Molyin |
|---|---|---|---|
| MiniMax H3 | 全模態旗艦,原生 2K+立體聲 | 2026-07-31 · 已宣布開放權重 | 已上線——到上方直接生成 |
| Seedance 2.5 | 字節跳動旗艦,單鏡最長 30 秒 | 2026-08-07(API) | API 開放當天接入——到上方直接生成 |
| Wan 3.0 | 阿里巴巴 All-in-One 全能模型,單鏡最長 30 秒 | 2026-08-06 | 發布當天接入——到上方直接生成 |
| HappyHorse | 表現力生成+指令式影片編輯 | 2026 年 6 月(1.1) | 已上線——到上方直接生成 |
| Seedance 2.0 家族 | 標準/Fast/Mini 主力,最高 4K | 2026 年 4 月(API) | 已上線——到上方直接生成 |
| Kling 3.0 | 元素參考+原生音訊,最高 4K | 2026-02-04 | 已上線——到上方直接生成 |
| Veo 3.1 | Google 電影感模型,內建音訊 | 2025 年 10 月 | 已上線——到上方直接生成 |
一份訂閱、一份積分——表中可用的模型全部包含。
MiniMax H3 完整規格
| 參數 | 數值 | 說明 |
|---|---|---|
| 生成模式 | 文生/圖生/參考生影片 | 三種模式共用同一個統一多模態上下文,在上方生成器裡隨時切換。 |
| 解析度檔位 | 768P / 2K | 原生 2K——16:9 下為 2560×1440——由基座模型在上下文內重新生成而非超分放大;768P 為經濟檔。 |
| 幀率 | 24 fps | 電影標準輸出幀率。 |
| 單鏡時長 | 4–15 秒 | 區間內任意整數時長、按秒計費——沒有固定 6 秒/10 秒檔位。 |
| 音訊 | 原生立體聲,恆開 | 配樂、對白、音效與畫面聯合生成;人聲可跟隨參考音訊。 |
| 參考圖 | 最多 9 張 | 每次請求前幾張免費,超出部分每張少量加收——具體數字見下方 FAQ。 |
| 參考影片 | 最多 3 段 | 單段 2-15 秒、合計不超過 15 秒;參考影片秒數按輸出檔位價計費。 |
| 參考音訊 | 最多 3 段 | 音訊不能作為唯一輸入——需搭配圖片或影片。 |
| 積分/秒 | 18(768P)· 29(2K) | 從積分餘額按秒扣費;生成失敗自動退回。 |
這裡列出的所有規格都是站內已支援的,並持續與模型最新的官方能力保持同步。
MiniMax H3 在 Molyin 的價格
與全站線上模型共用同一份積分、按秒計費。下表數字直接由計費引擎即時算出——生成失敗自動退回積分。
| 模型 | 解析度 | 積分/秒 | 5 秒影片 | 5 秒影片 + 3 秒參考 |
|---|---|---|---|---|
| 768p | 18 | 90 積分 | 144 積分 | |
| 2k | 29 | 145 積分 | 232 積分 |
- 例外:MiniMax H3 的參考影片秒數以全額每秒費率計費。
- MiniMax H3:前 5 張參考圖片免費,之後每多一張加收 9 積分。
用 MiniMax H3 生成,三步搞定
從想法到一部內建立體聲的原生 2K 成片
選好 MiniMax H3 與模式
在文生、圖生、參考生影片三種模式裡挑一個。
寫提示詞、掛參考
像導演一樣描述鏡頭。可選擇掛上圖片、影片、音訊素材,並說明它們的關係。
生成並匯出
MiniMax H3 一次交付畫面與立體聲。就地預覽,然後下載原片。
三軌提示詞公式
MiniMax H3 一次生成畫面、環境音與配樂——所以好的提示詞要同時為眼睛和耳朵寫作。出自我們的完整提示詞指南,附 12 個可直接執行的範例。
[主體] + [動作] + 可選 [風格] [鏡頭] [環境音] [配樂]
主體
這條鏡頭拍的是誰或什麼——描述越具體,結果越穩定。
動作
主體在做什麼,一次一個清晰的動作節拍。模糊的動詞只會產出模糊的運動。
風格
開頭就定下整體質感:實拍電影感、2D 動畫、黏土動畫、復古底片。
鏡頭
景別與運鏡。H3 對明確的鏡頭語言響應得很好——第 2 章給出完整詞表。
環境音
場景本身的聲音:雨聲、車流、鍋裡的滋滋油響。角色聽得見這一層。
配樂
只有觀眾聽得見的音樂。寫樂器和節奏,不要寫情緒詞。
MiniMax H3 常見問題
規格、發布狀態與體驗方式