FLUX 3:影片、圖片與音訊,一個多模態模型全包
Black Forest Labs 的世界模型一次同時生成畫面與聲音——在下方寫一條提示詞,FLUX 3 就交出 5–20 秒、自帶對白與音效的成片。
- 生成失敗自動退積分
- 積分包永不過期
- 每個模型都明碼標價
- 一鍵取消訂閱
- 5–20 秒
- 單條時長
- 720P / 1080P
- 解析度
- 原生,可開關
- 音訊
- 3–10 張
- 分鏡關鍵幀
真提示詞,真 FLUX 3 成片
下面每一條片子都由 FLUX 3 依所示提示詞原樣生成——官方樣片與社群作品,連聲音都是生成出來的。點 Remix,把提示詞一鍵載入上方生成器,改成你自己的。
一張照片進去,一場煙火終章出來
FLUX 3 的圖生影片模式能讓一張靜態照片動起來。這是官方示例的完整流程:一張煙火照片加一句提示詞,變成 10 秒 1080P 的煙火終章——人群的低語與爆炸聲隨畫面一起原生生成。

提示詞
一場美國獨立紀念日煙火秀,以紅、白、藍三色煙火的絢爛終章收尾。
什麼是 FLUX 3?
FLUX 3 是 Black Forest Labs——FLUX 圖片家族背後的實驗室——於 2026 年 7 月 23 日發表的多模態基礎模型。FLUX 1 和 FLUX.2 只生成圖片,FLUX 3 則在單一架構裡聯合學習圖片、影片與音訊。它押的注很簡單:一個必須渲染物體如何移動、碰撞、發出聲響的模型,會被逼著學會世界真實的運作方式——而它生成的每一種模態,都受惠於這份共享的理解。
這份世界模型的底子直接體現在成片裡。FLUX 3 單次生成最長 20 秒、自帶原生音訊——多語言對白與口型同步,音效緊扣在引發它們的物理事件上,風格從手持 DV 到黏土動畫再到電影級鏡頭。給它三個詞,它能排出一個連貫的場景;給它分鏡關鍵幀,它就在你的幀與幀之間執導轉場。圖片側,它處理複雜提示詞的能力明顯優於前代 FLUX,多語言文字也渲染得準確。
FLUX 3 影片今天已在 Molyin 上線——上方AI 影片生成器的影片側直接跑它,分鏡關鍵幀與鏡頭延伸全部包含。圖片側仍在早期開放階段,所以 FLUX 3 在AI 圖片生成器裡暫時標記為即將上線——位置已經留好,兩側共用同一套涵蓋全部模型的積分體系。
FLUX 3 對比 Seedance 2.5
Molyin 最新的兩款旗艦影片模型,並排看清。它們互補多於互斥:FLUX 3 強在原生對白與關鍵幀執導,Seedance 2.5 強在 30 秒長鏡頭與參考容量——一份積分兩邊通用。
| 能力 | FLUX 3 | Seedance 2.5 |
|---|---|---|
| 原生音訊 | 對白 + 音效同一次生成,可開關、價格不變 | 音畫聯合生成,始終開啟 |
| 單條時長 | 5–20 秒,區間內任意取 | 4–30 秒,區間內任意取 |
| 解析度 | 720P / 1080P | 480P / 720P |
| 參考輸入 | 3–10 張分鏡關鍵幀驅動鏡頭序列 | 最多 50 個參考素材——圖片、影片與音訊 |
| 鏡頭延伸 | FLUX 3 Extend 模型——延伸既有片段,5–20 秒 | Seedance 2.5 Extend 模型——從末幀接續,4–30 秒 |
| 多語言對白 | 角色開口說多種語言,口型同步 | 多語言口型同步——已演示八種語言 |
兩款模型在 Molyin 都可用,共用一份積分。
FLUX 3 與 Molyin 線上模型對比
| 模型 | 定位 | 發布時間 | 在 Molyin |
|---|---|---|---|
| FLUX 3 | Black Forest Labs 世界模型——原生音訊 + 分鏡關鍵幀 | 2026-08-07(影片 API)· 已宣布開放權重 | 已上線——去上方生成 |
| Seedance 2.5 | 字節跳動旗艦——30 秒長鏡頭,逐秒執導 | 2026-08-07(API) | 已上線——去上方生成 |
| Wan 3.0 | 阿里巴巴 All-in-One 全能模型,單鏡最長 30 秒 | 2026-08-06 | 已上線——去上方生成 |
| MiniMax H3 | 全模態旗艦,原生 2K + 立體聲 | 2026-07-31 · 已宣布開放權重 | 已上線——去上方生成 |
| HappyHorse | 表現力生成 + 指令式影片編輯 | 2026 年 6 月(1.1) | 已上線——去上方生成 |
| Seedance 2.0 家族 | 標準 / Fast / Mini 主力,最高 4K | 2026 年 4 月(API) | 已上線——去上方生成 |
| Kling 3.0 | 元素參考 + 原生音訊,最高 4K | 2026-02-04 | 已上線——去上方生成 |
| Veo 3.1 | Google 電影感模型,自帶音訊 | 2025 年 10 月 | 已上線——去上方生成 |
一份訂閱、一份積分——表中可用的模型全部包含。
FLUX 3 完整規格
| 參數 | 數值 | 說明 |
|---|---|---|
| 生成模式 | 文生影片 · 圖生影片(首/尾幀)· 分鏡關鍵幀 · 鏡頭延伸 | 分鏡關鍵幀走參考模式;鏡頭延伸是獨立模型——在影片延伸模式裡選 FLUX 3 Extend。 |
| 解析度 | 720P / 1080P | 兩檔都帶原生音訊生成;每檔各有自己的每秒費率。 |
| 單條時長 | 5–20 秒 | 區間內任意取值——按輸出秒數計費。 |
| 長寬比 | auto · 16:9 · 9:16 · 4:3 · 3:4 · 1:1 · 21:9 · 2:1 | auto 由模型依提示詞與輸入自行決定;2:1 寬幅是 FLUX 3 在 Molyin 的獨家比例。 |
| 音訊 | 原生——對白與音效,可開關 | 與畫面同一次生成;開關音訊價格不變。 |
| 語言 | 多語言對白與畫面文字 | 角色開口說多種語言且口型同步,畫面裡的招牌與標題也保持清晰可讀。 |
| 分鏡關鍵幀 | 3–10 張 | 關鍵幀鋪滿時間軸;模型在你的幀與幀之間生成動作。 |
| 鏡頭延伸 | 1 段源片段 | FLUX 3 Extend 模型延伸既有片段;新生成的畫面按下方延伸費率計費。 |
| 種子 | 不支援 | 換個措辭探索不同結果——相同提示詞每次生成也各不相同。 |
| 積分/秒 | 38(720P)· 65(1080P) | 文生、圖生與分鏡關鍵幀統一按此費率計費。 |
| 延伸積分/秒 | 91(720P)· 118(1080P) | 只對延伸時新生成的畫面計費——源片段本身免費。 |
這裡列出的所有規格都是站內已支援的,並持續與模型最新的官方能力保持同步。
FLUX 3 的積分價格
按秒透明計價,出自向生成器扣費的同一套計費引擎——開音訊不加錢,生成失敗自動退回積分。
| 模型 | 解析度 | 積分/秒 | 5 秒影片 | 5 秒影片 + 3 秒參考 |
|---|---|---|---|---|
| 720p | 38 | 190 積分 | 僅參考圖片 | |
| 1080p | 65 | 325 積分 | 僅參考圖片 | |
| 720p | 91 | 455 積分 | 455 積分(來源影片免費) | |
| 1080p | 118 | 590 積分 | 590 積分(來源影片免費) |
- 影片延伸模型(FLUX 3 Extend)絕不計收來源影片——只計新生成的延伸秒數,按上方所列的延伸費率計費。
用 FLUX 3 生成,三步搞定
從一條提示詞到一段帶聲成片
選 FLUX 3 與模式
在文生影片、圖生影片之間選擇,或用參考模式做分鏡關鍵幀;要延伸片段就選 FLUX 3 Extend 模型。
把聲音寫進場景裡
描述鏡頭,把對白放進引號——你寫什麼聲音,FLUX 3 就渲染什麼。參考模式掛上關鍵幀、FLUX 3 Extend 餵入源片段,就能掌握時間軸。
生成並匯出
FLUX 3 一次交付畫面與聲音,5 到 20 秒、720P 或 1080P。就地預覽,再下載原始檔。
把聲音寫進提示詞
你描述什麼音訊,FLUX 3 就渲染什麼——把每個聲音提示緊扣在引發它的物理事件上,混音自然跟著畫面走。出自我們的完整 FLUX 3 提示詞指南。
[視覺事件] 伴隨 [它的聲音] + 可選 [環境音底]
視覺事件
畫面裡發出聲響的動作:門砰然關上、玻璃杯輕碰、腳步濺水。
音效
釘在那個事件上的聲音——具體命名,和動作寫在同一句裡。
環境音
背景聲底:風聲、人群低語、房間底噪,一句就夠。
FLUX 3 常見問題
創作者最常問的 Black Forest Labs 多模態模型問題。