FLUX 3:视频、图片与音频,一个多模态模型全包
Black Forest Labs 的世界模型一次同时生成画面与声音——在下方写一条提示词,FLUX 3 就交出 5–20 秒自带对白与音效的成片。
- 生成失败自动退积分
- 积分包永不过期
- 每个模型明码标价
- 一键取消订阅
- 5–20 秒
- 单条时长
- 720P / 1080P
- 分辨率
- 原生,可开关
- 音频
- 3–10 张
- 分镜关键帧
真提示词,真 FLUX 3 成片
下面每条片子都由 FLUX 3 按所示提示词原样生成——官方样片与社区作品,连声音都是生成的。点 Remix,提示词一键载入上方生成器,直接改成你的。
一张照片进,一场烟花终章出
FLUX 3 的图生视频模式能让一张静态照片动起来。这是官方示例的完整过程:一张烟花照片加一句提示词,变成一条 10 秒 1080P 的烟花终章——人群的低语与爆炸声随画面一同原生生成。

提示词
一场美国独立日烟花表演,以红、白、蓝三色烟花的绚烂终章收尾。
什么是 FLUX 3?
FLUX 3 是 Black Forest Labs——FLUX 图片家族背后的实验室——于 2026 年 7 月 23 日发布的多模态基础模型。FLUX 1 和 FLUX.2 只生成图片,FLUX 3 则在同一个架构里联合学习图片、视频与音频。它押的注很简单:一个必须渲染物体如何运动、碰撞、发声的模型,会被迫学会世界真实的运转方式——而它生成的每一种模态,都受益于这份共享的理解。
这份世界模型的底子直接体现在成片里。FLUX 3 单次生成最长 20 秒、自带原生音频——多语言对白与口型同步,音效紧扣在引发它们的物理事件上,风格从手持 DV 到黏土定格再到电影级镜头。给它三个词,它能搭出一个连贯的场景;给它分镜关键帧,它就在你的帧与帧之间执导转场。图片侧,它对复杂提示词的处理显著优于前代 FLUX,多语言文字也渲染得准确。
FLUX 3 视频今天已在 Molyin 上线——上方AI 视频生成器的视频侧直接跑它,分镜关键帧与镜头续写全部包含。图片侧仍在早期开放阶段,所以 FLUX 3 在AI 图片生成器里暂标即将上线——位置已留好,两侧共用同一套覆盖全部模型的积分体系。
FLUX 3 对比 Seedance 2.5
Molyin 最新的两款旗舰视频模型,并排看清。它们是互补而非替代:FLUX 3 赢在原生对白与关键帧执导,Seedance 2.5 赢在 30 秒长镜头与参考容量——一份积分两边通用。
| 能力 | FLUX 3 | Seedance 2.5 |
|---|---|---|
| 原生音频 | 对白 + 音效同一次生成,可开关、价格不变 | 音画联合生成,始终开启 |
| 单条时长 | 5–20 秒,区间内任意取 | 4–30 秒,区间内任意取 |
| 分辨率 | 720P / 1080P | 480P / 720P / 1080P |
| 参考输入 | 3–10 张分镜关键帧驱动镜头序列 | 最多 50 个参考素材——图片、视频与音频 |
| 镜头续写 | FLUX 3 Extend 模型——续写已有片段,5–20 秒 | Seedance 2.5 Extend 模型——从末帧接续,4–30 秒 |
| 多语言对白 | 角色开口说多种语言,口型同步 | 多语言口型同步——已演示八种语言 |
两款模型在 Molyin 都可用,共用一份积分。
FLUX 3 与 Molyin 在线模型对比
| 模型 | 定位 | 发布时间 | 在 Molyin |
|---|---|---|---|
| FLUX 3 | Black Forest Labs 世界模型——原生音频 + 分镜关键帧 | 2026-08-07(视频 API)· 已宣布开放权重 | 已上线——去上方生成 |
| Seedance 2.5 | 字节跳动旗舰——30 秒长镜头,按秒执导 | 2026-08-07(API) | 已上线——去上方生成 |
| Wan 3.0 | 阿里 All-in-One 全能模型,单镜最长 30 秒 | 2026-08-06 | 已上线——去上方生成 |
| MiniMax H3 | 全模态旗舰,原生 2K + 立体声 | 2026-07-31 · 已宣布开放权重 | 已上线——去上方生成 |
| HappyHorse | 表现力生成 + 指令式视频编辑 | 2026 年 6 月(1.1) | 已上线——去上方生成 |
| Seedance 2.0 家族 | 标准 / Fast / Mini 主力,最高 4K | 2026 年 4 月(API) | 已上线——去上方生成 |
| Kling 3.0 | 元素参考 + 原生音频,最高 4K | 2026-02-04 | 已上线——去上方生成 |
| Veo 3.1 | Google 电影感模型,自带音频 | 2025 年 10 月 | 已上线——去上方生成 |
一份订阅、一份积分——表中可用的模型全部包含。
FLUX 3 完整规格
| 参数 | 数值 | 说明 |
|---|---|---|
| 生成模式 | 文生视频 · 图生视频(首/尾帧)· 分镜关键帧 · 镜头续写 | 分镜关键帧走参考模式;镜头续写是独立模型——在视频延长模式下选 FLUX 3 Extend。 |
| 分辨率 | 720P / 1080P | 两档都带原生音频生成;每档有各自的每秒费率。 |
| 单条时长 | 5–20 秒 | 区间内任意取值——按输出秒数计费。 |
| 画幅比例 | auto · 16:9 · 9:16 · 4:3 · 3:4 · 1:1 · 21:9 · 2:1 | auto 由模型根据提示词与输入自行选择;2:1 超宽幅是 FLUX 3 在 Molyin 的独占档。 |
| 音频 | 原生——对白与音效,可开关 | 与画面同一次生成;开关音频价格不变。 |
| 语言 | 多语言对白与画面文字 | 角色开口说多种语言且口型同步,画面里的招牌与标题也保持清晰可读。 |
| 分镜关键帧 | 3–10 张 | 关键帧铺满时间线;模型在你的帧与帧之间生成运动。 |
| 镜头续写 | 1 段源片段 | FLUX 3 Extend 模型续写已有片段;新生成的画面按下方续写费率计费。 |
| Seed | 不支持 | 换措辞来探索不同结果——相同提示词每次生成也各不相同。 |
| 积分/秒 | 38(720P)· 65(1080P) | 文生、图生与分镜关键帧统一按此费率计费。 |
| 续写积分/秒 | 91(720P)· 118(1080P) | 仅对续写时新生成的画面计费——源片段本身免费。 |
表里所列配置均为站内已支持的配置,且和官方最新能力保持同步。
FLUX 3 在 Molyin 的积分价格
按秒透明计价,出自向生成器扣费的同一套计费引擎——开音频不加钱,生成失败自动退回积分。
| 模型 | 分辨率 | 积分/秒 | 5 秒视频 | 5 秒视频 + 3 秒参考视频 |
|---|---|---|---|---|
| 720p | 38 | 190 积分 | 仅支持参考图 | |
| 1080p | 65 | 325 积分 | 仅支持参考图 | |
| 720p | 91 | 455 积分 | 455 积分(源视频不计费) | |
| 1080p | 118 | 590 积分 | 590 积分(源视频不计费) |
- 视频续写模型(FLUX 3 Extend)源视频不计费——只按新生成的延长段秒数计费,单价即上表续写档。
订阅档位与一次性积分包的完整对比见定价页。
用 FLUX 3 生成,三步搞定
从一条提示词到一段带声成片
选中 FLUX 3 与模式
在文生视频、图生视频之间选择,或用参考模式做分镜关键帧;要续写片段就选 FLUX 3 Extend 模型。
把声音写进场景里
描述镜头,把对白放进引号——你写什么声音,FLUX 3 就渲染什么。参考模式挂关键帧、FLUX 3 Extend 喂源片段,来执导时间线。
生成并导出
FLUX 3 一次交付画面与声音,5 到 20 秒、720P 或 1080P。就地预览,然后下载原片。
把声音写进提示词
你描述什么音频,FLUX 3 就渲染什么——把每个声音提示紧扣在引发它的物理事件上,混音自然跟着画面走。出自我们的完整 FLUX 3 提示词指南。
[视觉事件] 伴随 [它的声音] + 可选 [环境音底]
视觉事件
画面里发出声响的动作:门砰然关上、玻璃杯轻碰、脚步溅水。
音效
钉在那个事件上的声音——具体命名,和动作写在同一句里。
环境音
背景声底:风声、人群低语、房间底噪,一句就够。
FLUX 3 常见问题
创作者最关心的 Black Forest Labs 多模态模型问题。