指南

MiniMax H3 指南

MiniMax H3 一次生成画面与立体声——4 到 15 秒、768p 或原生 2K,原生多镜头建模、口型对齐的台词,以及能同时读入 9 张图、3 段视频、3 条音频的统一参考上下文。这份指南按真实创作任务组织:从三轨公式、分镜头时间线,到音频执导、关键帧与参考选角——每个示例都能一键装进 Molyin 生成器。

更新于 2026-08-09

01 三轨公式

多数视频模型生成的是画面,H3 生成的是一部片子——图片、环境音、配乐出自同一次生成。这改变了提示词的写法:一条好的 H3 提示词要覆盖看到什么、场景听起来是什么样、以及(可选)底下垫什么音乐。本章先立起这副骨架,再讲每个任务都绕不开的两个旋钮:分辨率与时长。

1.1 同时为眼睛和耳朵写作

从一句「主体 + 动作」起步,再按需叠加镜头、环境,以及 H3 特有的习惯——声音。因为音频与画面联合生成,你不写的部分模型会替你编。通常一句环境音加一句配乐就足以夺回控制权。自然语言直接可用;H3 还训练过一套更严格的结构化格式,第 3 章会见到它。

[主体] + [动作] + 可选 [风格] [镜头] [环境音] [配乐]

必填

主体

这条镜头拍的是谁或什么——描述越具体,结果越稳定。

必填

动作

主体在做什么,一次一个清晰的动作节拍。模糊的动词只会产出模糊的运动。

可选

风格

开头就定下整体质感:实拍电影感、2D 动画、黏土动画、老胶片。

可选

镜头

景别与运镜。H3 对明确的镜头语言响应很好——第 2 章给出完整词表。

可选

环境音

场景本身的声音:雨声、车流、油锅的滋滋声。角色听得见这一层。

可选

配乐

只有观众能听见的音乐。写乐器和节奏,不写情绪词。

深夜面摊

提示词

实拍,电影感。深夜的街边面摊在一只吊灯下发亮;摊主从翻滚的沸水里提起一笊篱面条,蒸汽涌满画面,他把面甩进等着的碗里。镜头保持中景,然后缓慢向碗推近。沸水翻滚作响,笊篱磕在锅沿上当啷一声,远处有电瓶车驶过。一段孤独的二胡旋律轻轻垫在场景下面。

一个主体、一个干净的动作、一次运镜——两层声音各自点名。这就是 H3 提示词的基准形态。

风暴中的灯塔

提示词

实拍,电影感,冷蓝灰色调。穿黄色雨衣的灯塔看守人在环廊上顶风前倾,紧抓栏杆,浪花炸起扑过他的身体;塔顶光束扫过两次。镜头以大幅度慢速向右横移,让他始终框在翻涌的海面前。风声怒吼,海浪砸在下方礁石上,雨衣被吹得啪啪作响。低沉的弦乐持续铺底,缓慢累积,悬而不决。

六个元素全部到位——风格开头,然后是主体、动作、一次明确的运镜,环境音和配乐各占一句。

1.2 分辨率与时长:768p 打样,2K 交付

两档分辨率——768p 与原生 2K——加一根 4–15 秒的连续刻度尺,接受任意整数。工作节奏:在 768p 上迭代,每秒成本只有 2K 的一小部分;构图和节奏过关后,同一条提示词换 2K 重跑出成片。动作量要和秒数匹配:每 4–5 秒一个动作节拍最稳;15 秒能装下一个三拍的微型场景。H3 全档位 24fps 输出立体声。

2K 锦鲤池

提示词

实拍,微距纪录片风格。雨后的锦鲤池:橙白相间的锦鲤在布满水珠的水面下滑行,鱼身掠过时睡莲叶微微颤动,一片枫叶在水流里缓缓打转。镜头先以慢速下摇,然后保持固定机位,三尾锦鲤向一粒漂浮的面包屑聚拢。雨声渐弱,水轻拍石岸,一尾锦鲤破水时溅起一声水花。没有音乐。

预载 15 秒 2K——水面、鳞片、枝叶这类纹理密集的主体,正是原生 2K 肉眼可见回本的地方。注意「没有音乐」本身就是一条指令:它让配乐轨保持空白。

02 多镜头时间线

H3 原生建模剪辑——你可以导一段剪好的序列,而不只是一个长镜头。约定是:以 [Shot 1] 开场,之后每个镜头都以镜头号加时间码起头,如 [Shot 2] At 00:04.000。时间码必须严格递增,且落在视频时长之内。本章讲分镜清单,以及镜头内部的运镜词表。

2.1 分镜清单:镜头号 + 时间码

把每个镜头写成独立的句块:镜头号、切换时间、然后是新镜头拍到什么。切镜要引入真正的新信息——新主体、新空间、新视点;如果只是距离变了,用运镜代替切镜。诚实地分配秒数:12 秒的视频装三个镜头很从容,五个就勉强了。

[Shot 1] 开场镜头 … [Shot N] At MM:SS.mmm, the camera cuts to …

必填

镜头号

[Shot 1] 开场不带时间码;之后每个镜头都有自己的编号。

必填

切换时间

每个后续镜头开头的 MM:SS.mmm——严格递增,始终在总时长之内。

可选

切镜措辞

"the camera cuts to" 是主力;"the shot transitions to" 等同类写法也可以。叠化、淡入淡出只在真的需要时才写。

可选

新信息

这次切镜揭示了上个镜头给不了的什么——新主体、新空间、新视点。没有新信息的切镜应该改成运镜。

三镜头的早市

提示词

实拍,电影感,温暖的晨光。[Shot 1] 大全景:有顶棚的市场正在醒来,摊贩卷起卷帘门,一箱箱橙子码成金字塔,阳光从棚顶缝隙间切进来。[Shot 2] At 00:04.000, the camera cuts to 鱼贩双手的特写:油亮的青花鱼被码上碎冰,水珠四溅。[Shot 3] At 00:08.000, the camera cuts to 一位上了年纪的顾客把橙子举到鼻尖,闭上眼,笑了。卷帘门哗啦作响,碎冰咯吱,人群的嘈杂渐渐涨起来。轻快的原声吉他以散步的节奏弹着。

12 秒三个镜头——全景交代、特写给细节、面孔给反应。场景音和配乐两句放在分镜之后,覆盖整条视频。

2.2 运镜词表:类型 × 幅度 × 速度

H3 听得懂一套精确的运镜词表——摇镜(pan)、横移(truck)、俯仰(tilt)、升降(pedestal)、推近(push in)、拉远(pull out)、变焦(zoom)、环绕(arc)、跟拍(tracking)、固定(static)、主观视角(POV)、手持晃动(shake)、滚转(roll)——每种运动还带两个可选修饰:幅度(小/大)与速度(慢/快)。把运镜写成镜头里的自然动作,不要堆在句尾当标签。中等幅度、正常速度是默认值,只在需要时才写出来。

环绕雕塑家

提示词

实拍,电影感,一个连续长镜头。洒满窗光的落尘工作室里,雕塑家正在凿一尊大理石像的面部,停下来吹掉颧骨上的石粉。镜头以大幅度慢速环绕他运动,直到环绕完成,石像的脸才第一次完整入画。凿子敲在石头上叮叮作响,石粉簌簌落下,天窗上一只鸽子咕咕叫。没有音乐。

一个镜头、一次环绕——幅度与速度写明,揭示的时机绑在运镜路径上。这么克制的调度,正是三维运镜词表的用武之地。

03 执导原生立体声

H3 每次生成都输出立体声——没有音频开关,所以真正的问题是:声轨由你来导,还是任其自生。语音与画面联合生成、口型自动对齐。本章讲三种音频手法:画内台词、画外音旁白,以及场景音与配乐的双层分离。

3.1 台词:谁说、说什么、怎么说

可靠的配方分三步:先确立说话人(年龄、嗓音特点),再给出台词原文,最后执导语气。H3 的原生记法给每个说话人一个稳定编号如 (S1),台词包在 <d>[Chinese] …</d> 里——标签标注所说的语言,内部的台词逐字保留。用引号也行,但带标签的写法最确定。台词要短:每 10 秒一到两句。要出现在画面里的文字——招牌、标签——则放进英文双引号。

旧书店的推荐

提示词

实拍,电影感,温暖的钨丝灯光。逼仄的二手书店里,店主——一位六十多岁、嗓音低沉不疾不徐的女性 (S1)——从高处书架抽出一本布面精装小说,在封面上轻敲两下,隔着柜台递过来,语气笃定而平静地说:<d>[Chinese] 人人都来找那本出名的。这本,才是他们留下的。</d> 镜头保持过肩中近景。书页沙沙,地板吱呀一声,雨点敲着店铺橱窗。没有音乐。

说话人带年龄与嗓音特征、标注 (S1)、台词包进 <d>[Chinese] …</d>、语气用「笃定而平静」执导——一条提示词集齐台词配方的全部要素。

3.2 画外音:盖在画面上的旁白

写旁白时,H3 有一个值得逐字照用的固定措辞:说话人 "says in an off-screen voiceover",后接台词——并且紧跟着声明画面中角色的嘴唇保持闭合。最后这个从句不是装饰:它就是阻止模型把旁白口型对到画面里那个人脸上的开关。

山里的信

提示词

实拍,电影感,低饱和色调。年轻人沿着之字形山径向上走,山谷里灌满雾气,他呼出的气在冷空气里清晰可见。一个苍老沙哑的男声 (S1) says in an off-screen voiceover:<d>[Chinese] 你爷爷每年秋天都走这条路。现在你知道为什么了。</d> while the hiker's lips remain completely closed. 镜头从背后以小幅度慢速跟拍,然后上摇到山脊线。风穿过枯草,登山靴碾过碎石,远处一声鹰唳。稀疏的钢琴音符,慢速,在视频结束前淡出。

画外音措辞加「嘴唇保持闭合」这一对搭配,是旁白与画内台词的分界线——丢掉后半句,登山者可能就开始对口型了。

3.3 双层分离:场景音 vs 配乐

H3 把音频分成两层来理解。场景音是角色能听见的一切——环境声、动作声、呼吸。配乐是只有观众听见的音乐——用乐器、节奏、力度变化来描述,永远不用情绪词。在 H3 的原生结构化格式里,这就是字面意义上的字段:时间线写在 integrated_multimodal_description,场景音写在 overall_soundscape,配乐写在 non_diegetic_music(静音写 N/A)。Molyin 会把你的提示词原样透传,所以完整的三字段格式可以直接粘进提示词框——下面的示例就是一条,可直接提交。

integrated_multimodal_description: [Shot 1] … ⏎ overall_soundscape: [环境音 + 动作声] ⏎ non_diegetic_music: [乐器 + 节奏 + 力度,或 N/A]

必填

环境音

场景持续的声音底床:雨声、室内底噪、车流。1–4 句覆盖整条视频。

可选

动作声

会发声的物理事件——脚步、碰撞、衣料摩擦。台词留在时间线字段里,不写在这。

可选

配乐规格

乐器、节奏、力度走向——「稀疏钢琴,慢速,弦乐渐强」。不写「有情绪的音乐」。N/A 表示无配乐。

天台雨夜,完整原生格式

提示词

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a woman standing under a corrugated awning on an apartment rooftop as evening rain falls, holding a chipped mug of tea. She watches the city lights blur below, then closes her eyes and breathes out slowly. [Shot 2] At 00:05.000, the camera cuts to a close-up of the mug: steam curls up through the rain-light, a drop from the awning strikes the rim and splashes. overall_soundscape: Steady rain drums on the corrugated awning and hisses on the streets below. The mug clinks once against her ring, and a long exhale is audible under the rain. non_diegetic_music: A muted felt-piano motif at a slow tempo, repeating with a slight swell in the second half and no resolution.

这就是完整的原生三字段格式,原样粘进提示词框即可。需要帧级精度时用它;日常任务,第 1 章的流畅写法就够。

04 图生视频

给 H3 一张首帧图,它会从这张图向前发展出场景——人物身份、服装、布局、风格全部锚定在你上传的画面上。输出比例跟随源图,所以先把静帧构图在你要发布的画幅里。再加一张尾帧,H3 会插值出两帧之间的完整旅程。

4.1 首帧:先锚定,再发展

经过验证的结构:先锚定,后运动。开头确认图片已经确立的东西——主体、位置、氛围——然后描述接下来的动作、镜头的行为和声音。不要把画面里的每个像素再描述一遍,更不要和图片唱反调;这场争论首帧已经赢了。小而具体的物理运动命中率最高。

老自行车醒了

提示词

从这一帧开始,画面活了:自行车前轮开始缓缓转动,辐条上夹着的扑克牌越打越快,车把上的彩色飘带在渐起的风里扬起来。镜头以小幅度慢速向旋转的辐条推近。扑克牌的嗒嗒声密集成一片轻响,风穿过小巷,远处一声狗吠。没有音乐。

上传一张首帧图。提示词没花一个字描述自行车——画面归图片管,运动和声音归文字管。

4.2 首帧 + 尾帧:描述那段旅程

两帧都上传后,提示词的任务反转了:跳过起点和终点——它们已经定死——只写两帧之间的路径。主体怎么运动、姿态怎么变化、构图怎么演进、两帧的差异如何逐步收拢。保持单一连续镜头让模型干净地插值;两帧差异越大,给的秒数越多。

碗成形了

提示词

转动的拉坯轮上,湿泥团在陶艺师拱起的双手下升起:拇指向中心压出凹陷,坯壁攀升外翻,泥浆顺着她的手腕流下,坯体逐渐落进成品碗的轮廓里。镜头全程保持对轮盘的固定近景。轮盘匀速嗡嗡转动,湿泥在掌下咕叽作响,水珠从她指间滴进托盘。

泥团作首帧、成品碗作尾帧——提示词只叙述形变本身。8 秒给插值留足空间;两帧差异更大就再加秒数。

05 参考选角

H3 的招牌能力:统一上下文一次读入最多 9 张图、3 段视频(每段 2–15 秒、合计不超 15 秒)、3 条音频——再用一条提示词告诉它每份素材贡献什么。素材按类型加上传顺序命名——Image 1、Video 1、Audio 1——并各自指派角色。这是选角,不是装饰:外形取自一份素材,运动取自另一份,声音取自第三份。

5.1 每份素材都点名,每个角色都指派

让多参考真正生效的规则:每份上传的素材都要点名并派活。「用 Video 1 的运镜,让 Image 1 的角色出镜」——类型加上传序号,角色直接说明。没派活的参考等于邀请模型自由发挥。图片承载身份、场景与风格;视频承载运镜、节奏与结构;音频承载音色与音乐气质。前 5 张参考图免费,从第 6 张起有少量按张附加费——提交前预估器会显示。

[Image/Video/Audio N] 提供 [角色] + 目标画面描述 + 可选 [一致性锁]

必填

点名素材

Image 1、Video 1、Audio 1——类型加上传顺序。每个类型内部独立编号。

必填

角色

每份素材贡献什么:外形、场景、运镜、节奏、音色、音乐风格。

可选

一致性锁

必须存活的特征:发型、着装、色调、光线。即使图里已经有,也要用文字再钉一遍。

风衣走秀

提示词

让 Image 1 中的女人穿过雨夜的霓虹街道向镜头走来,运镜与节奏参考 Video 1——一个缓慢的后退跟拍,让她始终居中前进。保持她的身份一致:银色短发、立起衣领的墨绿风衣、从容不迫的步伐。靴子踏碎水洼,雨点打在霓虹招牌上嘶嘶作响,一条合成器贝斯线以慢速脉动。

上传一张角色图和一段运镜参考视频。每份素材都点了名、各领一份差事,一致性锁再用文字把不许漂移的特征钉死。

5.2 角色一致,声音借用

打造常驻角色,参考图干重活,语言来上锁:在图片参考旁边把身份特征逐条写明,它们就能跨镜头存活。音频参考把这套逻辑延伸到声音——让某个说话人指向一条上传的音轨,H3 会匹配它的音色与语感,而不是复制那段录音。这就是给生成角色配上一把跨系列一致的嗓音的方法。音频参考不收附加费。

街头歌手

提示词

让 Image 1 中的街头艺人——年轻男性、蓬松卷发、白 T 恤外套牛仔夹克、一把用旧的木吉他——在黄昏的石拱门下演出。他扫了两下弦,闭上眼,以 Audio 1 的音色和松弛唱腔开口唱 (S1):<d>[Chinese] 又一天折进夜里,我还留在城这头。</d> 镜头从全景缓缓推成中近景,路人放慢脚步驻足聆听。琴弦在拱门天然的混响里嗡鸣,硬币叮当落进敞开的琴箱,暮色里的车流在远处低语。

上传一张角色图和一条人声音轨。(S1) 这个说话人映射到音频的音色——录音决定嗓音听起来什么样,<d> 里的词决定他唱什么。预载 12 秒 2K,把演出细节拉满。

MiniMax H3 参数速查表

Molyin 生成器为 MiniMax H3 实际开放的全部档位。

模式文生视频 / 图生视频 / 参考生视频
分辨率768p / 2k
时长4–15 秒
画面比例16:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:1
音频每次生成都输出立体声,无开关
首尾帧支持
参考图1–9 张
参考视频最多 3 段
参考音频最多 3 条
返回尾帧图不支持

常见问题

被问得最多的八个问题,答案都经过我们自己验证。