MiniMax H3(海螺 3)
全模态视频模型:文字、图片、视频、音频装进同一个上下文,一句话描述它们的关系,输出一部原生 2K、自带立体声、单镜最长 15 秒的成片。已在 Molyin 上线,在下方就能生成。
- 生成失败自动退积分
- 积分包永不过期
- 每个模型明码标价
- 一键取消订阅
- 2K
- 原生分辨率
- 24 fps
- 帧率
- 4–15 秒
- 时长任意取
- 立体声
- 每条都带声音
官方样片
全部来自 MiniMax 发布现场——悬停预览,点击音量图标听原生立体声。
- MiniMax H3
- Reference to video
- 15s
- 2K
图片1作为整体质感与氛围的参考,图片2作为角色外形的参考。制作一支15秒、16:9宽银幕的潮流时尚短片。保持角色设定的一致性:铂金色长发、窄框黑色复古墨镜、黑色亮面漆皮风衣、冷峻自信的时尚表情,漆皮风衣表面映出橙色的火焰反光。整体风格是快切的电影感时尚广告,融合夜间火焰场景、黑烟、橙红色火焰、VHS 故障效果、CCTV 转播中断、90年代模拟胶片颗粒、扫描线、色差、漏光、闪白转场,以及贯穿全片的轻微镜头晃动等元素。
- MiniMax H3
- Reference to video
- 15s
- 2K
制作一支16:9宽银幕的高端时尚品牌视频。整体氛围、场景与电影感质感参考图片1;包袋素材参考图片3;角色素材参考图片2;品牌片尾 logo 参考图片4。这是一支销售服装与包袋的时尚广告片。整体气质要高级、冷酷、克制,但剪辑不能显得沉闷——需要更有动感,注入强烈的时尚节奏感。避免普通叙事片或电商广告的感觉。 核心故事保持简单:沙漠公路上,一辆老式汽车旁,一位女人走到车尾,打开后备箱,取出一只黑色包袋。她与站在车旁的男人之间有一瞬短暂而安静的默契。随后,她拎着包走远。包袋与服装要自然融入角色的动作,成为其人物气质的内在部分。
- MiniMax H3
- Text to video
- 15s
- 2K
节奏更快,宏大但不拖沓。快速硬切、舰桥震动、强烈的光线闪烁、短暂黑场与曲速跳跃。文字设计类似电影预告片的宽字距字体,避免纯白,带克制的辉光与质感处理,边缘有细微高光。文字动画包括:从深空虚空中浮现、被星光扫掠照亮、字距逐渐展开、残影、微妙的辉光,以及黑场闪烁。
- MiniMax H3
- Reference to video
- 15s
- 2K
风格:一支暗黑流行 / 赛博垃圾摇滚 / 说唱风格的音乐 MV,兼具高级时装感与写实质感,散发电影杂志般的美学气息。画面高对比但不显廉价。整体参考90年代末至2000年代初的独立杂志、复印 zine、胶片扫描件、地下音乐海报与拼贴美学。视觉元素包括粗颗粒、轻微胶片抖动、半调网点、印刷毛边与扫描错位。剪辑节奏快,只用硬切,不用淡入淡出或柔和转场。文字设计的风格与质感参考所附图片。
- MiniMax H3
- Text to video
- 15s
- 2K
一支15秒、16:9横屏短视频。实拍的深夜自助洗衣房场景,融合手绘发光动画。场景是一间小型自助洗衣房,日光灯微微闪烁。店内有运转中的洗衣机、塑料洗衣篮、一条旧长凳,地上丢着一只袜子。整体空间安静,带着淡淡的怀旧感。 用手机单手手持拍摄,画面有明显晃动;白色日光灯导致曝光波动;玻璃面板上可见表面反光;镜头贴近物体时对焦略有迟滞。画面不能像商业广告那样精致考究。整体质感应像一段随手抓拍的即兴记录——仿佛深夜误入洗衣房,本能地用生猛的纪实感拍下超现实的幻象。
- MiniMax H3
- Text to video
- 15s
- 2K
生成一段15秒、16:9宽银幕的轻悬疑犯罪片开场序列。整体风格参考以下概念的视觉语言:复古日式动画片头、硬边剪影、漫画风拼贴、不对称分屏、强烈的几何色块、英文片头字幕、少量作装饰的日文片假名,以及爵士犯罪氛围。氛围为六成悬疑、四成爵士:神秘、冷峻、灵动,带都市犯罪感——既不恐怖也不沉重,更绝不是欢快的爵士 MV。开场的动态效果要像动态图形拼贴:先出现黑色线框,分屏边框快速绘出,色块与画框逐块贴入;角色剪影、道具特写与英文片头字幕随鼓点滑入、弹出或经遮罩显现。避免写实的叙事动画——要有片头序列的精致感。英文字幕必须清晰可读,允许动画效果:细线框先绘出,名字滑入框内,字母逐个出现并由移动色块揭示,最后短暂停顿。不要添加中文文字,避免乱码,确保英文人名无拼写错误。序列规则:每条英文字幕与头衔只出现一次。不要重复相同头衔,不要重复相同名字,不要给同一个人分配多个职务。转场必须多样:黑胶唱片圆形遮罩、车门竖切、角色影子作划像、红线切割、大号英文字母遮罩、分屏边框重组、硬几何色块切换,以及逐帧拼贴显现。所有转场都与鼓点同步——精准、悬疑、灵动,带漫画拼贴气质。避免柔和叠化与流体转场。BGM:创作一段原创 BGM。
一个上下文,一部成片
这是 MiniMax 官方的旗舰示例:三份素材——运镜参考视频、角色图、人声录音——加一句描述它们关系的话。MiniMax H3 把它们当作同一个上下文来读,交付一条角色开口唱歌的完整镜头。

提示词原文
参考视频1中的希区柯克式运镜,让图片2中的角色开口唱歌,人声与音频3保持一致。
MiniMax H3 是什么?
MiniMax H3 是 MiniMax H 系列的第三代模型,2026 年 7 月 31 日发布——它不只是一个视频模型,而是通用全模态生成模型:文字、图片、视频片段、音频在同一个统一上下文里被一起理解,素材之间的关系用自然语言描述即可。你可以在一句提示词里要求它:借用某段视频的运镜,让某张图里的角色出镜,唱出某段音频里的人声。
输出端同样激进。MiniMax H3 默认输出原生 2K——不是超分放大,而是基座模型的上下文内重生成,小字号文字这类细节因此得以保留。每次生成都自带原生立体声:配乐、对白、音效与画面联合生成,而非事后贴上去。再加上原生多镜头建模、精准的文字与品牌元素渲染、参考视频的动作迁移,MiniMax H3 明显是一个为商业内容而生的模型——广告、电商、产品片、UI 动效都在它的射程内。MiniMax 还宣布将开放模型权重。
在 MiniMax H3 全面开放之前,它对标的每一项能力在 Molyin 都已上线:去 AI 视频生成器试试在线模型,看看定价,或浏览完整的模型库。
MiniMax H3 vs Hailuo 02
MiniMax H3 用全新架构接替 Hailuo 02 一代,真正的变化在这里。
| 能力 | Hailuo 02 | MiniMax H3 |
|---|---|---|
| 模型设计 | 视频优先架构 | 全模态统一上下文,全新架构 |
| 分辨率 | 768P / 1080P | 默认原生 2K,另有 768P 经济档 |
| 时长 | 固定 6 秒或 10 秒 | 4-15 秒任意取 |
| 音频 | 无声输出 | 每条自带原生立体声 |
| 参考输入 | 首帧图 | 9 图 + 3 视频 + 3 音频 |
| 计费 | 按固定条数 | 按秒计费——生成多长付多长 |
规格核验于 2026-08-02。
MiniMax H3 vs Molyin 在线模型
| 模型 | 定位 | 发布时间 | 在 Molyin |
|---|---|---|---|
| MiniMax H3 | 全模态旗舰,原生 2K + 立体声 | 2026-07-31 · 已宣布开放权重 | 已上线——去上方生成 |
| Seedance 2.5 | 字节旗舰,单镜最长 30 秒 | 2026-08-07(API) | API 开放当天接入——去上方生成 |
| Wan 3.0 | 阿里 All-in-One 全能模型,单镜最长 30 秒 | 2026-08-06 | 发布当天接入——去上方生成 |
| HappyHorse | 表现力生成 + 指令式视频编辑 | 2026 年 6 月(1.1) | 已上线——去上方生成 |
| Seedance 2.0 家族 | 标准 / Fast / Mini 主力,最高 4K | 2026 年 4 月(API) | 已上线——去上方生成 |
| Kling 3.0 | 元素参考 + 原生音频,最高 4K | 2026-02-04 | 已上线——去上方生成 |
| Veo 3.1 | Google 电影感模型,自带音频 | 2025 年 10 月 | 已上线——去上方生成 |
一份订阅、一份积分——表中可用的模型全部包含。
MiniMax H3 完整规格
| 参数 | 数值 | 说明 |
|---|---|---|
| 生成模式 | 文生 / 图生 / 参考生视频 | 三种模式共用同一个统一多模态上下文,在上方生成器里随时切换。 |
| 分辨率档位 | 768P / 2K | 原生 2K——16:9 下为 2560×1440——由基座模型在上下文内重生成而非超分放大;768P 为经济档。 |
| 帧率 | 24 fps | 电影标准输出帧率。 |
| 单镜时长 | 4–15 秒 | 区间内任意整数时长、按秒计费——没有固定 6 秒 / 10 秒档位。 |
| 音频 | 原生立体声,恒开 | 配乐、对白、音效与画面联合生成;人声可跟随参考音频。 |
| 参考图 | 最多 9 张 | 每次请求前几张免费,超出部分每张少量加收——具体数字见下方 FAQ。 |
| 参考视频 | 最多 3 段 | 单段 2-15 秒、合计不超过 15 秒;参考视频秒数按输出档位价计费。 |
| 参考音频 | 最多 3 段 | 音频不能作为唯一输入——需搭配图片或视频。 |
| 积分/秒 | 18(768P)· 29(2K) | 从积分余额按秒扣费;生成失败自动退回。 |
表里所列配置均为站内已支持的配置,且和官方最新能力保持同步。
MiniMax H3 在 Molyin 的价格
与全站在线模型共用同一份积分、按秒计费。下表数字直接由计费引擎实时算出——生成失败自动退回积分。
| 模型 | 分辨率 | 积分/秒 | 5 秒视频 | 5 秒视频 + 3 秒参考视频 |
|---|---|---|---|---|
| 768p | 18 | 90 积分 | 144 积分 | |
| 2k | 29 | 145 积分 | 232 积分 |
- 例外:MiniMax H3 的参考视频秒数按全价计入计费秒数。
- MiniMax H3:前 5 张参考图免费,超出后每张加收 9 积分。
订阅档位与一次性积分包的完整对比见定价页。
用 MiniMax H3 生成,三步搞定
从想法到一部自带立体声的原生 2K 成片
选中 MiniMax H3 与模式
在文生、图生、参考生视频三种模式里挑一个。
写提示词、挂参考
像导演一样描述镜头。可选挂上图片、视频、音频素材,并说明它们的关系。
生成并导出
MiniMax H3 一次交付画面与立体声。就地预览,然后下载原片。
三轨提示词公式
MiniMax H3 一次生成画面、环境音与配乐——所以好的提示词要同时为眼睛和耳朵写作。出自我们的完整提示词指南,附 12 个可直接运行的示例。
[主体] + [动作] + 可选 [风格] [镜头] [环境音] [配乐]
主体
这条镜头拍的是谁或什么——描述越具体,结果越稳定。
动作
主体在做什么,一次一个清晰的动作节拍。模糊的动词只会产出模糊的运动。
风格
开头就定下整体质感:实拍电影感、2D 动画、黏土动画、老胶片。
镜头
景别与运镜。H3 对明确的镜头语言响应很好——第 2 章给出完整词表。
环境音
场景本身的声音:雨声、车流、油锅的滋滋声。角色听得见这一层。
配乐
只有观众能听见的音乐。写乐器和节奏,不写情绪词。
MiniMax H3 常见问题
规格、发布状态与体验方式