Guide

Guide MiniMax H3

MiniMax H3 génère l’image et le son stéréo en une seule passe — de 4 à 15 secondes en 768p ou en 2K native, avec montage multi-plans, dialogue synchronisé aux lèvres et un contexte de référence unifié qui lit ensemble jusqu’à 9 images, 3 clips vidéo et 3 pistes audio. Ce guide est organisé autour de vraies tâches créatives : de la formule à trois pistes et des timelines de plans, à la direction audio, aux images clés et au casting par références — chaque exemple se précharge dans le générateur Molyin en un clic.

Mis à jour le 2026-08-09

01 La formule à trois pistes

La plupart des modèles vidéo génèrent une image ; H3 génère un film — image, ambiance sonore et musique sortent de la même passe. Cela change la façon d’écrire : un bon prompt H3 couvre ce que l’on voit, ce que la scène donne à entendre et, en option, la musique qui passe dessous. Ce chapitre construit cette ossature, puis aborde les deux réglages dont chaque tâche a besoin : la résolution et la durée.

1.1 Écrire pour les yeux et les oreilles en même temps

Partez d’une phrase pour le sujet plus l’action, puis ajoutez la caméra, l’environnement et — l’habitude propre à H3 — le son. Comme l’audio est généré conjointement avec l’image, tout ce que vous ne spécifiez pas sera inventé pour vous. Une ligne d’ambiance et une ligne de musique suffisent généralement à reprendre la main. Le langage naturel simple fonctionne ; H3 a aussi été entraîné sur une structure plus stricte que nous verrons au chapitre 3.

[Sujet] + [Action] + [Style] [Caméra] [Ambiance] [Musique] facultatifs

Requis

Sujet

Qui ou quoi se trouve dans le plan — plus la description est concrète, plus le résultat est stable.

Requis

Action

Ce que fait le sujet, un temps clair à la fois. Des verbes vagues produisent des mouvements vagues.

Facultatif

Style

Le rendu général, annoncé d’entrée : prises de vues réelles cinématographiques, animation 2D, animation en pâte à modeler, film vintage.

Facultatif

Caméra

Taille de plan et mouvement. H3 suit bien un langage caméra explicite — le chapitre 2 donne le vocabulaire complet.

Facultatif

Ambiance

Ce que la scène elle-même fait entendre : pluie, circulation, huile qui grésille. Les personnages entendent cette couche.

Facultatif

Musique

La musique que seul le public entend. Nommez les instruments et le tempo, pas des humeurs.

L’échoppe de nouilles de nuit

Prompt

Prises de vues réelles, cinématographique. Une échoppe de nouilles de rue tard dans la nuit brille sous une unique ampoule suspendue ; le cuisinier soulève une passoire de nouilles hors de l’eau bouillante, la vapeur envahit le cadre, et il les jette dans un bol qui l’attend. La caméra garde un medium shot, puis effectue un push in lent vers le bol. L’eau bouillante gronde, la passoire claque sur le rebord de la marmite, des scooters passent au loin. Une ligne d’erhu solitaire joue doucement sous la scène.

Un sujet, une action propre, un mouvement de caméra — et les deux couches sonores nommées. C’est la forme de base du prompt H3.

Le phare dans la tempête

Prompt

Prises de vues réelles, cinématographique, palette bleu-gris froid. Un gardien de phare en ciré jaune se penche dans le vent sur le balcon de la galerie, serrant la rambarde tandis que les embruns éclatent sur lui ; le faisceau balaie deux fois. La caméra effectue un truck vers la droite, de grande amplitude, à vitesse lente, le gardant cadré devant la mer déchaînée. Le vent rugit, les vagues s’écrasent sur les rochers en contrebas, le ciré claque et flotte. Des nappes graves tenues montent lentement et restent suspendues sans se résoudre.

Les six éléments en jeu — le style d’abord, puis le sujet, l’action, un mouvement de caméra explicite, et une ligne pour l’ambiance, une pour la musique.

1.2 Résolution et durée : le 768p pour explorer, la 2K pour livrer

Deux résolutions — 768p et 2K native — et un curseur continu de 4 à 15 secondes qui accepte n’importe quel entier. Le rythme de travail : itérez en 768p, où chaque seconde coûte une fraction de la 2K, puis relancez le prompt gagnant en 2K pour le montage final. Faites correspondre la charge d’action aux secondes : un temps toutes les 4 à 5 secondes est fiable ; 15 secondes portent une micro-scène en trois temps. H3 rend en 24fps avec audio stéréo à tous les paliers.

Le bassin à koïs en 2K

Prompt

Prises de vues réelles, style documentaire macro. Un bassin à koïs après la pluie : des koïs orange et blanc glissent sous une surface piquetée de gouttes, les feuilles de nénuphar tremblent quand les poissons passent dessous, une feuille d’érable tourne lentement dans le courant. La caméra commence par un tilt vers le bas à vitesse lente, puis tient un static shot tandis que trois koïs convergent vers une miette de pain qui dérive. Une pluie fine qui s’estompe, de l’eau qui clapote sur la pierre, un unique plouf quand un koï perce la surface. Pas de musique.

Préchargé à 15 secondes en 2K — les sujets riches en texture comme l’eau, les écailles et le feuillage sont là où la 2K native paie visiblement. Notez que « Pas de musique » est en soi une direction : elle maintient la piste de musique vide.

02 Timelines multi-plans

H3 modélise les coupes nativement — dirigez une séquence montée, pas seulement une prise unique. La convention : ouvrez avec [Shot 1], puis commencez chaque plan suivant par une balise et un timecode, comme [Shot 2] At 00:04.000. Les timecodes doivent strictement augmenter et rester dans la durée de la vidéo. Ce chapitre couvre la liste de plans et le vocabulaire caméra qui se déplace à l’intérieur de chaque plan.

2.1 La liste de plans : balises + timecodes

Écrivez chaque plan comme son propre bloc de phrase : la balise, l’instant de coupe, puis ce que montre le nouveau plan. Utilisez une coupe pour introduire une information réellement nouvelle — un nouveau sujet, un nouvel espace, un nouveau point de vue ; si seule la distance change, bougez la caméra plutôt que de couper. Budgetisez les secondes honnêtement : une vidéo de 12 secondes tient confortablement trois plans, cinq c’est pousser.

[Shot 1] plan d’ouverture … [Shot N] At MM:SS.mmm, the camera cuts to …

Requis

Balise de plan

[Shot 1] ouvre la vidéo sans timecode ; chaque plan suivant reçoit sa propre balise numérotée.

Requis

Instant de coupe

MM:SS.mmm au début de chaque plan suivant — strictement croissant, toujours dans la durée totale.

Facultatif

Formule de coupe

"the camera cuts to" est le cheval de trait ; "the shot transitions to" et ses variantes fonctionnent aussi. Dissolves et fondus uniquement quand vous les voulez vraiment.

Facultatif

Nouvelle information

Ce que cette coupe révèle et que le plan précédent ne pouvait pas montrer — nouveau sujet, nouvel espace, nouveau point de vue. Une coupe sans information nouvelle devrait être un mouvement de caméra.

Le marché du matin en trois plans

Prompt

Prises de vues réelles, cinématographique, lumière matinale chaude. [Shot 1] Un wide shot d’un marché couvert qui s’éveille : les vendeurs remontent les rideaux métalliques, des caisses d’oranges empilées en pyramides, le soleil qui tranche à travers les trous du toit. [Shot 2] At 00:04.000, the camera cuts to un close-up des mains d’un poissonnier qui dispose des maquereaux luisants sur de la glace pilée, des gouttes d’eau qui giclent. [Shot 3] At 00:08.000, the camera cuts to une cliente âgée qui porte une orange à son nez, ferme les yeux et sourit. Les rideaux claquent, la glace crisse, le murmure de la foule enfle peu à peu. Un motif léger de guitare acoustique au tempo de marche.

Trois plans en 12 secondes — le wide shot pose le lieu, le close-up donne les détails, le visage réagit. L’ambiance et la musique se placent après la liste de plans et couvrent toute la vidéo.

2.2 Vocabulaire caméra : type × amplitude × vitesse

H3 comprend un vocabulaire caméra précis — pan, truck, tilt, pedestal, push in, pull out, zoom, arc, tracking, static, POV, handheld shake, roll — et chaque mouvement accepte deux modificateurs facultatifs : l’amplitude (small ou large) et la vitesse (slow ou fast). Écrivez le mouvement comme une action naturelle à l’intérieur du plan, pas comme une pile de balises à la fin. L’amplitude moyenne et la vitesse normale sont les valeurs par défaut ; ne les écrivez que lorsqu’elles comptent.

Autour du sculpteur

Prompt

Prises de vues réelles, cinématographique, un unique plan continu. Dans un atelier poussiéreux inondé de lumière de fenêtre, un sculpteur cisèle le visage d’une figure de marbre, s’arrêtant pour souffler la poudre de la pommette. La caméra fait un arc autour de lui, de grande amplitude, à vitesse lente, ne révélant le visage de la figure qu’à la fin de l’orbite. Le ciseau tinte contre la pierre, la poussière chuchote sur la surface, un pigeon roucoule sur le vitrage du toit. Pas de musique.

Un plan, une orbite — l’amplitude et la vitesse de l’arc sont écrites, et la révélation est accrochée au trajet de la caméra. Un mouvement aussi concerté, c’est exactement l’usage prévu pour le vocabulaire à trois dimensions.

03 Diriger la stéréo native

H3 sort de l’audio stéréo à chaque génération — il n’y a pas d’interrupteur audio, la vraie question est donc de savoir si vous dirigez la bande-son ou si vous la laissez au hasard. La parole est synchronisée aux lèvres du locuteur et générée avec l’image. Ce chapitre couvre les trois gestes audio : le dialogue à l’écran, la voix off, et la séparation en deux couches entre son de scène et musique.

3.1 Dialogue : qui parle, ce qu’il dit, comment

La recette fiable a trois parties : identifiez le locuteur (âge, caractère de voix), donnez la réplique exacte, et dirigez la diction. La notation native de H3 balise chaque locuteur avec un identifiant stable comme (S1) et enveloppe la réplique dans <d>[Français] …</d> — la balise nomme la langue parlée, et la réplique à l’intérieur est préservée mot pour mot. Les guillemets fonctionnent aussi, mais la forme balisée est la plus déterministe. Gardez les répliques courtes : une ou deux phrases pour 10 secondes. Tout texte qui doit apparaître à l’écran — enseignes, étiquettes — va entre guillemets doubles à la place.

La recommandation de la librairie

Prompt

Prises de vues réelles, cinématographique, lumière tungstène chaude. Dans une librairie d’occasion exiguë, la propriétaire — une femme de soixante ans passés, à la voix grave et posée (S1) — sort un roman relié d’une étagère haute, tape deux fois sur sa couverture, et le tend par-dessus le comptoir, disant avec une certitude tranquille : <d>[Français] Tout le monde demande le livre célèbre. C’est celui qu’on garde.</d> La caméra tient un medium close-up par-dessus l’épaule du client. Les pages bruissent, une lame du plancher craque, la pluie tape sur la vitrine. Pas de musique.

Locuteur établi avec âge et caractère de voix, balisé (S1), réplique enveloppée dans <d>[Français] …</d>, diction dirigée avec « une certitude tranquille » — la recette complète du dialogue dans un seul prompt.

3.2 La voix off : narration sur l’image

Pour la narration, H3 a une formule fixe qui vaut la peine d’être utilisée telle quelle : le locuteur "says in an off-screen voiceover", suivie de la réplique — et juste après, déclarez que les lèvres du personnage à l’écran restent fermées. Cette dernière clause n’est pas décorative : c’est elle qui empêche le modèle de synchroniser votre narration sur les lèvres de quiconque se trouve dans le cadre.

La lettre des montagnes

Prompt

Prises de vues réelles, cinématographique, couleurs désaturées. Un jeune homme marche sur un sentier en lacets au-dessus d’une vallée pleine de brume, son souffle visible dans l’air froid. La voix marquée d’un homme plus âgé (S1) says in an off-screen voiceover : <d>[Français] Votre grand-père a marché ce sentier chaque automne. Maintenant, vous savez pourquoi.</d> while the hiker’s lips remain completely closed. La caméra le suit par-derrière, de faible amplitude, à vitesse lente, puis effectue un tilt up vers la ligne de crête. Le vent traverse les herbes sèches, les bottes crissent sur le gravier, un rapace crie au loin. De rares notes de piano à tempo lent, qui s’estompent avant la fin de la vidéo.

La formule de voix off plus la clause « lèvres complètement fermées » forment la paire qui sépare narration et parole à l’écran — retirez la seconde moitié et le randonneur pourrait se mettre à articuler les mots.

3.3 Deux couches : son de scène contre musique

H3 pense l’audio en deux couches. Le son de scène est tout ce que les personnages pourraient entendre — ambiances, sons d’action, souffles. La musique n’est entendue que par le public — décrivez-la par l’instrumentation, le tempo et la dynamique, jamais par des mots d’humeur. Dans le format structuré natif de H3, ce sont littéralement des champs nommés : la timeline va dans integrated_multimodal_description, le son de scène dans overall_soundscape, et la musique dans non_diegetic_music (écrivez N/A pour le silence). Molyin transmet votre prompt sans le toucher, collez donc la disposition complète à trois champs dans la boîte de prompt — l’exemple ci-dessous en est une, prête à soumettre.

integrated_multimodal_description: [Shot 1] … ⏎ overall_soundscape: [ambiances + sons d’action] ⏎ non_diegetic_music: [instrumentation + tempo + dynamique, ou N/A]

Requis

Ambiance

Le fond continu de la scène : pluie, son de la pièce, circulation. De 1 à 4 phrases couvrant toute la vidéo.

Facultatif

Sons d’action

Les événements physiques qui font du bruit — pas, impacts, frottements de tissu. Le dialogue reste dans le champ timeline, pas ici.

Facultatif

Spécification de la musique

Instruments, tempo, courbe dynamique — « piano clairsemé, lent, cordes qui enflent ». Pas « musique émouvante ». N/A signifie le silence.

Pluie sur le toit, format natif complet

Prompt

integrated_multimodal_description: [Shot 1] Prise de vue réelle, cinématographique, un plan moyen cadre une femme debout sous un auvent en tôle ondulée sur le toit d’un immeuble, sous la pluie du soir, tenant une tasse de thé ébréchée. Elle regarde les lumières de la ville se brouiller en contrebas, puis ferme les yeux et expire lentement. [Shot 2] À 00:05.000, la caméra coupe sur un gros plan de la tasse : la vapeur s’élève en volutes dans la lumière pluvieuse, une goutte de l’auvent frappe le bord et éclabousse. overall_soundscape: La pluie régulière tambourine sur l’auvent en tôle ondulée et siffle dans les rues en contrebas. La tasse tinte une fois contre sa bague, et une longue expiration se fait entendre sous la pluie. non_diegetic_music: Un motif de piano feutré et assourdi à tempo lent, qui se répète avec une légère montée dans la seconde moitié et sans résolution.

C’est la disposition native complète à trois champs, collée telle quelle dans la boîte de prompt. Utilisez-la quand vous voulez un contrôle à la frame près ; pour les travaux rapides, le style fluide du chapitre 1 suffit.

04 Image vers vidéo

Donnez à H3 une première image et il développe la scène vers l’avant exactement à partir de cette image — identité, vêtements, composition et style s’ancrent tous sur ce que vous uploadez. Le format de sortie suit l’image source, donc composez votre fixe dans le cadre que vous voulez publier. Ajoutez une dernière image et H3 interpole le voyage entre les deux.

4.1 Première image : ancrer, puis développer

La structure éprouvée : ancrez d’abord, bougez ensuite. Ouvrez en confirmant ce que l’image établit — sujet, position, ambiance — puis décrivez l’action suivante, le comportement de la caméra et le son. Ne redécrivez pas chaque pixel et ne contredisez pas l’image ; la frame a déjà gagné cette discussion. Les petits mouvements physiques ont le taux de réussite le plus élevé.

Le vieux vélo s’éveille

Prompt

À partir de cette frame, la scène prend vie : la roue avant du vélo commence à tourner lentement, la carte à jouer pincée dans les rayons claque de plus en plus vite, et les rubans du guidon se soulèvent dans une brise qui monte. La caméra effectue un push in de faible amplitude à vitesse lente vers les rayons qui tournent. Le claquement de la carte devient un cliquetis doux, le vent traverse la ruelle, un chien aboie une fois au loin. Pas de musique.

Uploadez une image comme première frame. Le prompt ne dépense aucun mot à décrire le vélo — l’image possède le look ; les mots possèdent le mouvement et le son.

4.2 Première + dernière image : décrire le voyage

Avec les deux frames uploadeées, le travail du prompt s’inverse : sautez les points de départ et d’arrivée — ils sont déjà fixés — et écrivez le chemin entre les deux. Comment le sujet se déplace, ce qui change de mains, comment la composition évolue, comment les différences entre les deux frames se referment progressivement. Restez sur un seul plan continu pour que le modèle interpole proprement, et donnez plus de secondes aux écarts visuels importants.

Le bol prend forme

Prompt

Sur le tour de potier en rotation, le tas d’argile humide s’élève sous les mains en coupe de la potière : ses pouces creusent un creux au centre, les parois montent et s’évasent, et la barbotine coule le long de ses poignets tandis que la forme se stabilise dans la silhouette du bol fini. La caméra tient un close shot statique sur le plateau du tour tout du long. Le tour bourdonne régulièrement, l’argile humide fait squish sous ses paumes, l’eau dégoutte de ses doigts dans le bac.

Uploadez le tas d’argile comme première image et le bol fini comme dernière — le prompt ne raconte que la transformation. Huit secondes laissent de la place à l’interpolation ; un écart plus grand entre les frames mérite plus.

05 Le casting par références

La signature de H3 : un contexte unifié qui lit jusqu’à 9 images, 3 clips vidéo (2 à 15 s chacun, 15 secondes au total) et 3 pistes audio dans une seule requête — et un prompt qui dit ce que chaque média contribue. Nommez les médias par type et ordre d’upload — Image 1, Video 1, Audio 1 — et assignez un rôle à chacun. C’est du casting, pas de la décoration : l’apparence d’un média, le mouvement d’un autre, la voix d’un troisième.

5.1 Nommez chaque média, assignez chaque rôle

La règle qui fait fonctionner les références multiples : chaque média uploadeé est nommé et reçoit un travail. « Utilisez le mouvement de caméra de Video 1, mettez le personnage d’Image 1 à l’écran » — type plus ordre d’upload, rôle énoncé directement. Les références non assignées invitent le modèle à deviner. Les images portent l’identité, les scènes et le style ; les vidéos portent le mouvement de caméra, le rythme et la structure ; l’audio porte le timbre de voix et le caractère musical. Les 5 premières images de référence sont gratuites ; à partir de la 6e, un petit supplément par image s’applique — l’estimateur l’affiche avant la soumission.

[Image/Video/Audio N] fournit [rôle] + description de la cible + [verrou de cohérence] facultatif

Requis

Médias nommés

Image 1, Video 1, Audio 1 — type plus ordre d’upload. La numérotation repart dans chaque type.

Requis

Rôles

Ce que chaque média contribue : apparence, scène, mouvement de caméra, rythme, timbre de voix, style musical.

Facultatif

Verrou de cohérence

Les traits qui doivent survivre : cheveux, garde-robe, palette, éclairage. Écrivez-les en toutes lettres même si l’image les montre.

La marche au trench-coat

Prompt

La femme d’Image 1 marche vers la caméra dans la rue néon sous la pluie, en suivant le mouvement de caméra et le rythme de Video 1 — un tracking shot arrière lent qui la garde centrée pendant qu’elle avance. Gardez son identité cohérente : cheveux courts argentés, trench-coat vert sombre col relevé, foulée calme et posée. Les flaques éclaboussent sous ses bottes, la pluie siffle sur les enseignes néon, une ligne de basse synthétique pulse à tempo lent.

Uploadez une image de personnage et un clip de référence caméra. Chaque média est nommé, chacun a exactement un travail, et le verrou de cohérence réécrit en mots ce qui ne doit pas dériver.

5.2 Personnages cohérents, voix empruntées

Pour un personnage récurrent, la référence fait le gros du travail et le langage verrouille : nommez les traits d’identité explicitement à côté de la référence image, et ils tiennent à travers les plans. Les références audio étendent ce système à la voix — pointez un locuteur vers une piste uploadeée et H3 en matche le timbre et la diction sans copier l’enregistrement. C’est ainsi qu’on donne à un personnage généré une voix cohérente sur toute une série. Les références audio sont gratuites, sans supplément.

Le chanteur de rue

Prompt

Le musicien d’Image 1 — jeune homme, cheveux bouclés lâches, veste en jean sur un tee-shirt blanc, guitare acoustique usée — joue sous une arche de pierre au crépuscule. Il gratte deux fois les cordes, ferme les yeux, et chante (S1) avec le timbre de voix et la diction décontractée d’Audio 1 : <d>[Français] Un jour de plus se replie, et je suis toujours du même côté de la ville.</d> La caméra effectue un push in lent, d’un wide shot à un medium close-up, tandis que les passants ralentissent pour écouter. Les cordes de la guitare résonnent sous la réverbération naturelle de l’arche, des pièces tintent dans l’étui ouvert, la circulation du soir murmure au-delà.

Uploadez une image de personnage et une piste vocale. Le locuteur (S1) se mappe au timbre de l’audio — l’enregistrement dirige le son de la voix, la ligne <d> décide ce qu’elle chante. Préchargé à 12 secondes en 2K pour le détail de la performance.

Aide-mémoire des paramètres MiniMax H3

Chaque palier que le générateur Molyin expose réellement pour MiniMax H3.

ModesTexte vers vidéo / Image vers vidéo / Référence vers vidéo
Résolution768p / 2k
Durée4–15s
Format16:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:1
AudioAudio stéréo à chaque génération, sans interrupteur
Première/dernière imageOui
Images de référence1–9
Vidéos de référenceJusqu’à 3
Audio de référenceJusqu’à 3
Rendre la dernière imageNon

FAQ

Les huit questions les plus fréquentes, avec des réponses que nous avons vérifiées nous-mêmes.