FLUX 3 : un seul modèle multimodal pour la vidéo, l’image et l’audio
Le modèle monde de Black Forest Labs génère l’image et le son en une seule passe — écrivez un prompt ci-dessous et FLUX 3 produit 5 à 20 secondes de séquence avec dialogues et effets intégrés.
- Générations échouées remboursées automatiquement
- Les packs de crédits n’expirent jamais
- Le prix de chaque modèle est public
- Annulez à tout moment en un clic
- 5–20 s
- Durée du clip
- 720P / 1080P
- Résolution
- Natif, activable ou non
- Audio
- 3–10
- Images clés de storyboard
De vrais prompts, de vraies séquences FLUX 3
Chaque clip ci-dessous a été généré par FLUX 3 à partir du prompt exact affiché — échantillons officiels et créations de la communauté, son compris. Cliquez sur Remix pour charger n’importe quel prompt dans le générateur ci-dessus et le faire vôtre.
- FLUX 3
- Text to video
- 10s
- 1080P
Un restaurant de ramen chaleureux par une nuit pluvieuse à Tokyo : la vapeur monte du bouillon, les néons se reflètent dans les flaques devant la vitrine, le cuisinier travaille avec calme. La caméra dérive lentement le long du comptoir. Le crépitement de la pluie et les bruits feutrés de la cuisine.
- FLUX 3
- Text to video
- 20s
- 720P
une diatribe contre l’IA
- FLUX 3
- Text to video
- 20s
- 720P
Comment les pyramides ont-elles été construites ? Visualisez-le.
- FLUX 3
- Text to video
- 15s
- 720P
histoire en claymation d’un homme sans cesse écrasé par une main géante qui entre dans le décor, l’empêchant de vivre sa vie
- FLUX 3
- Text to video
- 20s
- 720P
La vie quotidienne des Aztèques
Une photo en entrée, un bouquet final en sortie
Le mode image-vers-vidéo de FLUX 3 anime une photo fixe. Voici l’exemple officiel, de bout en bout : une photo de feux d’artifice plus un prompt d’une ligne donnent un bouquet final de 10 secondes en 1080P — murmure de la foule et explosions générés nativement avec l’image.

Prompt
Un feu d’artifice du 4 Juillet se conclut par un bouquet final éclatant de feux rouges, blancs et bleus.
Qu’est-ce que FLUX 3 ?
FLUX 3 est le modèle fondateur multimodal annoncé par Black Forest Labs — le laboratoire derrière la famille d’images FLUX — le 23 juillet 2026. Là où FLUX 1 et FLUX.2 ne généraient que des images, FLUX 3 apprend images, vidéos et audio conjointement au sein d’une même architecture. Le pari est simple : un modèle qui doit rendre la manière dont les objets bougent, entrent en collision et sonnent est forcé d’apprendre comment le monde se comporte réellement — et chaque modalité qu’il génère bénéficie de cette compréhension partagée.
Cette base de modèle monde se lit directement dans les séquences. FLUX 3 génère des clips allant jusqu’à 20 secondes avec audio natif en une seule passe — des dialogues multilingues synchronisés au mouvement des lèvres, des effets sonores arrimés aux événements physiques qui les causent, des styles qui vont du caméscope tenu à la main au claymation en passant par les plans cinématographiques. Donnez-lui trois mots et il met en scène une scène cohérente ; donnez-lui des images clés de storyboard et il dirige les transitions entre vos images exactes. Côté image, il gère les prompts complexes nettement mieux que les générations FLUX précédentes et rend un texte multilingue précis.
La vidéo FLUX 3 est disponible sur Molyin dès aujourd’hui — le versant vidéo du générateur de vidéos IA ci-dessus l’exécute directement, avec images clés de storyboard et extension de clip incluses. Le versant image est encore en accès anticipé : FLUX 3 reste donc marqué « Bientôt disponible » dans le générateur d’images IA — l’emplacement est prêt, et les deux versants fonctionnent sur un même système de crédits qui couvre chaque modèle.
FLUX 3 vs Seedance 2.5
Les deux modèles vidéo phares les plus récents de Molyin, côte à côte. Ils se complètent plutôt qu’ils ne se remplacent : FLUX 3 domine sur les dialogues natifs et la direction des images clés, Seedance 2.5 sur les plans de 30 secondes et la capacité de références — un seul solde de crédits couvre les deux.
| Capacité | FLUX 3 | Seedance 2.5 |
|---|---|---|
| Audio natif | Dialogues + effets sonores en une seule passe, activables ou non au même prix | Génération audio-visuelle conjointe, toujours active |
| Durée du clip | 5–20 s, toute durée dans la plage | 4–30 s, toute durée dans la plage |
| Résolution | 720P / 1080P | 480P / 720P / 1080P |
| Entrées de référence | 3 à 10 images clés de storyboard pilotent la séquence de plans | Jusqu’à 50 éléments de référence — images, clips et audio |
| Extension de clip | Modèle FLUX 3 Extend — prolonge un clip existant, 5–20 s | Modèle Seedance 2.5 Extend — prolonge à partir de la dernière image, 4–30 s |
| Dialogues multilingues | Les personnages parlent plusieurs langues, lèvres synchronisées | Synchro labiale multilingue — huit langues démontrées |
Les deux modèles sont disponibles sur Molyin et partagent un même solde de crédits.
FLUX 3 vs les modèles disponibles sur Molyin
| Modèle | Positionnement | Date de sortie | Sur Molyin |
|---|---|---|---|
| FLUX 3 | Le modèle monde de Black Forest Labs — audio natif + images clés de storyboard | 7 août 2026 (API vidéo) · poids ouverts annoncés | Disponible — générez ci-dessus |
| Seedance 2.5 | Le fleuron de ByteDance — plans de 30 s, dirigés seconde par seconde | 7 août 2026 (API) | Disponible — générez ci-dessus |
| Wan 3.0 | Le modèle tout-en-un d’Alibaba, plans jusqu’à 30 s | 6 août 2026 | Disponible — générez ci-dessus |
| MiniMax H3 | Modèle phare omni-modal, 2K natif + stéréo | 31 juillet 2026 · poids ouverts annoncés | Disponible — générez ci-dessus |
| HappyHorse | Génération expressive + montage vidéo par instructions | Juin 2026 (1.1) | Disponible — générez ci-dessus |
| Famille Seedance 2.0 | Les chevaux de trait Standard / Fast / Mini, jusqu’à 4K | Avril 2026 (API) | Disponible — générez ci-dessus |
| Kling 3.0 | Références d’éléments + audio natif, jusqu’à 4K | 4 février 2026 | Disponible — générez ci-dessus |
| Veo 3.1 | Le modèle cinématographique de Google, avec audio | Octobre 2025 | Disponible — générez ci-dessus |
Un abonnement, un solde de crédits — chaque modèle disponible ci-dessus est inclus.
Spécifications complètes de FLUX 3
| Paramètre | Valeur | Notes |
|---|---|---|
| Modes de génération | Texte-vers-vidéo · Image-vers-vidéo (première/dernière image) · Images clés de storyboard · Extension de clip | Les images clés de storyboard passent en mode référence ; l’extension de clip est un modèle à part — choisissez FLUX 3 Extend dans le mode d’extension vidéo. |
| Résolution | 720P / 1080P | Les deux niveaux génèrent avec un audio natif ; chacun a son propre tarif à la seconde. |
| Durée du clip | 5–20 secondes | Toute durée dans la plage — facturation à la seconde de sortie. |
| Rapports d’aspect | auto · 16:9 · 9:16 · 4:3 · 3:4 · 1:1 · 21:9 · 2:1 | auto laisse le modèle choisir d’après le prompt et les entrées ; le grand écran 2:1 est un exclusif FLUX 3 sur Molyin. |
| Audio | Natif — dialogues et effets sonores, activable ou non | Généré dans la même passe que l’image ; même prix, audio activé ou non. |
| Langues | Dialogues multilingues et texte à l’écran | Les personnages parlent plusieurs langues avec une synchro labiale, et les enseignes ou titres rendus restent lisibles. |
| Images clés de storyboard | 3–10 images | Les images clés sont réparties sur la ligne de temps ; le modèle génère le mouvement entre vos images exactes. |
| Extension de clip | 1 clip source | Le modèle FLUX 3 Extend prolonge un clip existant ; les nouvelles séquences sont facturées au tarif d’extension ci-dessous. |
| Seed | Non pris en charge | Variez la formulation pour explorer d’autres résultats — des prompts identiques donnent toujours des différences entre générations. |
| Crédits par seconde | 38 (720P) · 65 (1080P) | Texte-vers-vidéo, image-vers-vidéo et images clés de storyboard sont tous facturés à ce tarif. |
| Crédits d’extension par seconde | 91 (720P) · 118 (1080P) | Ne s’applique qu’aux nouvelles séquences générées lors d’une extension — le clip source lui-même est gratuit. |
Tout ce qui est listé ici est déjà pris en charge sur le site et reste synchronisé avec les dernières capacités officielles du modèle.
Combien coûte FLUX 3 en crédits
Un tarif transparent à la seconde, issu du même moteur de facturation qui débite le générateur — l’audio ne coûte rien de plus, et les générations échouées sont remboursées automatiquement.
| Modèle | Résolution | Crédits/s | Vidéo de 5s | Vidéo de 5s + référence de 3s |
|---|---|---|---|---|
| 720p | 38 | 190 crédits | Images de référence uniquement | |
| 1080p | 65 | 325 crédits | Images de référence uniquement | |
| 720p | 91 | 455 crédits | 455 crédits (vidéo source gratuite) | |
| 1080p | 118 | 590 crédits | 590 crédits (vidéo source gratuite) |
- Les modèles de prolongement (FLUX 3 Extend) ne facturent jamais la vidéo source — seules les secondes nouvellement générées sont facturées, au tarif de prolongement indiqué ci-dessus.
Les offres d’abonnement et les packs de crédits à l’achat unique sont comparés côte à côte sur la page de tarifs.
Générer avec FLUX 3
Trois étapes d’un prompt à une séquence sonorisée
Choisissez FLUX 3 et un mode
Choisissez texte-vers-vidéo, image-vers-vidéo ou le mode référence pour les images clés de storyboard ; pour prolonger un clip, sélectionnez le modèle FLUX 3 Extend.
Écrivez la scène, son compris
Décrivez le plan et placez les dialogues entre guillemets — FLUX 3 rend l’audio que vous écrivez. Joignez des images clés en mode référence, ou confiez un clip source à FLUX 3 Extend, pour diriger la ligne de temps.
Générez et exportez
FLUX 3 livre image et son en une seule passe, de 5 à 20 secondes en 720P ou 1080P. Prévisualisez sur place, puis téléchargez le fichier original.
Écrivez le son dans vos prompts
FLUX 3 rend l’audio que vous décrivez — arrimez chaque signal sonore à l’événement physique qui le cause et le mix suit l’image. Tout droit tiré de notre guide complet des prompts FLUX 3.
[Événement visuel] avec [son] + [nappe d’ambiance] facultatif
Événement visuel
L’action à l’écran qui fait du bruit : une porte claque, un verre tinte, des pas éclaboussent.
Effet sonore
L’effet épinglé à cet événement — nommé concrètement, dans la même phrase que l’action.
Ambiance
La nappe de fond : vent, murmure de foule, son de pièce. Une phrase suffit.
FAQ FLUX 3
Ce que les créateurs demandent au sujet du modèle multimodal de Black Forest Labs.
Commencez à créer avec Molyin dès aujourd’hui
Inscrivez-vous gratuitement et transformez votre première idée en vidéo cinématique en quelques minutes.