FLUX 3: Ein multimodales Modell für Video, Bild & Audio
Das Weltmodell von Black Forest Labs erzeugt Bild und Ton in einem einzigen Durchgang — schreib unten einen Prompt, und FLUX 3 rendert 5–20 Sekunden Filmmaterial mit eingebautem Dialog und Effekten.
- Fehlgeschlagene Generierungen werden automatisch erstattet
- Credit-Pakete laufen nie ab
- Der Preis jedes Modells ist öffentlich
- Jederzeit mit einem Klick kündbar
- 5–20 s
- Clip-Länge
- 720P / 1080P
- Auflösung
- Nativ, ein-/ausschaltbar
- Audio
- 3–10
- Storyboard-Keyframes
Echte Prompts, echtes FLUX-3-Filmmaterial
Jeder Clip unten wurde von FLUX 3 aus dem exakt gezeigten Prompt generiert — offizielle Beispiele und Community-Arbeiten, inklusive Ton. Tippe auf Remix, um einen beliebigen Prompt in den Generator oben zu laden und ihn zu deinem eigenen zu machen.
- FLUX 3
- Text to video
- 10s
- 1080P
Ein gemütliches Ramen-Lokal an einem regnerischen Tokioter Abend: Dampf steigt aus der Brühe auf, Neonlichter spiegeln sich in den Pfützen vor dem Fenster, der Koch arbeitet ruhig. Die Kamera gleitet langsam am Tresen vorbei. Regenprasseln und leise Küchengeräusche.
- FLUX 3
- Text to video
- 20s
- 720P
schimpft über KI
- FLUX 3
- Text to video
- 20s
- 720P
Wie wurden die Pyramiden gebaut? Visualisiere es.
- FLUX 3
- Text to video
- 15s
- 720P
Claymation-Geschichte über einen Mann, der immer wieder von einer riesigen Hand plattgemacht wird, die ins Bild kommt, sodass er sein Leben nicht normal leben kann
- FLUX 3
- Text to video
- 20s
- 720P
Alltag der Azteken
Ein Foto rein, ein Feuerwerksfinale raus
Der Bild-zu-Video-Modus von FLUX 3 animiert ein einzelnes Standbild zu Bewegung. Hier ist das offizielle Beispiel von Anfang bis Ende: Ein Feuerwerksfoto plus ein einzeiliger Prompt wird zu einem 10-sekündigen 1080P-Finale — Gemurmel der Menge und Explosionen werden nativ zusammen mit dem Bild generiert.

Prompt
Ein Feuerwerk zum 4. Juli endet mit einem blendenden Finale aus roten, weißen und blauen Feuerwerkskörpern.
Was ist FLUX 3?
FLUX 3 ist das multimodale Foundation-Modell, das Black Forest Labs — das Labor hinter der FLUX-Bildfamilie — am 23. Juli 2026 vorgestellt hat. Während FLUX 1 und FLUX.2 Bilder generierten, lernt FLUX 3 gemeinsam aus Bildern, Videos und Audio innerhalb einer einzigen Architektur. Die Idee dahinter ist einfach: Ein Modell, das darstellen muss, wie sich Objekte bewegen, kollidieren und klingen, wird gezwungen zu lernen, wie sich die Welt tatsächlich verhält — und jede Modalität, die es generiert, profitiert von diesem gemeinsamen Verständnis.
Diese Weltmodell-Grundlage zeigt sich im Filmmaterial. FLUX 3 generiert Clips von bis zu 20 Sekunden Länge mit nativem Audio in einem einzigen Durchgang — Dialoge in mehreren Sprachen, synchron zur Lippenbewegung, Soundeffekte, die an die physikalischen Ereignisse gebunden sind, die sie auslösen, Stile von Handkamera-Aufnahmen bis zu Claymation und Kinoaufnahmen. Gib ihm drei Worte, und es inszeniert eine stimmige Szene; gib ihm Storyboard-Keyframes, und es führt Regie bei den Übergängen zwischen deinen exakten Frames. Auf der Bildseite verarbeitet es komplexe Prompts deutlich besser als frühere FLUX-Generationen und rendert präzisen mehrsprachigen Text.
FLUX 3 Video ist ab heute live auf Molyin — die Videoseite des KI-Video-Generators oben führt es direkt aus, inklusive Storyboard-Keyframes und Clip-Verlängerung. Die Bildseite steckt noch im Early Access, daher ist FLUX 3 im KI-Bildgenerator weiterhin als „Coming soon“ markiert — der Platz ist bereit, und beide Seiten laufen über ein gemeinsames Credit-System, das jedes Modell abdeckt.
FLUX 3 vs. Seedance 2.5
Die beiden neuesten Flaggschiff-Videomodelle auf Molyin im direkten Vergleich. Sie ergänzen einander, statt sich zu ersetzen: FLUX 3 führt bei nativem Dialog und Keyframe-Regie, Seedance 2.5 bei 30-Sekunden-Aufnahmen und Referenzkapazität — ein Credit-Guthaben deckt beide ab.
| Fähigkeit | FLUX 3 | Seedance 2.5 |
|---|---|---|
| Natives Audio | Dialog + Soundeffekte im selben Durchgang, zum gleichen Preis ein-/ausschaltbar | Gemeinsame Audio-Visuell-Generierung, immer aktiv |
| Clip-Länge | 5–20 s, jede Länge im Bereich | 4–30 s, jede Länge im Bereich |
| Auflösung | 720P / 1080P | 480P / 720P |
| Referenzeingaben | 3–10 Storyboard-Keyframes steuern die Aufnahmesequenz | Bis zu 50 Referenz-Assets — Bilder, Clips und Audio |
| Clip-Verlängerung | FLUX 3 Extend-Modell — setzt einen bestehenden Clip fort, 5–20 s | Seedance 2.5 Extend-Modell — setzt ab dem letzten Frame fort, 4–30 s |
| Mehrsprachiger Dialog | Charaktere sprechen mehrere Sprachen, lippensynchron | Mehrsprachige Lippensynchronisation — acht Sprachen demonstriert |
Beide Modelle sind auf Molyin verfügbar und teilen sich ein Guthaben.
FLUX 3 im Vergleich mit den auf Molyin verfügbaren Modellen
| Modell | Positionierung | Veröffentlichungsdatum | Auf Molyin |
|---|---|---|---|
| FLUX 3 | Das Weltmodell von Black Forest Labs — natives Audio + Storyboard-Keyframes | 7. Aug. 2026 (Video-API) · offene Gewichte angekündigt | Live — oben generieren |
| Seedance 2.5 | ByteDance-Flaggschiff — 30-s-Aufnahmen, Sekunde für Sekunde inszeniert | 7. Aug. 2026 (API) | Live — oben generieren |
| Wan 3.0 | Alibabas All-in-One-Modell, bis zu 30-s-Aufnahmen | 6. Aug. 2026 | Live — oben generieren |
| MiniMax H3 | Omni-modales Flaggschiff, natives 2K + Stereo | 31. Juli 2026 · offene Gewichte angekündigt | Live — oben generieren |
| HappyHorse | Ausdrucksstarke Generierung + Video-Bearbeitung per Anweisung | Juni 2026 (1.1) | Live — oben generieren |
| Seedance-2.0-Familie | Standard-/Fast-/Mini-Arbeitspferde, bis zu 4K | April 2026 (API) | Live — oben generieren |
| Kling 3.0 | Element-Referenzen + natives Audio, bis zu 4K | 4. Feb. 2026 | Live — oben generieren |
| Veo 3.1 | Googles cineastisches Modell mit Audio | Okt. 2025 | Live — oben generieren |
Ein Abo, ein Credit-Guthaben — jedes oben verfügbare Modell ist enthalten.
Alle Spezifikationen von FLUX 3
| Parameter | Wert | Hinweise |
|---|---|---|
| Generierungsmodi | Text-zu-Video · Bild-zu-Video (erster/letzter Frame) · Storyboard-Keyframes · Clip-Verlängerung | Storyboard-Keyframes laufen im Referenzmodus; die Clip-Verlängerung ist ein eigenes Modell — wähle FLUX 3 Extend im Video-Extend-Modus. |
| Auflösung | 720P / 1080P | Beide Stufen generieren mit nativem Audio; jede Stufe hat ihren eigenen Sekundentarif. |
| Clip-Länge | 5–20 Sekunden | Jede Länge im Bereich — abgerechnet wird pro Sekunde Ausgabe. |
| Seitenverhältnisse | auto · 16:9 · 9:16 · 4:3 · 3:4 · 1:1 · 21:9 · 2:1 | „auto“ lässt das Modell anhand von Prompt und Eingaben wählen; 2:1-Widescreen ist auf Molyin exklusiv für FLUX 3. |
| Audio | Nativ — Dialog und Soundeffekte, ein-/ausschaltbar | Wird im selben Durchgang wie das Bild generiert; gleicher Preis mit oder ohne Audio. |
| Sprachen | Mehrsprachiger Dialog und Bildschirmtext | Charaktere sprechen lippensynchron mehrere Sprachen, und gerenderte Schilder oder Titel bleiben lesbar. |
| Storyboard-Keyframes | 3–10 Bilder | Die Keyframes werden über die Zeitleiste verteilt; das Modell generiert die Bewegung zwischen deinen exakten Frames. |
| Clip-Verlängerung | 1 Quell-Clip | Das FLUX-3-Extend-Modell setzt einen bestehenden Clip fort; neues Filmmaterial wird zum untenstehenden Verlängerungstarif abgerechnet. |
| Seed | Nicht unterstützt | Variiere die Formulierung, um Alternativen zu erkunden — identische Prompts liefern trotzdem unterschiedliche Ergebnisse. |
| Credits pro Sekunde | 38 (720P) · 65 (1080P) | Text-zu-Video, Bild-zu-Video und Storyboard-Keyframes werden alle zu diesem Tarif abgerechnet. |
| Credits pro Sekunde bei Verlängerung | 91 (720P) · 118 (1080P) | Gilt nur für neu generiertes Filmmaterial beim Verlängern eines Clips — der Quell-Clip selbst ist kostenlos. |
Alles, was hier steht, wird auf der Seite bereits unterstützt und bleibt mit den neuesten offiziellen Fähigkeiten des Modells synchron.
Was FLUX 3 in Credits kostet
Transparente Sekundenpreise aus derselben Abrechnungs-Engine, über die auch der Generator abrechnet — Audio kostet nichts extra, und fehlgeschlagene Generierungen werden automatisch erstattet.
| Modell | Auflösung | Credits/Sek. | 5s-Video | 5s-Video + 3s Referenz |
|---|---|---|---|---|
| 720p | 38 | 190 Credits | Nur Referenzbilder | |
| 1080p | 65 | 325 Credits | Nur Referenzbilder | |
| 720p | 91 | 455 Credits | 455 Credits (Quellvideo kostenlos) | |
| 1080p | 118 | 590 Credits | 590 Credits (Quellvideo kostenlos) |
- Video-Extend-Modelle (FLUX 3 Extend) rechnen das Quellvideo nie ab — nur die neu generierten Sekunden werden abgerechnet, zum oben gezeigten Extend-Tarif.
So generierst du mit FLUX 3
Drei Schritte vom Prompt zum Filmmaterial mit Ton
Wähle FLUX 3 und einen Modus
Wähle Text-zu-Video, Bild-zu-Video oder den Referenzmodus für Storyboard-Keyframes; zum Verlängern eines Clips wähle das FLUX-3-Extend-Modell.
Beschreibe die Szene, Ton inklusive
Beschreibe die Einstellung und setze Dialoge in Anführungszeichen — FLUX 3 rendert den Ton, den du schreibst. Hänge Keyframes im Referenzmodus an oder übergib FLUX 3 Extend einen Quell-Clip, um die Zeitleiste zu steuern.
Generieren und exportieren
FLUX 3 liefert Bild und Ton in einem Durchgang, 5 bis 20 Sekunden in 720P oder 1080P. Sieh dir die Vorschau direkt an und lade dann die Originaldatei herunter.
Schreib Ton in deine Prompts
FLUX 3 rendert den Ton, den du beschreibst — binde jeden Soundhinweis an das physikalische Ereignis, das ihn auslöst, und der Mix folgt dem Bild. Direkt aus unserem vollständigen FLUX-3-Prompt-Guide.
[Visuelles Ereignis] mit [seinem Klang] + optional [Atmosphären-Teppich]
Visuelles Ereignis
Die Aktion im Bild, die ein Geräusch erzeugt: eine Tür knallt, Gläser klirren, Schritte platschen.
Sound-Cue
Der Effekt, der an dieses Ereignis gekoppelt ist — konkret benannt, im selben Satz wie die Aktion.
Atmosphäre
Der Hintergrund-Teppich: Wind, Gemurmel der Menge, Raumton. Ein Halbsatz genügt.
FLUX 3 FAQ
Was Creator über das multimodale Modell von Black Forest Labs fragen.
Starte noch heute mit Molyin
Melde dich kostenlos an und verwandle deine erste Idee in Minuten in ein filmisches Video.