Kling 3.0
Kuaishous audiovisuelles Modell — Kling 3.0 dreht 3–15-sekündige Takes, in denen Figuren wirklich sprechen: Dialoge in fünf Sprachen, authentische Dialekte, Szenen mit mehreren Figuren, bis zu echtem 4K. Unten generieren.
- Fehlgeschlagene Generierungen werden automatisch erstattet
- Credit-Pakete laufen nie ab
- Der Preis jedes Modells ist öffentlich
- Jederzeit mit einem Klick kündbar
- 3–15 s
- Länge eines Takes
- Bis zu 4K
- Drei Auflösungsstufen
- 5
- Sprachen für gesprochene Dialoge
- Ab 22 Credits/s
- Kling 3.0 720P-Tarif
Sechs Takes, sechs vollständige Prompts
Eine mondbeschienene 15-Sekunden-Verfolgung, ein tränenreiches Dinosaurier-Wiedersehen, spanische Wegbeschreibungen, eine kantonesische Büro-Tirade, eine vierköpfige Familienszene und eine 4K-Schriftzug-Aufnahme — jeder Clip unten stammt aus Klings offiziellem Video-3.0-Guide und bringt den kompletten Prompt mit, der ihn erzeugt hat. Tippe auf Remix, um einen Prompt direkt in den Generator oben zu laden und ihn zu deinem zu machen.
- Kling 3.0
- Image to video
- 15s
- 1080P
Eröffnung mit einer horizontal fahrenden Ultraweitwinkel-Halbtotalen, der Stabilisator bewegt sich dicht über dem Boden, mit einem stark kontrastierenden romantischen Kino-Look aus kalter blauer Nacht und silbrig-weißem Sternenhimmel, der einen starken poetischen Realismus und ein klassisch-episches Temperament ausstrahlt. Die Protagonistin ist eine junge Frau in einem dunkelgrünen langen Kleid, die mit aller Kraft über den vom Mondlicht erhellten Gartenrasen rennt; ihr Rock bläht sich im Wind zu wogenden dynamischen Kurven, sie umklammert eine kleine weiße Blume in der rechten Hand und hebt mit der linken den Saum ihres Kleides, atmet schnell und blickt dennoch entschlossen. In der 4. Sekunde beschleunigt die Kamera mit ihr nach vorn, und mehrere Männer und Frauen in Ballkleidern alter Zeiten brechen im Hintergrund nacheinander von links und rechts ins Bild und rennen neben ihr her — manche versuchen sich zu nähern, manche drehen sich rufend um, doch keiner berührt sie wirklich, was Verfolgung und Flucht andeutet. In der 8. Sekunde zoomt die Kamera allmählich auf eine Halbnahe heran, schwenkt, um vor der Protagonistin vorwärts zu verfolgen, und hebt sich leicht; sie wirft einen kurzen Blick zurück auf einen jungen männlichen Charakter hinter ihr, ihre Blicke treffen sich für einen Sekundenbruchteil, die Emotionen brechen mitten im Lauf hervor, und die Frau und der Mann fassen sich an den Händen, um gemeinsam zu rennen. In der 12. Sekunde erreichen Musik und Bewegung ihren Höhepunkt; die Kamera bewegt sich dicht an ihrem Seitenprofil und wehenden Haar vorwärts, sie lässt die weiße Blume los und wirft sie in die Luft, die Blume schwebt in Zeitlupe herab, während die Menge dahinter an ihr vorbeistreift. In den letzten 3 Sekunden fährt die Kamera weiter vorwärts, die Frau und der Mann durchbrechen die Menge und stürmen auf den Sternenhimmel am Ende des Gartens zu, ihre Gestalten nehmen allmählich die Bildmitte ein. Die Gesamtatmosphäre ist feurig, romantisch und entschlossen, ein erzählerischer Ausbruch über Schicksal, Entscheidung und Freiheit.
- Kling 3.0
- Image to video
- 15s
- 1080P
Dies ist eine 15-sekündige filmische Plansequenz, eine einzige ununterbrochene Einstellung ohne Schnittübergänge. Die Szene spielt im Inneren eines Turms aus Gipsstatuen, gesprenkelt von Licht und Schatten, umgeben von aufragenden weißen Gipsskulpturen, die eine Atmosphäre von Geheimnis und Beklemmung heraufbeschwören. Die Einstellung beginnt damit, dass die Hauptfigur nach einem panischen Lauf schlitternd in der Mitte der Szene zum Stehen kommt, die Brust hebt und senkt sich, der Ausdruck ist benommen und hilflos, Angst glimmt in ihren Augen. Die Kamera umkreist die Hauptfigur in einem geschmeidigen 360-Grad-Schwenk. Während die Kamera rotiert, blickt die Hauptfigur ängstlich umher und ruft: „Alex! Alex where are you! Are you here?“ Dann hallt ein niedlicher Dinosaurier-Ruf im Hintergrund wider, und die Kamera schiebt sich über die Schulter der Hauptfigur auf ihren Rücken — ein kleiner bis mittelgroßer, entzückender Baby-Dinosaurier tritt hinter einer Gipssäule hervor und stößt ein süßes Zwitschern aus. Von dem Geräusch aufgeschreckt, wirbelt die Hauptfigur herum; beim Anblick des Dinosauriers bricht sie augenblicklich in Tränen aus und stürzt ohne Zögern vor, um ihn fest in die Arme zu schließen. Der Dinosaurier schmiegt sich folgsam an sie. Schluchzend streichelt die Hauptfigur den Dinosaurier sanft und sagt zitternd: „I found you! Thank God, I'm so scared!“ Licht und Schatten haben insgesamt eine filmische Textur, und die Emotion wandelt sich von Verzweiflung zu einem überwältigend berührenden Wiedersehen.
- Kling 3.0
- Image to video
- 10s
- 1080P
Sonnenlicht erfüllt die alten Straßen Madrids. Vor einer Bäckerei am Straßenrand gehen eine chinesische Touristin und ein Tourist in grauem Hoodie auf den Verkäufer zu, beide mit höflichem Lächeln. Touristin (etwas langsam sprechend, mit unbeholfenem Akzent, auf Spanisch): Disculpe, ¿dónde está la plaza mayor? Ein weißhaariger spanischer Verkäufer (dreht sich leicht und zeigt nach vorn, in leichtem, fröhlichem Ton, auf Spanisch): Por allí, a dos calles. Muy cerca. Die Touristin nickt zum Dank. Der Tourist nickt ebenfalls zustimmend und sagt (auf Spanisch): Muchas gracias. Der Verkäufer lächelt und nickt zurück. Die beiden Touristen drehen sich dann um und gehen in die gewiesene Richtung.
- Kling 3.0
- Image to video
- 10s
- 1080P
In einem Bürohochhaus lehnt sich der Mann zurück, mit müdem, geringschätzigem Gesichtsausdruck, und sagt auf Kantonesisch: 「其实……我真系唔系好 buy 你呢个 logic 啰。成个 proposal 根本 align 唔到我哋个 core value。你个 flow 咁乱,点样去 convince 个 client 呀?不如你返去 re-think 下个 angle,听朝早我要见到个 final version。」
- Kling 3.0
- Image to video
- 10s
- 1080P
Häusliches Setting mit einem leisen Summen der Wohnzimmer-Klimaanlage im Hintergrund für eine realistische Alltagsstimmung. Mama (leise, in überraschtem Ton): Wow, I didn't expect this plot at all. Papa (mit gedämpfter Stimme, zustimmend, in ruhigem Ton): Yeah, it's totally unexpected. Never thought that would happen. Junge (in aufgeregtem Ton): It's the best twist ever! Mädchen (nickt mit, in begeistertem Ton): I can't believe they did that!
- Kling 3.0
- Image to video
- 10s
- 4K
Die Kamera bleibt fest auf das Wort „KLING“ gerichtet, das auf dem Baseballschläger prangt, während der Spieler schwingt und den Ball trifft.
Ein Standbild, ein fertiger Werbespot
Bild-zu-Video mit Text auf nativem Niveau: Eine einzige Produktaufnahme einer Parfümflasche geht als Startbild hinein, und der Prompt inszeniert drei Kamerabewegungen plus drei Voiceover-Zeilen. Kling 3.0 hält den goldenen Schriftzug auf der Flasche durch jede Bewegung gestochen scharf und liefert den Spot mit der Erzählstimme bereits im Soundtrack.

Der Prompt
Am Fenster einer Pariser Wohnung, mit sanfter französischer Klaviermusik im Hintergrund, fällt das vergoldete Nachmittagslicht durch die Fensterläden auf die Parfümflasche und zeichnet ein geflecktes Spiel aus Licht und Schatten. Die Kamera schwenkt langsam von den verstreuten Rosenblättern herein und verlagert den Fokus auf den facettierten Schliff der Kling-Parfümflasche. Voiceover (träge französische Frauenstimme, britischer Akzent, langsames Tempo): Bathe in the golden hour. Die Kamera umkreist die Parfümflasche in Zeitlupe und fängt das Spiel von Licht und Schatten auf dem goldenen Schriftzug und dem Flaschenkörper ein. Voiceover: Kling, a whisper of Parisian elegance. Die Kamera zieht sich zurück und verharrt auf der Gesamtszene — die Kling-Parfümflasche steht auf einem Samtsockel, vor dem Fenster sind schemenhaft Pariser Gebäude zu erkennen. Voiceover: Wrap yourself in luxury with every breath.
Was ist Kling 3.0?
Kling 3.0 ist das Videogenerierungsmodell hinter Kling AI, entwickelt von Kuaishou. Sein prägendes Merkmal: Ton ist kein nachträglicher Gedanke — Dialog, Atmosphäre und Musik entstehen zusammen mit dem Bild, Figuren sprechen ihre Zeilen lippensynchron, und in Szenen mit mehreren Figuren sagt jede Person exakt die Zeile, die du ihr zuweist. Gesprochene Dialoge funktionieren in fünf Sprachen — Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch — und das Modell liefert authentische Dialekte und Akzente, von Kantonesisch bis zu indischem Englisch, wenn du sie im Prompt markierst.
Der Rest des Datenblatts ist genauso ernst zu nehmen. Die Länge ist ein stufenloser Regler von 3 bis 15 Sekunden in 720p, 1080p oder echtem 4K. Bild-zu-Video animiert ein Standbild und bewahrt Text auf nativem Niveau — Schilder, Untertitel und Schriftzüge bleiben gestochen scharf statt zu verschmieren, weshalb die Parfüm- und Baseball-Beispiele oben Bild für Bild bestehen. Element-Referenzen komponieren ein Video aus 2–4 Fotos eines Subjekts und fixieren dessen Identität über alle Kamerabewegungen hinweg, und Bild-zu-Video akzeptiert zusätzlich ein Start-und-Endbild-Paar für kontrollierte Übergänge.
Auf Molyin läuft Kling 3.0 im selben KI-Videogenerator wie jedes andere Modell, das wir hosten — ein Prompt-Feld, ein Credit-Guthaben. Credits funktionieren überall gleich; die Zahlen stehen auf der Preisseite.
Kling 3.0 vs. Seedance 2.0
Beide sind live auf Molyin und ergänzen sich wirklich — ein Prompt-Feld, ein Credit-Guthaben, also lautet die ehrliche Antwort auf „welches?“: Lass deinen Prompt auf beiden laufen und behalte den Gewinner.
| Merkmal | Kling 3.0 | Seedance 2.0 |
|---|---|---|
| Dauer | 3–15 s, stufenlos | 4–15 s, stufenlos |
| Auflösung | 720p · 1080p · 4K | 480p · 720p · 1080p · 4K |
| Seitenverhältnisse | 3 — 16:9, 9:16, 1:1 | 6 |
| Audio | Natives Audio, abschaltbar — Dialoge in 5 Sprachen plus Dialekte und Akzente | Native Audiogenerierung |
| Referenzen | Element-Referenzen — 2–4 Bilder eines Subjekts | Bis zu 9 Bilder + 3 Videos + 3 Audiospuren |
| Preis | 22 / 29 / 71 Credits/s (720P / 1080P / 4K) | 11 / 28 / 65 / 135 Credits/s je nach Stufe |
| Am stärksten bei | Gesprochene Performances, mehrsprachige Dialoge, Text im Bild, Konsistenz eines einzelnen Subjekts | Schnelle 480p-Entwürfe, große multimodale Referenzstapel, seed-gesteuerte Iteration |
Die angegebenen Preise sind die aktuellen Ausführungspreise auf Molyin.
Kling 3.0 vs. Modelle live auf Molyin
| Modell | Positionierung | Veröffentlichungsdatum | Auf Molyin |
|---|---|---|---|
| Kling 3.0 | Natives Audio in 5 Sprachen + Element-Referenzen, bis 4K | 4. Feb. 2026 | Live — oben generieren |
| Seedance 2.5 | ByteDance-Flaggschiff — 30-s-Takes, Sekunde für Sekunde inszeniert | 7. Aug. 2026 (API) | Live — oben generieren |
| FLUX 3 | Black Forest Labs — Storyboard-Keyframes + Take-Fortsetzung | 7. Aug. 2026 (Video-API) | Live — oben generieren |
| Wan 3.0 | Alibabas All-in-One-Modell, Takes bis 30 s | 6. Aug. 2026 | Live — oben generieren |
| MiniMax H3 | Omnimodales Flaggschiff, natives 2K + Stereo | 31. Juli 2026 · Open Weights angekündigt | Live — oben generieren |
| HappyHorse | Ausdrucksstarke Generierung + instruktionsbasiertes Video-Editing | Juni 2026 (1.1) | Live — oben generieren |
| Seedance-2.0-Familie | Standard- / Fast- / Mini-Arbeitspferde, bis 4K | Apr. 2026 (API) | Live — oben generieren |
| Veo 3.1 | Googles filmisches Modell mit Audio | Okt. 2025 | Live — oben generieren |
Ein Abo, ein Credit-Guthaben — jedes oben verfügbare Modell ist enthalten.
Kling 3.0 — vollständige Spezifikationen
| Parameter | Wert | Hinweise |
|---|---|---|
| Modell | Kling 3.0 — Kuaishous einheitliches audiovisuelles Modell | Das Modell hinter Kling AI — es generiert Bild und Ton in einem Durchgang. |
| Generierungsmodi | Text / Bild / Elemente zu Video | Drei Modi: von Grund auf prompten, ein Standbild animieren oder aus Element-Referenzfotos komponieren. |
| Auflösungsstufen | 720P / 1080P / 4K | Entwurf in 720P, Feinschliff in 1080P, Master in echtem 4K — das Baseball-Beispiel oben ist eine 4K-Ausgabe. |
| Clip-Länge | 3–15 s | Ein stufenloser Regler, keine festen Vorgaben — beide 15-Sekunden-Beispiele oben sind einzelne ununterbrochene Takes. |
| Seitenverhältnisse | 16:9 · 9:16 · 1:1 | Breitbild, Hochformat und Quadrat; bei Bild-zu-Video folgt die Ausgabe dem Seitenverhältnis deines Startbilds. |
| Audio | Natives Audio — abschaltbar | Der Ton entsteht zusammen mit dem Bild, und Dialoge sind lippensynchron; schalte ihn ab, wenn du nur die Bilder brauchst. |
| Dialogsprachen | Chinesisch · Englisch · Japanisch · Koreanisch · Spanisch | Plus authentische Dialekte und Akzente — Kantonesisch, Sichuanesisch, britisches oder indisches Englisch — direkt im Prompt markiert. |
| Element-Referenzen | 2–4 Bilder eines Subjekts | Fotos einer Figur, eines Produkts oder einer Szene aus mehreren Blickwinkeln fixieren die Identität über alle Kamerabewegungen hinweg. |
| Start- & Endbild | Unterstützt bei Bild-zu-Video | Lege beide Endpunkte des Clips fest, und das Modell animiert den Übergang dazwischen. |
| Seed-Steuerung | Nicht unterstützt | Keine Reproduktion mit festem Seed — iteriere, indem du den Prompt verfeinerst oder ein gelungenes Ergebnis remixt. |
| Credits pro Sekunde | 22–71 Credits/s | Von 720P bis 4K — die vollständige Staffelpreisliste steht in der Tabelle unten; fehlgeschlagene Generierungen werden erstattet. |
Alles, was hier steht, wird auf der Seite bereits unterstützt und bleibt mit den neuesten offiziellen Fähigkeiten des Modells synchron.
Kling-3.0-Preise auf Molyin
Abgerechnet wird pro Sekunde nach Auflösungsstufe, aus demselben Credit-Guthaben wie alles andere auf Molyin. Die Zahlen unten kommen direkt aus unserer Abrechnungs-Engine, und fehlgeschlagene Generierungen werden automatisch erstattet.
| Modell | Auflösung | Credits/Sek. | 5s-Video | 5s-Video + 3s Referenz |
|---|---|---|---|---|
| 720p | 22 | 110 Credits | Nur Referenzbilder | |
| 1080p | 29 | 145 Credits | Nur Referenzbilder | |
| 4k | 71 | 355 Credits | Nur Referenzbilder |
Credit-Preise für jedes Modell in der vollständigen Preisliste ansehen →
So generierst du mit Kling 3.0
Drei Schritte von der Idee zum fertigen Take
Modell und Modus wählen
Wähle Text-zu-Video, Bild-zu-Video oder den Referenzmodus mit 2–4 Element-Fotos.
Den Prompt schreiben
Ein konkretes Subjekt plus eine klare Bewegung, dann Dialog in Anführungszeichen setzen und benennen, wer ihn spricht — genau wie in den Beispielen auf dieser Seite. Markiere eine Sprache oder einen Dialekt für eine authentische Sprechweise.
Generieren und exportieren
Wähle 720P, 1080P oder 4K und eine beliebige Länge von 3 bis 15 Sekunden, sieh dir die Vorschau an und lade dann die Originaldatei herunter.
Die Element-Referenz-Formel
Das Markenzeichen von Kling 3.0: Lade 2–4 Fotos eines Subjekts hoch und beschreibe die Szene darum herum — das Modell fixiert die Identität des Subjekts, während alles andere dem Prompt gehorcht. Direkt aus unserem vollständigen Prompt-Guide.
[Elemente: Bild 1, Bild 2…] + [Szenenbeschreibung] + [Element] konsistent halten
Referenz-Elemente
2–4 Bilder, im Prompt als „Bild N“ referenziert; die Upload-Reihenfolge ist die Nummerierungsreihenfolge.
Szenenbeschreibung
Was in der neuen Szene geschieht: Aktion, Umgebung, Kamera.
Konsistenz
Eine Zeile „konsistent mit den Referenzbildern bleiben“ verstärkt die Fixierung des Erscheinungsbilds.
Kling 3.0 FAQ
Was Creator über Kuaishous Videomodell fragen — beantwortet aus unserer eigenen Integration.
Starte noch heute mit Molyin
Melde dich kostenlos an und verwandle deine erste Idee in Minuten in ein filmisches Video.