Guide

Kling 3.0 Guide

Von der Kernformel über natives Audio und Bild-zu-Video bis zu Element-Referenzen — die zentralen Beispiele sind aus validierten Samples des offiziellen Video-3.0-Benutzerhandbuchs von kling.ai adaptiert (der Sternenlicht-Long-Take, der Vier-Personen-Dialog, das Nachfragen auf Spanisch, das Büro-Gespräch auf Kantonesisch, die Parfümanzeige), und ein Klick auf „Ausprobieren“ füllt den Molyin-Generator vorab aus. Das Aushängeschild von Kling 3.0 ist ein fertiger Clip mit Soundeffekten und Dialog in einer einzigen Generierung — dazu 2–4 Referenzbilder für Charakterkonsistenz und ein stufenloser Dauer-Regler von 3 bis 15 Sekunden. Dieser Guide deckt jeden Baustein ab.

Aktualisiert am 2026-08-12

01 Die Kernformel

Kling 3.0 versteht strukturierte Regieanweisungen: wer, was die Person tut, wie sich die Kamera bewegt, wo und in welchem Stil. Dieses Kapitel zerlegt einen guten Prompt in fünf wiederverwendbare Teile und demonstriert dann das Long-Take-Storytelling am offiziellen Aushängeschild-Sample — steht dieses Grundgerüst, ist jedes spätere Kapitel nur eine Erweiterung davon.

1.1 Die grundlegende Prompt-Formel

Alles beginnt mit einem Satz: Subjekt und Bewegung sind die beiden Pflichtteile; Kamera, Umgebung und Stil kommen je nach Bedarf dazu. Spiele den Clip zuerst im Kopf ab und schreibe ihn dann nach der Formel auf. Schließe mit einer Einschränkungszeile ab — „frei von Untertiteln halten“, „kein Wasserzeichen erzeugen“ — das senkt die Ausschussquote messbar.

[Subjekt] + [Bewegung] + optional [Kamera] [Umgebung] [Stil]

Erforderlich

Subjekt

Der Star im Bild — eine Person, ein Tier oder ein Produkt. Je konkreter, desto besser.

Erforderlich

Bewegung

Was das Subjekt tut, mit Körperteilen und Tempo genau beschrieben.

Optional

Kamera

Bildausschnitt und Kamerabewegung: Nahaufnahme, Heranfahren, Umkreisen — eine Bewegung pro Einstellung.

Optional

Umgebung

Schauplatz und Stimmung: Ort, Tageszeit, Licht, Wetter.

Optional

Stil

Bildgestaltung und Bildqualität: Farbgebung, Textur, cineastischer Look.

Ein Eckcafé im Morgengrauen

Prompt

Die Außenterrasse eines Eckcafés am frühen Morgen, das Sonnenlicht fällt schräg über das Kopfsteinpflaster. Eine Frau im beigen Trenchcoat sitzt in einem Korbsessel und schlägt ein Buch auf, wobei sie sich eine lose Haarsträhne hinters Ohr streicht. Ein Kellner überquert den Hintergrund mit einem Tablett. Die Kamera fährt langsam auf die Buchseiten in ihren Händen zu. Ruhige, gemütliche Stimmung, warme Goldtöne, detailreiche Darstellung. Halte das Video frei von Untertiteln; erzeuge kein Wasserzeichen.

Zwei Sätze für Subjekt + Bewegung, je einer für Kamera und Umgebung, dann eine Einschränkungszeile zum Abschluss. Empfohlen: 5 s, 1080p, 16:9.

1.2 Kamera-Sprache

Kamerabegriffe sind eine Stärke von Kling 3.0: Heranfahren, Zurückfahren, Schwenken, Verfolgen, Umkreisen und Sturzflug werden alle zuverlässig umgesetzt. Eine Disziplinregel — gib jeder Einstellung nur eine einzige Kamerabewegung. Wer Heranfahren, Umkreisen und Schwenken in einer Einstellung stapelt, kauft sich nur verwackeltes Material.

Umkreisung eines Leuchtturms auf der Klippe

Prompt

Ein rot-weißer Leuchtturm steht in der Abenddämmerung auf einer Küstenklippe, sein Licht schaltet sich gerade ein, während die Wellen in weißer Gischt gegen die Felswand schlagen. Die Kamera umkreist den Leuchtturm langsam eine volle Runde und steigt dabei von Meereshöhe bis zur Draufsicht auf, während die untergehende Sonne die Wolken orange und violett färbt. Cineastische Qualität, mehrschichtiges Licht, ruhiges und stabiles Bild. Halte das Video frei von Untertiteln; erzeuge kein Wasserzeichen.

„Die Kamera umkreist … langsam eine volle Runde“ ist die zuverlässigste Formulierung für eine Orbit-Bewegung — ergänze eine Zeile zum Höhenwechsel. Empfohlen: 8 Sekunden, genug Zeit, damit die Umkreisung vollständig ablaufen kann.

1.3 Sekundentakt für Long Takes

Das offizielle Benutzerhandbuch von Kling 3.0 schreibt Long Takes als Beats auf Sekundenebene: In der 4. Sekunde beschleunigt die Kamera, in der 8. fährt sie auf eine Halbnahe, in der 12. erreichen Musik und Bewegung ihren Höhepunkt — pinne jede Wendung von Aktion und Kamera an die Zeitleiste, und das Modell spielt im Takt. Das Beispiel unten ist das offizielle Aushängeschild-Sample wortgetreu. Beachte den Unterschied zum nummerierten Storyboarding: Sekundentakt eignet sich für eine ununterbrochene Einstellung, Einstellungsnummern für den Schnitt zwischen mehreren Blickwinkeln.

Ein 15-sekündiger Sternenlicht-Lauf in einer Einstellung (offizielles Sample)

Prompt

Eröffnet mit einer horizontal mitfahrenden Ultraweitwinkel-Halbtotalen, der Gimbal bewegt sich bodennah in niedriger Kameraposition; kalte blaue Nacht und silbrig weißer Sternenhimmel bilden einen kontrastreichen, romantischen Kinolook, der eine starke poetisch-realistische und klassisch-epische Ausstrahlung verbreitet. Die Hauptfigur ist eine junge Frau in einem dunkelgrünen langen Kleid, die mit aller Kraft über den mondbeschienenen Gartenrasen rennt; ihr Rock bauscht sich im Wind zu wogenden dynamischen Kurven, in der rechten Hand umklammert sie eine kleine weiße Blume, mit der linken hebt sie den Saum ihres Kleides, ihr Atem geht schnell, doch ihr Blick ist entschlossen. In der 4. Sekunde beschleunigt die Kamera gemeinsam mit ihr nach vorn, und im Hintergrund stürmen von links und rechts nacheinander mehrere Männer und Frauen in Ballkleidern vergangener Zeiten ins Bild und rennen neben ihr her — manche versuchen, sich ihr zu nähern, manche drehen sich rufend um, doch niemand berührt sie wirklich, was Verfolgung und Flucht andeutet. In der 8. Sekunde zoomt die Kamera allmählich auf eine Halbnahe, schwenkt vor die Hauptfigur, um sie vorwärts zu verfolgen, und hebt sich leicht; sie wirft einen kurzen Blick zurück auf eine junge männliche Figur hinter ihr, ihre Blicke treffen sich für den Bruchteil einer Sekunde, die Gefühle brechen mitten im Lauf hervor, und Frau und Mann fassen sich an den Händen und rennen gemeinsam. In der 12. Sekunde erreichen Musik und Bewegung ihren Höhepunkt; die Kamera bewegt sich dicht an ihrem Profil und den flatternden Haaren nach vorn, sie lässt die weiße Blume los und wirft sie in die Luft, die Blume treibt in Zeitlupe herab, während die Menge hinter ihr an ihr vorbeistreift. In den letzten 3 Sekunden bewegt sich die Kamera ununterbrochen weiter, Frau und Mann durchbrechen die Menge und stürmen auf den Sternenhimmel am Ende des Gartens zu, ihre Gestalten nehmen allmählich das Zentrum des Bildes ein. Die Gesamtstimmung ist feurig, romantisch und entschlossen — ein erzählerischer Ausbruch über Schicksal, Entscheidung und Freiheit.

Erfordert 1 Startbild (der Garten / die Frau beim Aufbrechen); natives Audio ist voraktiviert. „In der N-ten Sekunde + eine Wendung in Aktion oder Kamera“ ist die offizielle Taktnotation für Long Takes — das ist wortgetreu das Aushängeschild-Sample aus dem Benutzerhandbuch von kling.ai.

02 Natives Audio

Soundeffekte und Dialoggenerierung sind das Aushängeschild von Kling 3.0: Regen, Wind, Schritte und gesprochene Zeilen werden zusammen mit dem Bild erzeugt, automatisch synchron — ganz ohne nachträgliches Vertonen. Noch seltener sind die Sprachen und Dialekte — Englisch, Spanisch, Kantonesisch werden alle mit Tonfall und Attitüde „gespielt“. Der Schreibstil ist genauso direkt: Wie beim Bild gilt — je genauer du den Klang beschreibst, desto präziser das Ergebnis. Alle Beispiele in diesem Kapitel sind mit voraktiviertem nativem Audio versehen.

2.1 Umgebungsgeräusche

Umgebungsgeräusche schreibt man nach dem Prinzip „benennen + schichten“: Liste jeden gewünschten Klang auf und gib an, welcher im Vordergrund und welcher in der Ferne liegt. Wenn der Regen der Star ist, nenne ihn zuerst; lass fernen Donner den Hintergrund füllen. Beschreibst du nichts, improvisiert das Modell — und trifft dabei nicht immer die Stimmung, die du wolltest.

Nächtlicher Regen auf einer Waldhütte

Prompt

Nachts, die Veranda einer Holzhütte im Wald, warmes gelbes Licht strahlt aus den Fenstern. Starker Regen trommelt dicht auf die Dachvorsprünge und Blätter, und das abfließende Wasser rinnt wie ein Perlenvorhang vom Rand der Veranda. Statischer Kamerabildausschnitt, der nur eine Ecke der Veranda und den Regenvorhang zeigt. Audio: aus nächster Nähe dichte Regentropfen, die auf das Holzdach prasseln, und das Ticken von Tropfen, die in Pfützen fallen; in der Ferne gelegentlich ein tiefes Donnergrollen — die Gesamtstimmung ruhig und wohltuend. Halte das Video frei von Untertiteln.

Schichte das Audio von nah nach fern — Hauptklang, Detail, Kulisse — und schließe mit einem Stimmungswort ab. Empfohlen: 5 Sekunden; natives Audio ist voraktiviert.

2.2 Charakter-Dialoge

Die offizielle Dialognotation ist „Figur (Tonfall-Angabe): Zeile“ — nenne zuerst, wer spricht, setze den Tonfall in Klammern und lass die exakten Worte folgen. In Szenen mit mehreren Figuren nenne alle vier Sprechenden nacheinander, und das Modell verteilt Stimmen und synchronisiert die Lippen automatisch. Je kürzer die Zeile, desto stabiler die Synchronisation.

Eine vierköpfige Familie vor dem Fernseher (offizielles Sample)

Prompt

Häusliche Szene mit dem leisen Summen der Wohnzimmer-Klimaanlage im Hintergrund für eine realistische Alltagsstimmung. Mama (leise, mit überraschtem Ton): Wow, I didn't expect this plot at all. Papa (mit tiefer Stimme, zustimmend, in ruhigem Ton): Yeah, it's totally unexpected. Never thought that would happen. Junge (mit aufgeregtem Ton): It's the best twist ever! Mädchen (nickt zustimmend, mit begeistertem Ton): I can't believe they did that!

Das offizielle Vier-Personen-Dialogsample wortgetreu: eine kurze Zeile pro Person mit Tonfall-Angabe in Klammern, und das Hintergrundsummen der Klimaanlage legt zuerst die Alltagsszene fest. Empfohlen: 10 Sekunden; natives Audio ist voraktiviert.

2.3 Mehrsprachige Dialoge und Dialekte

Hier hebt sich Kling 3.0 vom Feld ab: Zeilen lassen sich auf Spanisch, Kantonesisch und mehr erzeugen — inklusive Akzent und Tonfall. Die Notation: Vor der Zeile in Klammern „auf Spanisch“ / „auf Kantonesisch“ plus eine Tonfallbeschreibung notieren, die Zeile selbst bleibt wörtlich in der Zielsprache. Beide Beispiele unten sind offizielle Samples, wortgetreu.

Auf Spanisch nach dem Weg fragen in Madrid (offizielles Sample)

Prompt

Sonnenlicht erfüllt die alten Straßen von Madrid. Vor einer Bäckerei am Straßenrand gehen eine chinesische Touristin und ein männlicher Tourist im grauen Kapuzenpullover auf den Ladenangestellten zu, beide mit höflichem Lächeln. Touristin (spricht etwas langsamer, mit unsicherem Akzent, auf Spanisch): Disculpe, ¿dónde está la plaza mayor? Ein weißhaariger spanischer Ladenangestellter (dreht sich leicht und zeigt nach vorn, mit leichtem, fröhlichem Ton, auf Spanisch): Por allí, a dos calles. Muy cerca. Die Touristin nickt zum Dank. Der männliche Tourist nickt ebenfalls zustimmend und sagt (auf Spanisch): Muchas gracias. Der Ladenangestellte lächelt und nickt als Antwort. Die beiden Touristen drehen sich dann um und gehen in die angegebene Richtung.

„Etwas langsamer sprechend, mit unsicherem Akzent“ ist Charakterisierung über den Vortrag — der Akzent ist Teil der Darbietung. Empfohlen: 10 Sekunden; natives Audio ist voraktiviert.

Kantonesischer Schlagabtausch im Hochhausbüro (offizielles Sample)

Prompt

In einem Hochhausbüro lehnt sich der Mann zurück, trägt einen müden, abschätzigen Gesichtsausdruck und sagt auf Kantonesisch: 「其实……我真系唔系好 buy 你呢个 logic 啰。成个 proposal 根本 align 唔到我哋个 core value。你个 flow 咁乱,点样去 convince 个 client 呀?不如你返去 re-think 下个 angle,听朝早我要见到个 final version。」

Die kantonesische Zeile bleibt unübersetzt, und die eingemischten englischen Arbeitsbegriffe (logic / proposal / align) sind genau der Klang von Hongkong-Kantonesisch — die Authentizität des Dialekts steckt in solchen Details. Empfohlen: 10 Sekunden; natives Audio ist voraktiviert.

03 Bild zu Video

Ein Startbild plus eine Bewegungsbeschreibung, und Kling 3.0 erweckt das Bild zum Leben. Eine wichtige Regel: Das Seitenverhältnis der Ausgabe folgt automatisch dem Startbild — Hochformat rein, Hochformat raus; quadratisch rein, quadratisch raus. Schneide vor dem Hochladen auf dein Zielverhältnis zu; das ist einfacher, als im Prompt dagegen anzukämpfen. Der Fokus deines Prompts verschiebt sich von der Bildbeschreibung zur Beschreibung von Bewegung und Ton — das Bild ist ja bereits da.

3.1 Ein Foto zum Leben erwecken

Ein Bild-zu-Video-Prompt beschreibt nur drei Dinge: was sich bewegt, wie es sich bewegt und ob sich die Kamera bewegt. Erzwinge nichts, was nicht im Bild ist — „wecke“ stattdessen das, was schon da ist: wehende Haare, ziehende Wolken, ein Blinzeln und ein Lächeln sind kleine Bewegungen mit hoher Trefferquote.

Blinzeln und Lächeln in einem alten Foto

Prompt

Die Person auf dem Foto blinzelt langsam, ihre Mundwinkel heben sich zu einem sanften Lächeln, während ihr Blick zur Kamera wandert und lose Haarsträhnen von einer leichten Brise bewegt werden. Die Kamera bleibt fest; Beleuchtung und Farbgebung bleiben der ursprünglichen Textur des Fotos treu. Dezente, natürliche Bewegung. Halte das Video frei von Untertiteln.

Erfordert 1 Startbild; beschreibe nur die Bewegung, nie die Szene erneut — „der ursprünglichen Textur des Fotos treu bleiben“ hält den Stil. Das Seitenverhältnis der Ausgabe folgt automatisch deinem hochgeladenen Bild.

3.2 Produktpräsentation

Bei E-Commerce-Produktclips schreibe drei Dinge klar: wie sich die Kamera bewegt, welche Produktdetails Nahaufnahmen bekommen und was das Voiceover sagt. Ergänze „das Erscheinungsbild des Produkts bleibt dem Bild treu“, um die Details zu fixieren — Kling 3.0 bewahrt sogar den Originaltext auf der Flasche, wie das offizielle Sample unten in voller Länge zeigt.

Eine Parfümanzeige in einer Pariser Wohnung (offizielles Sample)

Prompt

Am Fenster einer Pariser Wohnung, mit sanftem französischem Klavier als Hintergrundmusik, fällt das vergoldete Nachmittagslicht durch die Jalousien auf die Parfümflasche und wirft geflecktes Licht und Schatten. Die Kamera schwenkt langsam zwischen den verstreuten Rosenblättern herein und verlagert den Fokus auf den facettierten Schliff der Kling-Parfümflasche. Voiceover (träge französische Frauenstimme, britischer Akzent, langsames Tempo): Bathe in the golden hour. Die Kamera umkreist die Parfümflasche in Zeitlupe und fängt das Spiel von Licht und Schatten auf dem goldenen Schriftzug und dem Flaschenkörper ein. Voiceover: Kling, a whisper of Parisian elegance. Die Kamera fährt zurück und friert auf der Gesamtszene ein — die Kling-Parfümflasche steht auf einem Samtsockel, vor dem Fenster zeichnen sich schemenhaft Pariser Gebäude ab. Voiceover: Wrap yourself in luxury with every breath.

Erfordert 1 Produktbild der Flasche; natives Audio ist voraktiviert. Das Voiceover trägt eine Klangfarben-Regieanweisung — „träge französische Frauenstimme, britischer Akzent, langsames Tempo“ — und der goldene Schriftzug auf der Flasche bleibt während der Umkreisung lesbar. Das offizielle i2v-Werbesample, wortgetreu.

04 Element-Referenzen

Referenz-zu-Video (r2v) fixiert Charaktere und Elemente mit 2–4 Bildern: Gib dem Modell denselben Charakter aus verschiedenen Blickwinkeln und in verschiedenen Outfits, und es erstellt eine komplette „Identitätsakte“, die jeden Szenenwechsel übersteht. Verweise in deinem Prompt auf die Uploads als „Bild 1“, „Bild 2“ — die Plattform übernimmt die Referenzsyntax automatisch, du brauchst keine Sonderzeichen. Feste Regel: Du musst 2–4 Referenzbilder hochladen; weniger als 2 können nicht abgeschickt werden.

4.1 Die Formel für Element-Referenzen

Ein Prompt mit Element-Referenzen ist ein dreiteiliger Aufbau: Hole die Elemente mit „Bild N“ auf die Bühne, beschreibe, was in der neuen Szene geschieht, und schließe mit einer Zeile zur Konsistenz ab. Die Upload-Reihenfolge ist die Nummerierungsreihenfolge — der erste Upload ist Bild 1, der zweite ist Bild 2.

[Elemente: Bild 1, Bild 2…] + [Szenenbeschreibung] + [Element] konsistent halten

Erforderlich

Referenz-Elemente

2–4 Bilder, im Prompt als „Bild N“ referenziert; die Upload-Reihenfolge ist die Nummerierungsreihenfolge.

Optional

Szenenbeschreibung

Was in der neuen Szene geschieht: Aktion, Umgebung, Kamera.

Optional

Konsistenz

Eine Zeile „konsistent mit den Referenzbildern bleiben“ verstärkt die Fixierung des Erscheinungsbilds.

Der Alltag eines Marken-Maskottchens

Prompt

Das kleine blaue Wal-Maskottchen aus Bild 1 und Bild 2 erscheint in einer hellen Bäckerei. Es steht auf den Zehenspitzen am Tresen und mustert neugierig ein Tablett mit frisch gebackenen Croissants, während sein Schwanz fröhlich hin und her wedelt. Die Kamera fährt langsam von einer Halbtotalen auf sein Gesicht zu. Halte das Maskottchen identisch zu den Referenzbildern. Warmes, herzliches Gefühl, 3D-Animationsqualität. Halte das Video frei von Untertiteln.

Erfordert 2–4 Referenzbilder (weniger als 2 können nicht abgeschickt werden); mehrere Blickwinkel desselben Charakters funktionieren am besten, und die Plattform übernimmt die Referenzsyntax.

4.2 Mehrere Elemente kombinieren

Jedes Referenzbild bekommt genau eine Aufgabe: Bild 1 für die Hauptfigur, Bild 2 für den Co-Star, Bild 3 für das Requisit. Benenne die Aufgabe jedes Bildes per Nummer, und das Modell verwechselt sie nicht — das ist besonders wichtig, wenn du Personen und Requisiten gemeinsam hochlädst.

Ein Reisemoment zu zweit

Prompt

Der Mann aus Bild 1 und die Frau aus Bild 2 gehen Seite an Seite eine Ginkgo-Allee im Herbst entlang, goldene Blätter treiben im Wind. Sie streckt die Hand aus, fängt ein Blatt und dreht sich lachend zu ihm, um es ihm zu zeigen; er hebt seine Kamera und hält den Moment fest. Die Kamera verfolgt die beiden gleichmäßig von der Seite. Die Gesichter, Frisuren und Outfits beider Personen bleiben durchgehend identisch zu den Referenzbildern — kein Face-Swapping, keine Verzerrung. Warme Farbtöne, natürlich und lebendig. Halte das Video frei von Untertiteln.

Erfordert 2–4 Referenzbilder. Schreibe bei Zwei-Personen-Szenen „Bild 1 = wer, Bild 2 = wer“ an den Anfang, und die globale Sperre am Ende — „kein Face-Swapping, keine Verzerrung“ — verhindert Drift. Empfohlen: 8 Sekunden.

05 Storytelling mit langer Dauer

Kling 3.0 erzeugt jede ganzzahlige Dauer von 3 bis 15 Sekunden. Länger ist nicht automatisch besser: 5 s sind für schnelles Iterieren gedacht, 8–10 s fassen eine Erzählung mit Storyboard, und 12 s und mehr gehören „einer durchgehenden Einstellung, die bis zum Ende durchspielt“ — ununterbrochene Aktion, komplette Dialogszenen, all das, was kurze Dauern nicht fassen können.

5.1 Eine komplette durchgehende Einstellung

Der Schlüssel zu einer langen, durchgehenden Einstellung ist, die Aktionen in zeitlicher Reihenfolge aneinanderzureihen: was zuerst geschieht, was folgt, wo es endet — ausgelegt wie ein Mini-Drehbuch. Das offizielle Sample unten legt auch den Emotionsbogen auf die Zeitleiste — von Verzweiflung zur Wiedervereinigung, eine ganze Szene in 15 Sekunden durchgespielt.

Eine Dinosaurier-Wiedervereinigung im Gipsturm (offizielles Sample)

Prompt

Dies ist ein 15-sekündiger cineastischer Long Take, eine einzige ununterbrochene Einstellung ohne Schnitte. Die Szene spielt im Inneren eines Turms aus Gipsstatuen mit geflecktem Licht und Schatten, umgeben von hochaufragenden weißen Gipsskulpturen, die eine Atmosphäre von Geheimnis und Bedrückung verbreiten. Die Einstellung eröffnet mit der Hauptfigur, die nach einem wilden Lauf im Zentrum der Szene zum Stehen rutscht, die Brust hebt und senkt sich heftig, der Gesichtsausdruck ist fassungslos und hilflos, in den Augen glitzert Angst. Die Kamera umkreist die Hauptfigur in einem sanften 360-Grad-Schwenk. Während sich die Kamera dreht, blickt die Hauptfigur ängstlich umher und ruft: "Alex! Alex where are you! Are you here?" Daraufhin hallt im Hintergrund ein niedlicher Dinosaurierschrei wider, und die Kamera fährt über die Schulter der Hauptfigur auf ihren Rücken zu — ein kleiner bis mittelgroßer, putziger Dinosauriernachwuchs tritt hinter einer Gipssäule hervor und stößt ein süßes Zirpen aus. Erschrocken von dem Geräusch wirbelt die Hauptfigur herum; als sie den Dinosaurier erblickt, bricht sie sofort in Tränen aus und stürmt ohne Zögern nach vorn, um ihn fest in die Arme zu schließen. Der Dinosaurier schmiegt sich artig an sie. Schluchzend streichelt die Hauptfigur den Dinosaurier sanft und sagt zitternd: "I found you! Thank God, I'm so scared!" Das gesamte Licht- und Schattenspiel hat cineastische Textur, und die Emotion wandelt sich von Verzweiflung zu einer überwältigend berührenden Wiedervereinigung.

Erfordert 1 Startbild (der Gipsturm / die Hauptfigur); natives Audio ist voraktiviert. Eröffne mit dem Vertrag — „ein 15-sekündiger Long Take, eine einzige ununterbrochene Einstellung ohne Schnitte“ — und reihe dann Aktionen und Emotionsbogen in zeitlicher Reihenfolge. Das offizielle Long-Take-Sample, wortgetreu.

Kling 3.0 Parameter-Übersicht

Dies sind alle Einstellungen, die der Molyin-Generator für Kling 3.0 tatsächlich anbietet.

ModiText zu Video / Bild zu Video / Referenz zu Video
Auflösungen720p / 1080p / 4k
Dauer3–15 s
Seitenverhältnisse16:9 / 9:16 / 1:1
AudioUnterstützt
Erster/letzter FrameUnterstützt
Referenzbilder2–4
ReferenzvideosNicht unterstützt
Referenz-AudioNicht unterstützt
Letzten Frame zurückgebenNicht unterstützt

FAQ

Die sechs häufigsten Arten, wie Clips schiefgehen — und die Lösungen aus dem offiziellen Benutzerhandbuch.