Guide

Guide Kling 3.0

Le système d’écriture complet, de la formule de base à l’audio natif, en passant par l’image-to-video et les références d’éléments — les exemples clés sont adaptés d’échantillons validés du guide d’utilisation officiel Video 3.0 de kling.ai (le plan-séquence de la course sous les étoiles, le dialogue à quatre personnages, la demande de chemin en espagnol, la blague de bureau en cantonais, la publicité du parfum), et un clic sur « Essayez » pré-remplit le générateur Molyin. La tête de proue de Kling 3.0 est un clip finalisé avec effets sonores et dialogues en une seule génération — plus 2 à 4 images de référence pour la cohérence des personnages et un réglage de durée continu de 3 à 15 secondes. Ce guide couvre chaque bloc.

Mis à jour le 2026-08-12

01 La formule de base

Kling 3.0 comprend la direction structurée  qui, ce qu’ils font, comment la caméra bouge, où, dans quel ton. Ce chapitre décompose un bon prompt en cinq pièces réutilisables, puis démontre la narration en plan-séquence avec l’échantillon phare officiel — posez ce squelette correctement et chaque chapitre suivant n’en est qu’une extension.

1.1 La formule de base du prompt

Tout commence par une phrase  le sujet et le mouvement sont les deux parties obligatoires  caméra, environnement et style s’empilent au besoin. Passez d’abord le clip dans votre tête, puis écrivez-le en suivant la formule. Terminez par une ligne de contrainte — « garder la vidéo sans sous-titres », « ne pas générer de filigranes » — elle réduit sensiblement le taux d’échec.

[Sujet] + [Mouvement] + facultatif [Caméra] [Environnement] [Style]

Requis

Sujet

La star du cadre — une personne, un animal ou un produit. Plus c’est précis, mieux c’est.

Requis

Mouvement

Ce que fait le sujet, avec les parties du corps et le rythme précisés.

Facultatif

Caméra

Cadrage et mouvement de caméra  close-up, push-in, orbit — un seul mouvement par plan.

Facultatif

Environnement

Décor et ambiance  lieu, moment de la journée, éclairage, météo.

Facultatif

Style

Direction artistique et qualité d’image  palette, texture, sensation cinématographique.

Un café de coin au petit matin

Prompt

La terrasse extérieure d’un café de coin au petit matin, la lumière du soleil oblique sur les pavés. Une femme en trench beige s’assoit sur une chaise en osier et ouvre un livre, glissant une mèche de cheveux lâche derrière son oreille. Un serveur traverse l’arrière-plan en portant un plateau. La caméra effectue un lent push-in vers les pages entre ses mains. Ambiance calme et douillette, tons dorés chaleureux, riches détails. Gardez la vidéo sans sous-titres  ne générez aucun filigrane.

Deux phrases pour le sujet et le mouvement, une pour la caméra, une pour l’environnement, puis une ligne de contrainte pour conclure. Suggestion  5 s, 1080p, 16:9.

1.2 Le langage de caméra

Les termes de caméra sont le point fort de Kling 3.0  push in (zoom avant), pull back (zoom arrière), pan (panoramique), tracking (suivi), orbit (orbite) et dive (plongée) s’exécutent tous avec précision. Une règle de discipline — un seul mouvement de caméra par plan  empiler push, orbit et pan ensemble ne vous achète que des images tremblantes.

Orbite autour d’un phare de falaise

Prompt

Un phare rouge et blanc se dresse sur une falaise côtière au crépuscule, sa lampe s’allumant à l’instant où les vagues s’écrasent contre la roche en gerbes blanches. La caméra orbite lentement autour du phare sur un cercle complet, s’élevant du niveau de la mer jusqu’à une vue plongeante, tandis que le soleil couchant teinte les nuages d’orange et de violet. Qualité cinématographique, éclairage en couches, des images stables et fluides. Gardez la vidéo sans sous-titres  ne générez aucun filigrane.

« La caméra orbite lentement… un cercle complet » est la formulation d’orbite la plus stable — ajoutez une ligne sur le changement de hauteur. Suggestion  8 secondes, assez pour que l’orbite s’achève.

1.3 Des battements à la seconde près pour les plans-séquences

Le guide d’utilisation officiel de Kling 3.0 écrit les plans-séquences comme des battements à la seconde près  à la 4e seconde la caméra accélère, à la 8e elle pousse vers un medium shot, à la 12e la musique et le mouvement culminent — épinglez chaque tournant d’action et de caméra sur la ligne de temps et le modèle joue au rythme. L’exemple ci-dessous est l’échantillon phare officiel, verbatim. Notez la différence avec le storyboard à plans numérotés  les battements à la seconde près conviennent à un plan sans coupure  les numéros de plan conviennent au découpage multi-angles.

Une course sous les étoiles de 15 secondes en un seul plan (échantillon officiel)

Prompt

Ouverture sur un plan moyen-long ultra grand-angle en tracking horizontal, le stabilisateur près du sol, dans un ton romantique cinématographique très contrasté de nuit bleu froid et de ciel étoilé blanc argenté, dégageant un fort réalisme poétique et un tempérament épique classique. La protagoniste est une jeune femme en longue robe vert foncé, courant à toutes forces sur la pelouse du jardin éclairée par la lune  sa jupe ondule dans le vent formant des courbes dynamiques, elle serre une petite fleur blanche dans sa main droite et relève le bas de sa robe de la main gauche, respirant vite mais le regard ferme. À la 4e seconde, la caméra accélère avec elle, et plusieurs hommes et femmes en robes de bal d’époque font irruption dans le cadre l’un après l’autre depuis les côtés gauche et droit en arrière-plan, courant à ses côtés — certains tentent de s’approcher, d’autres se retournent pour crier, mais personne ne la touche vraiment, suggérant la poursuite et la fuite. À la 8e seconde, la caméra zoome progressivement vers un medium shot, effectue un pan pour suivre devant la protagoniste et s’élève légèrement  elle jette un bref regard en arrière vers un jeune personnage masculin derrière elle, leurs regards se croisent une fraction de seconde, les émotions explosent en pleine course, et la femme et l’homme se prennent par la main pour courir ensemble. À la 12e seconde, la musique et le mouvement atteignent un sommet  la caméra avance près de son profil et de ses cheveux qui flottent, elle relâche la fleur blanche et la lance en l’air, la fleur descendant au ralenti tandis que la foule derrière la frôle. Dans les 3 dernières secondes, la caméra continue d’avancer, la femme et l’homme percent la foule et foncent vers le ciel étoilé au bout du jardin, leurs silhouettes envahissant progressivement le centre du cadre. L’atmosphère générale est flamboyante, romantique et résolue, une bouffée de narration sur le destin, le choix et la liberté.

Nécessite 1 image de première frame (le jardin / la femme qui s’élance)  l’audio natif est pré-activé. « À la Nᵉ seconde + un tournant d’action ou de caméra » est la notation officielle des battements de plan-séquence — c’est l’échantillon phare du guide d’utilisation de kling.ai, verbatim.

02 Audio natif

La génération d’effets sonores et de dialogues est la tête de proue de Kling 3.0  pluie, vent, pas et répliques parlées sont générés en même temps que l’image, automatiquement synchronisés — aucun doublage en post-production. Plus rares encore, les langues et dialectes — l’anglais, l’espagnol, le cantonais sont tous interprétés avec ton et attitude. L’écriture est tout aussi directe  comme pour l’image, plus vous êtes précis sur le son, plus le résultat est précis. Tous les exemples de ce chapitre ont l’audio natif pré-activé.

2.1 Effets sonores d’ambiance

Écrivez les effets sonores comme « nommez-les + empilez-les »  listez chaque son souhaité, puis précisez lequel est au premier plan et lequel est lointain. Si la pluie est la star, écrivez-la en premier, et laissez le tonnerre lointain garnir l’arrière-plan — laissez le son d’une scène vide et le modèle improvise, pas toujours l’ambiance que vous vouliez.

La pluie nocturne sur une cabane forestière

Prompt

La nuit, le porche d’une cabane en bois dans la forêt, une lumière jaune chaleureuse brillant aux fenêtres. Une pluie battante tambourine densément sur les avant-toits et les feuilles, et le ruissellement s’écoule du bord du porche en chapelets de perles. Caméra statique encadrant un seul coin du porche et le rideau de pluie. Audio  de près, de denses gouttes martelant le toit en bois et le tic des gouttes frappant les flaques  au loin, un grondement de tonnerre grave et occasionnel — l’ambiance générale calme et réparatrice. Gardez la vidéo sans sous-titres.

Empilez l’audio — son principal proche → sons de détail → fond lointain — et terminez par un mot d’ambiance. Suggestion  5 secondes, audio natif pré-activé.

2.2 Dialogue des personnages

La notation officielle du dialogue est « personnage (indication de ton)  réplique » — nommez d’abord chaque locuteur, mettez le ton entre parenthèses, et faites suivre les mots exacts. Dans les scènes multi-personnages, nommez les quatre locuteurs un à un et le modèle assigne les voix et synchronise les lèvres automatiquement. Plus la réplique est courte, plus la synchronisation est stable.

Une famille de quatre devant la télé (échantillon officiel)

Prompt

Décor domestique avec un léger ronron du climatiseur du salon en arrière-plan pour une ambiance quotidienne réaliste. Maman (doucement, d’un ton surpris)  Wow, I didn’t expect this plot at all. Papa (à voix basse, en accord, d’un ton calme)  Yeah, it’s totally unexpected. Never thought that would happen. Garçon (d’un ton excité)  It’s the best twist ever! Fille (hochant la tête, d’un ton enthousiaste)  I can’t believe they did that!

L’échantillon officiel de dialogue à quatre personnages, verbatim  une courte réplique par personne avec une indication de ton entre parenthèses, et le ronron du climatiseur pose d’abord la scène du quotidien. Suggestion  10 secondes, audio natif pré-activé.

2.3 Dialogues multilingues et dialectes

C’est là que Kling 3.0 se démarque  les répliques peuvent être générées en espagnol, en cantonais et plus encore — avec accent et attitude spécifiables. La notation  avant la réplique, notez entre parenthèses « en espagnol » / « en cantonais » plus une description de ton, et gardez la réplique elle-même dans la langue cible, verbatim. Les deux exemples ci-dessous sont des échantillons officiels, verbatim.

Demander son chemin en espagnol à Madrid (échantillon officiel)

Prompt

La lumière du soleil inonde les vieilles rues de Madrid. Devant une boulangerie de quartier, une touriste chinoise et un touriste en hoodie gris s’avancent vers le vendeur, tous deux arborant un sourire poli. Touriste (parlant un peu lentement, avec un accent hésitant, en espagnol)  Disculpe, ¿dónde está la plaza mayor? Un vendeur espagnol aux cheveux blancs (se tournant légèrement et pointant vers l’avant, d’un ton léger et enjoué, en espagnol)  Por allí, a dos calles. Muy cerca. La touriste hoche la tête pour remercier. Le touriste hoche aussi la tête en accord et dit (en espagnol)  Muchas gracias. Le vendeur sourit et hoche la tête en réponse. Les deux touristes se retournent ensuite et marchent dans la direction indiquée.

« Parlant un peu lentement, avec un accent hésitant » est une caractérisation par la prestation — l’accent fait partie du jeu. Suggestion  10 secondes, audio natif pré-activé.

Blague de bureau en cantonais dans une tour de bureaux (échantillon officiel)

Prompt

Dans une tour de bureaux, l’homme se penche en arrière, l’air fatigué et méprisant, et dit en cantonais  「其实……我真系唔系好 buy 你呢个 logic 啰。成个 proposal 根本 align 唔到我哋个 core value。你个 flow 咁乱,点样去 convince 个 client 呀?不如你返去 re-think 下个 angle,听朝早我要见到个 final version。」

La réplique en cantonais reste non traduite, et les termes de travail anglais mêlés (logic / proposal / align) sont exactement la façon dont sonne le cantonais de Hong Kong — l’authenticité du dialecte vit dans des détails comme ceux-ci. Suggestion  10 secondes, audio natif pré-activé.

03 Image vers vidéo

Une image de première frame plus une description de mouvement, et Kling 3.0 donne vie à l’image. Une règle importante  le format de sortie suit automatiquement l’image de première frame — une image verticale donne une vidéo verticale, un carré donne un carré. Recadrez à votre format cible avant l’upload  c’est plus facile que de se battre dans le prompt. Le centre de gravité de votre prompt passe de la description de l’image à la description du mouvement et du son, parce que l’image existe déjà.

3.1 Donner vie à une photo

Un prompt image-to-video ne couvre que trois choses  ce qui bouge, comment ça bouge, et si la caméra bouge. N’imposez pas ce qui n’est pas dans l’image — « réveillez » plutôt ce qui s’y trouve déjà  cheveux qui flottent, nuages qui dérivent, un clignement et un sourire sont tous de petits mouvements à fort taux de réussite.

La personne d’une vieille photo cligne des yeux et sourit

Prompt

La personne sur la photo cligne lentement des yeux, le coin de ses lèvres s’élevant en un doux sourire tandis que son regard se pose vers la caméra, de fines mèches de cheveux agitées par une légère brise. La caméra reste fixe  l’éclairage et l’étalonnage des couleurs se reportent de la texture d’origine de la photo. Un mouvement subtil et naturel. Gardez la vidéo sans sous-titres.

Nécessite 1 image de première frame. Décrivez uniquement le mouvement, ne redécrivez jamais la scène — « reporter la texture d’origine de la photo » tient le style. Le format de sortie suit automatiquement votre image téléversée.

3.2 Vitrine produit

Pour les clips produit e-commerce, écrivez trois choses clairement  comment la caméra bouge, quels détails du produit reçoivent des close-ups, et ce que dit la voix off. Ajoutez « l’apparence du produit reste cohérente avec l’image » pour verrouiller les détails — Kling 3.0 préserve même le texte natif sur la bouteille, comme le montre intégralement l’échantillon officiel ci-dessous.

Une publicité de parfum dans un appartement parisien (échantillon officiel)

Prompt

Près de la fenêtre d’un appartement parisien, avec un doux piano français en BGM de fond, la lumière dorée de l’après-midi filtre à travers les volets sur le flacon de parfum, projetant une lumière et des ombres mouchetées. La caméra effectue un lent push-in depuis les pétales de rose épars, déplaçant la mise au point sur la taille facettée du flacon de parfum Kling. Voix off (voix féminine française langoureuse, accent britannique, débit lent)  Bathe in the golden hour. La caméra orbite autour du flacon de parfum au ralenti, capturant le jeu de lumière et d’ombre sur les lettres dorées et le corps du flacon. Voix off  Kling, a whisper of Parisian elegance. La caméra effectue un pull back et se fige sur la scène complète — le flacon de parfum Kling sur un piédestal de velours, les bâtiments parisiens faiblement visibles par la fenêtre. Voix off  Wrap yourself in luxury with every breath.

Nécessite 1 image produit du flacon  l’audio natif est pré-activé. La voix off porte une indication de timbre — « voix féminine française langoureuse, accent britannique, débit lent » — et les lettres dorées du flacon restent lisibles tout au long de l’orbite. L’échantillon publicitaire i2v officiel, verbatim.

04 Références d’éléments

Les références d’éléments (reference-to-video, r2v) verrouillent la cohérence des personnages et des éléments avec 2 à 4 images  donnez-lui différents angles et tenues du même personnage et le modèle construit un fichier d’identité complet qui survit à tout changement de scène. Référencez vos images dans le prompt comme « Image 1 », « Image 2 » — la plateforme gère automatiquement la syntaxe de citation  aucun symbole spécial n’est nécessaire. Règle stricte  2 à 4 images de référence — moins de 2 ne peuvent pas être soumises.

4.1 La formule de référence d’éléments

Un prompt de référence est une structure en trois parties  faites entrer les éléments en scène avec « Image N », décrivez ce qui se passe dans la nouvelle scène, puis terminez par une ligne de « rester cohérent ». L’ordre d’upload est l’ordre de numérotation — la première image est l’Image 1, la seconde est l’Image 2.

[Éléments  Image 1, Image 2…] + [description de la scène] + gardez l’[élément] cohérent

Requis

Éléments de référence

2 à 4 images, citées dans le prompt comme « Image N »  l’ordre d’upload est l’ordre de numérotation.

Facultatif

Description de la scène

Ce qui se passe dans la nouvelle scène  action, environnement, caméra.

Facultatif

Cohérence

Une ligne « rester cohérent avec les images de référence » renforce le verrouillage de l’apparence.

La vie quotidienne d’une mascotte de marque

Prompt

La petite mascotte baleine bleue des Image 1 et Image 2 apparaît dans une boulangerie lumineuse. Elle se dresse sur la pointe des pieds au comptoir, lorgnant avec curiosité un plateau de croissants fraîchement cuits, sa queue se balançant joyeusement. La caméra effectue un lent push-in, d’un medium shot à son visage. Gardez la mascotte identique aux images de référence. Sensation chaleureuse et saine, qualité d’animation 3D. Gardez la vidéo sans sous-titres.

Nécessite 2 à 4 images de référence (moins de 2 ne peuvent pas être soumises)  plusieurs angles du même personnage donnent les meilleurs résultats, et la plateforme gère la syntaxe de citation.

4.2 Combiner plusieurs éléments

Chaque image de référence reçoit un travail  l’Image 1 pour le protagoniste, l’Image 2 pour la co-star, l’Image 3 pour l’accessoire. Appelez chaque rôle par son numéro et le modèle ne les croisera pas — surtout quand personnes et accessoires sont mélangés, précisez à quoi sert chaque image.

Le clip de voyage d’un couple

Prompt

L’homme de l’Image 1 et la femme de l’Image 2 marchent côte à côte sur une allée de ginkgos en automne, des feuilles dorées dérivant dans le vent. Elle tend la main pour attraper une feuille et se tourne vers lui en riant  il lève son appareil photo et capture l’instant. La caméra les suit en douceur de côté. Les visages, coiffures et tenues des deux personnes restent identiques aux images de référence tout du long — pas d’échange de visage, pas de déformation. Tons chaleureux, naturel et vivant. Gardez la vidéo sans sous-titres.

Nécessite 2 à 4 images de référence. Dans les scènes à deux personnes, énoncez d’abord « Image 1 = qui, Image 2 = qui », et terminez par le verrou global — « pas d’échange de visage, pas de déformation » — pour prévenir la dérive. Suggestion  8 secondes.

05 Narration en longue durée

Kling 3.0 génère n’importe quelle durée entière de 3 à 15 secondes. Plus long n’est pas automatiquement mieux  5 secondes conviennent à l’itération rapide, 8 à 10 secondes tiennent une narration storyboardée, et 12 secondes et plus appartiennent à « un plan continu qui se joue en entier » — une action sans coupure, des scènes de dialogue complètes, les choses que les courtes durées ne peuvent pas contenir.

5.1 Un plan continu complet

La clé d’un plan continu long est de faire la queue des actions en ordre temporel  ce qui se passe d’abord, ce qui se passe ensuite, où cela atterrit à la fin — déroulez-le comme un mini scénario. L’échantillon officiel ci-dessous planifie aussi l’arc émotionnel sur la ligne de temps — du désespoir aux retrouvailles, toute une scène jouée en 15 secondes.

Des retrouvailles de dinosaure dans la tour de plâtre (échantillon officiel)

Prompt

C’est un plan-séquence cinématographique de 15 secondes, un seul plan sans coupure, sans transitions montées. La scène se déroule à l’intérieur d’une tour de statues de plâtre mouchetée de lumière et d’ombre, entourée de hautes sculptures de plâtre blanc, évoquant une atmosphère de mystère et d’oppression. Le plan s’ouvre sur la protagoniste qui s’arrête en dérapage au centre de la scène après une course effrénée, la poitrine haletante, l’expression hébétée et impuissante, la peur luisant dans ses yeux. La caméra orbite autour d’elle en un pan circulaire fluide à 360 degrés. Tandis que la caméra tourne, la protagoniste jette des regards anxieux autour d’elle et crie  "Alex! Alex where are you! Are you here?" Un cri de dinosaure adorable résonne alors en arrière-plan, et la caméra pousse par-dessus l’épaule de la protagoniste vers son dos — un petit dinosaure bébé, de taille petite à moyenne, adorable, sort de derrière un pilier de plâtre en poussant un gazouillis sucré. Surprise par le son, la protagoniste se retourne brusquement  en apercevant le dinosaure, elle éclate instantanément en larmes et se précipite sans hésiter pour le serrer étroitement dans ses bras. Le dinosaure se blottit docilement contre elle. En sanglotant, la protagoniste caresse doucement le dinosaure et tremble  "I found you! Thank God, I’m so scared!" L’éclairage et les ombres d’ensemble arborent une texture cinématographique, l’émotion passant du désespoir à des retrouvailles bouleversantes.

Nécessite 1 image de première frame (la tour de plâtre / la protagoniste)  l’audio natif est pré-activé. Ouvrez avec le contrat — « un plan-séquence de 15 secondes, un seul plan sans coupure, sans transitions montées » — puis faites la queue des actions et de l’arc émotionnel en ordre temporel. L’échantillon officiel de plan-séquence, verbatim.

Aide-mémoire des paramètres Kling 3.0

Voici tous les niveaux réellement proposés pour Kling 3.0 dans le générateur Molyin.

ModesTexte vers vidéo / Image vers vidéo / Référence vers vidéo
Résolutions720p / 1080p / 4k
Durée3–15 s
Formats16:9 / 9:16 / 1:1
AudioPris en charge
Première/dernière imagePris en charge
Images de référence2–4
Vidéos de référenceNon pris en charge
Audio de référenceNon pris en charge
Renvoyer la dernière imageNon pris en charge

FAQ

Les six façons les plus courantes de rater une vidéo — et les correctifs issus du guide d’utilisation officiel.