01 La formule de base
HappyHorse 1.1 comprend la direction structurée qui, ce qu’ils font, comment la caméra bouge, où, dans quel ton. Ce chapitre décompose un bon prompt en cinq pièces réutilisables, puis démontre le squelette complet d’une scène de haute complexité avec un échantillon phare de 15 secondes. Posez le squelette correctement et chaque chapitre suivant n’en est qu’une extension. Une prémisse à retenir HappyHorse produit par défaut des vidéos avec son — laissez le son non écrit et le modèle improvise, donc chaque prompt devrait porter une couche audio.
1.1 La formule de base du prompt
Tout commence par une phrase le sujet et le mouvement sont les deux parties obligatoires caméra, environnement et style s’empilent au besoin. Tournez d’abord le clip dans votre tête, puis écrivez-le en suivant la formule. La durée est un réglage continu de 3 à 15 secondes — prévoyez exactement autant d’action que les secondes choisies. Une seconde action entassée signifie généralement que les deux jouent mal. L’audio est toujours actif donnez une ligne à l’ambiance et une aux effets, et le clip revient complet.
[Sujet] + [Mouvement] + facultatif [Caméra] [Environnement] [Style]
Sujet
La star du cadre — une personne, un animal ou un produit. Plus c’est précis, mieux c’est.
Mouvement
Ce que fait le sujet, avec les parties du corps et le rythme précisés les petits mouvements lents et continus sont les plus sûrs.
Caméra
Cadrage et mouvement de caméra close-up, push-in, dolly — un seul mouvement par plan.
Environnement
Décor et ambiance lieu, moment de la journée, éclairage, météo.
Style
Direction artistique et qualité d’image palette de couleurs, texture, netteté.
Une caravane sur les dunes
Prompt
Un désert au crépuscule. Une caravane de chameaux avance lentement le long de la crête d’une dune, les ballots sur le dos des chameaux se balançant à chaque pas, le meneur en cape rougeâtre marchant en tête. La caméra fait un dolly lent depuis un low angle de côté tandis que le soleil couchant étire les ombres des gens et des chameaux sur le sable, de fins grains s’écoulant le long du sol. Qualité cinématographique, palette dorée chaleureuse, riches détails. Audio des clochettes de chameau sonnant doucement à chaque pas, un bourdonnement bas de sable soufflé par le vent au loin, la respiration lourde occasionnelle d’un chameau.
Deux phrases pour le sujet et le mouvement, une pour la caméra, une pour l’environnement, puis les couches de style et d’audio pour conclure — voilà un prompt HappyHorse de base solide. Suggestion 1080p, 21:9.
Un tour F1 onboard de 15 secondes (échantillon phare)
Prompt
[Style et réglage caméra] Des images POV onboard de F1 ultra-photoréalistes, caméra montée directement derrière le casque du pilote sur l’arceau de sécurité, identiques à l’angle officiel de la caméra onboard F1. Le premier plan inférieur du cadre capture le casque du pilote, le nez complet et l’aile avant de la voiture s’étendant devant, avec des F1 rivales clairement visibles sur la piste. Simulation physique hyper-réaliste incluant la vibration authentique de la voiture, la flexion du châssis, le mouvement de la suspension et les rafales aérodynamiques. Qualité cinématographique 8K, étalonnage de diffusion réel, flou de mouvement sur les éléments rapides, fumée de pneus et débris de gomme à la surface de la piste. [0-4 secondes] La voiture jaillit d’un virage rapide à environ 280 km/h, le châssis tremblant violemment sous la vibration des vibreurs à la sortie du virage. Deux F1 rivales apparaissent droit devant, l’une légèrement à gauche et l’autre légèrement à droite, leurs diffuseurs arrière et leurs ailes arrière remplissant le cadre. Les mains gantées du pilote font des micro-corrections sur le volant, la voiture zigzaguant légèrement sous l’instabilité de freinage. Le rugissement du moteur est assourdissant, tout le cadre vibre d’intensité mécanique. Le crissement des pneus et le sifflement d’appui remplissent l’audio. Les détails de la surface de la piste, les marques de peinture et les lignes de roulage en gomme sont hyper-réalistes. [4-9 secondes] La voiture approche d’une chicane serrée à pleine vitesse de course, un freinage puissant fait plonger fortement le nez, toute la voiture frémissant sous une décélération de 5G. Le casque du pilote s’incline vers l’avant sous la charge de freinage. La voiture tourne brusquement à gauche puis immédiatement à droite à travers la chicane, le châssis roulant et lacetant avec un transfert de poids authentique, les pneus se déformant visiblement sous la charge latérale. Une voiture rivale est dépassée agressivement à l’intérieur du virage, les deux voitures se croisant à quelques centimètres l’une de l’autre, la turbulence du sillage faisant trembler violemment la caméra. De la fumée de pneu s’échappe des roues avant sous le freinage en traînée. [9-15 secondes] La voiture accélère fortement en sortant du dernier virage sur une longue ligne droite, les pneus arrière perdant momentanément leur adhérence causant un coup de talon arrière visible et un survirage, le pilote rattrapant le dérapage avec un contre-braquage net. La voiture se redresse et file sur la ligne droite à vitesse croissante, les deux voitures devant rapetissant au loin. Les foules des tribunes des deux côtés défilent floues à vitesse extrême. La note du moteur monte dans la plage de régime atteignant le limiteur, le pilote passant les vitesses aux palettes provoquant de nettes interruptions de couple. La caméra tremble en continu avec les imperfections de la surface et la turbulence aérodynamique. Le cadre final montre la voiture à pleine vitesse avec une brume de chaleur s’élevant de l’asphalte devant. [Amélioration de la qualité] Réalisme authentique d’images onboard F1, mouvement de véhicule basé sur la physique réelle, débattement de suspension et flexion de châssis véritables, comportement précis des pneus sous charge, audio réaliste du moteur et de l’aérodynamique, flou de mouvement cinématographique sur les éléments rapides, étalonnage fidèle à la diffusion, surface de piste hyper-réaliste avec billes de gomme et marques de pneus, vibration de caméra réaliste et continue sur tout le clip, aucun lissage artificiel appliqué.
Un échantillon phare validé, verbatim [Style et réglage caméra] pose le ton → des battements à la seconde près planifient l’action (0-4 / 4-9 / 9-15) → [Amélioration de la qualité] conclut, avec l’audio (moteur, crissement de pneus, flux d’air) écrit dans chaque battement — le squelette complet d’une scène complexe de 15 secondes.
1.2 Choisir parmi 9 formats
HappyHorse 1.1 propose neuf formats — le plus grand choix de Molyin 16:9, 9:16, 1:1, 4:3, 3:4, 4:5, 5:4, 21:9 et 9:21. Il n’y a qu’une seule règle pour choisir — partez à rebours de l’endroit où vous publierez le 16:9 pour la vidéo grand écran, le 9:16 pour les fils verticaux mobiles, le 4:5 ou le 1:1 pour les posts de fil, le 21:9 pour un look cinémascope, le 9:21 pour les expériences visuelles ultra-hautes. Décidez du format avant de générer recadrer après coup ne fait que jeter de la qualité.
Un solo dans le studio de répétition
Prompt
Un studio de répétition baigné de lumière matinale. Une danseuse contemporaine en tenue d’entraînement noire étire ses bras sur le plancher de bois, puis se lève sur pointes et tourne une fois, sa jupe s’évasant avec le tour avant d’atterrir dans une pose stable et contrôlée. Medium shot statique la lumière du matin oblique à travers de hautes fenêtres, une fine poussière dérivant dans les rais. Audio le frottement doux des chaussons de danse sur le bois, un bruissement de tissu au tour, un bruit sourd posé à l’atterrissage, et le ton calme de respiration de la pièce.
Pré-rempli en 9:16 vertical — le cadre standard des fils mobiles, et une silhouette en pied le remplit parfaitement la couche audio donne son souffle au studio silencieux.
1.3 Reproduire et itérer avec le seed
Le seed est la graine aléatoire de HappyHorse 1.1 — et l’une des capacités qui le démarquent. Verrouillez le seed et le même prompt reproduit un résultat très similaire changez un mot et vous voyez exactement ce que ce mot fait. Échangez le seed et le même prompt devient un lot frais de variations. Deux habitudes valent la peine d’être prises notez le seed quand un résultat accroche, et figez le seed pendant les tests A/B de formulation. Notez que la génération est probabiliste — le même seed ne garantit pas une sortie identique au pixel près, mais la composition et le sujet restent bien plus stables qu’un tirage aléatoire.
Un renard roux dans les bois enneigés
Prompt
Un renard roux trottine à travers une forêt de bouleaux couverte de neige. Il s’arrête soudain, oreilles dressées, à l’écoute — puis plonge tête première dans un congère, envoyant de la poudre voler. La caméra le suit en douceur en medium shot la lumière du soleil d’hiver oblique à travers les troncs et son haleine se condense en bouffées blanches dans l’air froid. Audio le craquement des pattes tassant la neige, le bruit sourd et étouffé du plongeon, le vent à travers les bouleaux, et un ou deux chants d’oiseaux lointains.
Pré-rempli avec le seed 42 — changez la formulation, gardez le seed, et comparez exactement ce que fait chaque ajustement la couche audio se teste en A/B de la même façon.
02 Lip-sync et répliques
Le lip-sync est le scénario phare de HappyHorse sur le playground officiel écrivez la réplique lettre par lettre entre guillemets, attachez la phrase « precise lip-sync », et le personnage la délivre à la caméra avec précision. Une réplique courte a besoin d’une phrase couvrant le ton et le cadrage une prestation plus longue se scinde en battements à la seconde près, une réplique par battement. Les deux exemples de ce chapitre sont des échantillons officiels validés.
2.1 La prestation du présentateur du journal
Une prestation multi-répliques s’écrit comme « réglage de caméra + battements à la seconde près + une réplique par battement » posez d’abord la scène et le cadrage, puis scindez à 0-5s et 5-10s avec une réplique et une petite action par battement (se tourner vers la deuxième caméra), et terminez en nommant « precise lip-sync » plus le ton de la pièce.
L’ouverture du présentateur du journal (échantillon officiel)
Prompt
Medium shot d’un présentateur professionnel de journal télévisé à un bureau élégant dans un studio de diffusion moderne, éclairage bleu froid, écrans doucement lumineux derrière. 0-5s Il regarde la caméra et dit d’une voix claire et mesurée, "Good evening. Tonight, a breakthrough that could change how millions of us work." 5-10s Il se tourne légèrement vers une deuxième caméra, "We’ll have the full story, and what it means for you, right after this." Precise lip-sync, ton subtil de salle de studio, qualité de diffusion nette, faible profondeur de champ.
L’échantillon lip-sync du playground officiel, verbatim deux répliques en 10 secondes scindées à 0-5s / 5-10s, la phrase « precise lip-sync » est obligatoire, et le ton de la salle donne son espace à la voix.
2.2 La syntaxe character et les saynètes verticales
La notation officielle des saynètes verticales nomme directement le personnage avec character1 « character1 fait quelque chose dans un décor, lève les yeux et dit en anglais la réplique » — une phrase emballe la scène, l’action, la langue et la réplique associez-la au 9:16 vertical et vous avez une saynète prête pour le fil.
Un guitariste à trois heures du matin (échantillon officiel)
Prompt
character1 dans une pièce intime et tamisée gratte une corde, lève les yeux et dit en anglais "This next one I wrote at three in the morning." Lumière pratique chaleureuse, intime, cinématographique, precise lip-sync.
L’échantillon officiel de la syntaxe character, verbatim character1 ouvre par son nom, « dit en anglais » épingle la langue, pré-rempli en 9:16 vertical — plus la réplique est courte, plus la synchronisation est stable.
03 Image vers vidéo
Une image de première frame plus une phrase sur le mouvement, et HappyHorse 1.1 donne vie à l’image — le centre de gravité de votre prompt passe de la description de la scène à la description du mouvement et du son, parce que la scène existe déjà. Une règle stricte à retenir la sortie image-to-video suit automatiquement le format de la première frame, sans sélecteur de format. Vous voulez un résultat 9:16 Téléversez une image 9:16. Le contrôle de la composition reste entre vos mains.
3.1 Donner vie à une photo
Un prompt image-to-video ne couvre que trois choses ce qui bouge, comment ça bouge, et si la caméra bouge. N’imposez pas ce qui n’est pas dans l’image — « réveillez » plutôt ce qui s’y trouve déjà un ourlet qui flotte, de l’eau qui coule, une lanterne qui se balance sont tous de petits mouvements à fort taux de réussite. Ajoutez une ligne comme « préserver la texture d’origine » et le style artistique ne dérivera pas. Écrivez la couche audio comme d’habitude — une image fixe ne porte aucune information audio propre.
Un canoë sur un lac au matin
Prompt
Donnez vie à cette photo une brume fine dérive lentement sur le lac, le canoë monte et descend doucement sur de petites ondulations, la lanterne suspendue à sa proue se balance légèrement, et un oiseau d’eau décolle des roseaux lointains et rase l’eau vers la droite du cadre. Gardez la caméra statique, préservant tout du long le look argentique aux tons froids de la photo. Audio de petites vagues clapotant contre la coque, le cliquetis métallique faible de la lanterne, les battements d’ailes de l’oiseau d’eau rasant la surface, le froissement des roseaux lointains.
Nécessite 1 image de première frame. Décrivez uniquement le mouvement, pas la scène — « préserver le look d’origine » tient le style, et la couche audio fournit ce qu’un cadre fixe n’a pas le format de sortie suit automatiquement la première frame.
3.2 Vitrine produit
Pour les clips produit e-commerce, écrivez deux choses clairement comment le produit bouge (rotation, lévitation, push-in) et comment la caméra joue le jeu. Ajoutez « l’apparence du produit reste cohérente avec l’image » pour verrouiller les détails, puis spécifiez l’éclairage et l’arrière-plan — « éclairage de studio, cadre propre » est la ligne de clôture passe-partout des vidéos produit. L’audio est le détail que les clips produit oublient le plus le clic d’un couvercle de boîte, une partition haut de gamme — de petites choses qui font bouger la conversion.
Un vase céladon vu en rond
Prompt
Le vase céladon de l’image repose devant un fond sans couture gris clair et tourne lentement à vitesse constante sur un tour complet, son émail craquelé jouant sous une lumière de studio douce. La caméra effectue un lent push-in, d’un medium shot à un close-up de l’épaule, révélant la finesse brillante de l’émail. L’apparence du produit reste cohérente avec l’image. Éclairage de studio, propre et premium. Audio le ton calme d’une galerie, soutenu par une partition d’ambiance minimaliste et premium.
Nécessite 1 image produit. « Rotation complète + push-in vers un close-up » est la combinaison standard de vitrine produit — une partition premium complète la pièce.
04 Référence vers vidéo
Quand les mots ne peuvent pas épingler un visage — un personnage, un produit, une mascotte — confiez-le aux images de référence. La reference-to-video de HappyHorse 1.1 n’accepte que des images, de 1 à 9, citées dans l’ordre d’upload comme « Image 1 », « Image 2 ». Le modèle verrouille l’apparence à partir de vos images tandis que la scène et l’action viennent entièrement de votre texte. La division du travail avec l’image-to-video est simple une image de référence n’est pas la première frame — c’est la fiche du personnage.
4.1 La formule de référence de personnage
Un prompt reference-to-video est une structure en trois parties faites entrer le matériau en scène avec « Image N », décrivez ce qui se passe dans la nouvelle scène, puis terminez par une ligne de « rester cohérent ». L’ordre d’upload est l’ordre de numérotation — la première image est l’Image 1, la seconde est l’Image 2. Les prises multi-angles du même personnage fonctionnent le mieux le modèle construit une « fiche de personnage » complète et le visage survit à tout changement de scène.
[Références Image 1…] + [description de la scène] + gardez le [sujet] cohérent
Références
Images uniquement, de 1 à 9, citées comme « Image N » dans l’ordre d’upload.
Description de la scène
Ce qui se passe dans la nouvelle scène action, environnement, caméra — l’image est générée de zéro, entièrement pilotée par vos mots.
Cohérence
Une ligne « rester cohérent avec la référence » renforce le verrouillage de l’apparence.
La vie quotidienne d’un astronaute en orbite
Prompt
Le chat en smoking de l’Image 1, portant une combinaison spatiale blanche, flotte lentement à l’intérieur d’un module de station spatiale. Curieux, il tend une patte pour toucher une goutte d’eau dérivante, tandis que la Terre bleue tourne lentement derrière le hublot. La caméra orbite sur un demi-tour autour de lui. L’apparence du chat et de la combinaison reste cohérente avec l’image de référence. Qualité d’animation 3D, riches détails. Audio le bourdonnement bas des équipements de la station, le tremblotement faible de la goutte dérangée, le silence particulier de l’apesanteur.
Nécessite 1 image de référence ou plus. « Image 1 » désigne votre image de personnage téléversée la conclusion « rester cohérent » est la phrase standard de verrouillage d’apparence, et la couche audio remplit le sens de l’espace de la capsule.
4.2 Combiner plusieurs images
Chaque image reçoit un travail une pour le personnage, une pour l’accessoire, une pour la tenue. Assignez chaque rôle dans l’ordre d’upload — « Image 1 », « Image 2 » — et le modèle ne les mélangera pas. Plus le matériau est important, plus tôt il doit apparaître dans le prompt le protagoniste passe toujours avant les accessoires.
Le lancer du bouquet
Prompt
La mariée de l’Image 1 se tient sur des marches en pierre couvertes de lierre et, en riant, lance le bouquet de pivoines blanches de l’Image 2 par-dessus son épaule plusieurs demoiselles d’honneur tendent les mains vers lui en souriant tandis que des pétales se dispersent dans l’air. Plan en contre-plongée vers le haut, la lumière de l’après-midi filtrant à travers les feuilles, chaleureux et naturel. Les apparences des personnes et du bouquet restent cohérentes avec les images de référence. Audio les acclamations et rires des invités, le froissement des pétales qui se dispersent, un chant d’oiseau faible au loin.
Nécessite 2 images de référence ou plus. Nommez chaque rôle explicitement — les personnes comme Image 1, l’accessoire comme Image 2 — pour que rien ne se croise ce sont les acclamations qui donnent vraiment vie au moment.
05 Édition vidéo
Réécrire une vidéo en langage naturel — c’est le terrain de HappyHorse Video Edit. Téléversez un clip source de 3 à 15 secondes et énoncez une seule instruction simple changez le style, changez la tenue, changez l’accessoire tout le reste reste intact. La durée de sortie et le format suivent automatiquement la vidéo source — il n’y a ni sélecteur de durée ni sélecteur de format. Vous pouvez aussi attacher jusqu’à 5 images de référence pour montrer au modèle en quoi changer les choses.
5.1 Transfert de style
Donnez à tout le clip une nouvelle peau artistique. La formulation de l’échantillon officiel est minimale une ligne — « recolorer toute la scène en utilisant le style de l’image de référence » — associée à une image de référence du style cible. L’image répond « changer en quoi » bien plus précisément que cent adjectifs. Sans image de référence, nommez trois traits du style cible en mots — coup de pinceau, texture, palette.
Recolorer par image de référence (échantillon officiel)
Prompt
Recolorez la scène en utilisant le style de l’image de référence. Gardez le mouvement de caméra, la composition et le rythme de la vidéo d’origine inchangés — seuls l’étalonnage des couleurs et la texture artistique changent pour correspondre à la référence.
Nécessite 1 vidéo source de 3 à 15 secondes + 1 image de référence du style cible cet exemple bascule automatiquement sur Video Edit, et la durée et le format suivent la source. La formulation centrale de l’échantillon de recoloration officiel — le style va à l’image de référence, la narration reste intacte.
5.2 Remplacement d’éléments
Échangez des vêtements, des accessoires ou des produits sans toucher au reste des séquences énoncez clairement quoi remplacer par quoi, puis terminez par « tout le reste reste inchangé ». Pour les remplacements, une image de référence cloue le nouveau look — « le cardigan beige de l’Image 1 » bat cent adjectifs.
Remplacer la veste par un cardigan
Prompt
Remplacez la veste de la personne dans la vidéo par le cardigan en maille beige de l’Image 1. Le tissu doit se froisser naturellement avec le mouvement, et la texture et la direction de l’éclairage doivent correspondre aux séquences d’origine. Tout le reste reste inchangé.
Nécessite une vidéo source, plus jusqu’à 5 images de référence. « Remplacer A par B + tout le reste reste inchangé » est la formulation de remplacement la plus fiable.