Tutoriel

Guide des prompts Seedance 2.0

La série Seedance 2.0 prend nativement en charge la génération audio-vidéo conjointe, avec une excellente compréhension sémantique et de puissantes capacités d’interaction multimodale. Ce tutoriel vous explique comment rédiger des prompts pour Seedance 2.0 et partage des techniques concrètes pour générer plus efficacement des vidéos de haute qualité, fidèles à votre intention.

Formule de base

Les modèles Seedance 2.0 peuvent utiliser simultanément des ressources vidéo, image et audio comme références, en verrouillant précisément l’apparence des personnages, les effets de mouvement, le style visuel, le timbre de voix, et bien plus. Cela réduit fortement la difficulté de rédaction des prompts : avec quelques formules de base simples, vous pouvez guider le modèle pour exploiter vos ressources multimodales et générer rapidement des vidéos adaptées à des besoins précis.

Le travail de référence vers vidéo se divise en trois types de tâches : référence multimodale, montage vidéo et extension vidéo. Choisissez la formule de base qui correspond à votre tâche.

Référence multimodale

Extrayez certains éléments de vos ressources (par exemple un sujet, un style, une scène ou un son) pour générer une toute nouvelle vidéo.

  • Idéal pour : transfert de mouvement, réutilisation d’un sujet, reprise d’une ambiance et tâches similaires
  • Structures recommandées :
  • Référence image : En vous référant au <Subject N> dans <Image N>, générez...
  • Référence vidéo : En vous référant au <motion / camera work / style / sound> dans <Video N>, générez...
  • Référence audio : En vous référant au timbre de voix dans <Audio N>, générez...

Montage vidéo

Effectuez des modifications locales ou globales à partir d’une vidéo existante. Par défaut, tout ce que vous ne mentionnez pas reste inchangé.

  • Idéal pour : remplacement local, suppression de sujet, modification d’attributs et tâches similaires
  • Structures recommandées :
  • Ajouter un élément : décrivez clairement les <element traits> + <when it appears> + <where it appears>
  • Modifier un élément : modifier strictement <Video N>, en remplaçant le <original trait> par le <new trait>
  • Supprimer un élément : nommez l’élément à retirer ; pour les éléments qui doivent rester inchangés, les mentionner explicitement dans le prompt améliore les résultats

Extension vidéo

Prolongez la vidéo d’origine sur l’axe temporel, en conservant la cohérence du style audiovisuel, des sujets et de la narration.

  • Idéal pour : poursuivre une intrigue, prolonger une action, compléter des segments manquants
  • Structures recommandées :
  • Étendre une vidéo : Étendre <Video N> vers l’avant/l’arrière, en générant...
  • Compléter une piste : <Video 1> + <transition description> + puis <Video 2> + <transition description> + puis <Video 3>

Remarque

Pour les tâches de montage / extension, désignez directement la vidéo comme <Video N>. N’écrivez pas « en vous référant à <Video N> », car la tâche pourrait être classée à tort comme une tâche de référence.

Tâches combinées

Les trois types de tâches ci-dessus peuvent aussi être combinés.

  • Idéal pour : utiliser une ressource comme référence tout en en modifiant une autre
  • Structure recommandée : En vous référant à la [reference dimension] de <Image/Video N>, modifier strictement <Video X>, [specific edits]

Exemples de prompts

Exemples de prompts pour différents scénarios avec Seedance 2.0, afin de vous aider à maîtriser le contrôle par référence multimodale et la génération de texte. Choisissez la structure la plus proche de votre tâche et adaptez-la.

Génération de texte

Slogans

Modèle de prompt :

「contenu du texte」+「moment d’apparition」+「emplacement d’apparition」+「mode d’entrée」,「caractéristiques du texte (couleur, style)」

Conseil

Seedance 2.0 adapte automatiquement un style de texte approprié au contexte. Si vous avez des exigences strictes sur l’apparence du texte, consultez « Référence multi-image → Référence de logo » ci-dessous.

Supports de référence

Image 1
Image 1

Résultat

Prompt

Style bande dessinée dessinée à la main. Trois personnes sont assises ensemble et mangent le poulet frit de l’Image 1, dans une atmosphère chaleureuse et conviviale. L’image devient ensuite progressivement floue, puis le texte « 快乐尽在 Seedance » (« Toute la joie est dans Seedance ») apparaît au centre du cadre.

Sous-titres

Modèle de prompt :

Des sous-titres apparaissent en bas de l’image, avec le texte « … », parfaitement synchronisés avec l’audio.

Résultat

Supports de référence

Tutorial illustration

Prompt

Générer une vidéo avec voix off. Une voix masculine grave et calme dit : « Dans l’immensité du cosmos, notre monde n’est qu’un instant fugace. Et pourtant, la vie y prospère envers et contre tout. » La scène passe lentement de la nuit à l’aube : les étoiles s’estompent tandis que le soleil se lève derrière les montagnes. Des sous-titres apparaissent en bas de l’image en suivant la narration.

Résultat

Supports de référence

Tutorial illustration

Prompt

Les deux personnes de l’image discutent dans un bureau. La femme parle en premier : « 你每次卡点到,是不是很享受这种刚刚好的感觉? » (« Tu arrives toujours pile à l’heure : tu aimes vraiment jouer avec la limite, non ? ») L’homme répond avec un sourire : « 我有我的节奏 » (« J’ai mon propre rythme »). La conversation est décontractée et naturelle, avec des sous-titres de dialogue correspondants en bas de l’image.

Bulles de dialogue

Modèle de prompt :

「Personnage」 dit : « … » ; pendant qu’il parle, une bulle apparaît à côté de lui avec la réplique écrite à l’intérieur.

Résultat

Supports de référence

Tutorial illustration

Prompt

Les deux personnes de l’Image 1, en tenue de sport, courent sur la piste de l’école. La fille regarde le garçon et dit avec un sourire confiant : « On peut vraiment y arriver ! » Cut sur un gros plan du garçon, qui répond avec hésitation : « Tu es sûre ? » Retour sur un plan rapproché taille de la fille, qui dit d’un ton lumineux : « Oui ! » — avec énergie et assurance. Une bulle apparaît à côté de la personne qui parle, avec la réplique correspondante à l’intérieur.

Résultat

Supports de référence

Tutorial illustration

Prompt

En vous référant à la fille dans l’Image 1 et l’Image 2 : dans un champ de fraises, elle cueille une fraise, en prend une bouchée et dit avec un sourire : « Ça, c’est du vrai ! » Une bulle apparaît autour d’elle avec la réplique écrite à l’intérieur.

Référence image

Seedance 2.0 prend en charge les références de sujet multi-vues ainsi que les références multi-images, comme les images de scène et les storyboards.

Si l’ordre des images est important, importez-les dans l’ordre et mentionnez-les précisément dans le prompt comme Image 1, Image 2, … Image n.

Référence de sujet multi-vues

Il suffit d’indiquer clairement la cible de référence : le modèle comprend des instructions comme celles-ci, entre autres. Produits :

Électronique grand public

Résultat

Supports de référence

Tutorial illustration

Prompt

Extraire l’appareil photo de l’Image 1, de l’Image 2 et de l’Image 3, puis remplacer l’arrière-plan par du blanc. L’appareil photo est posé sur une table blanche ; l’objectif fait la mise au point en gros plan, puis tourne lentement autour de lui comme sujet principal, en montrant clairement l’avant, les côtés et l’arrière.

Maison

Résultat

Supports de référence

Tutorial illustration

Prompt

Dans une scène d’intérieur aux tons chaleureux, un plan moyen présente le thermos des images de référence. La caméra avance en douceur jusqu’à un gros plan ; une main entre naturellement dans le cadre, saisit le corps du thermos et le soulève, tandis que la caméra suit la légère rotation de la main pour montrer le produit.

Personnages :

Supports de référence

Tutorial illustration

Résultat

Prompt

En vous référant à la femme dans l’Image 1, l’Image 2 et l’Image 3, générez une scène où elle mange un gâteau dans un café.

Référence multi-image

Référence de logo

Résultat

Supports de référence

Tutorial illustration

Prompt

Le décor est une passerelle aérienne éclairée au néon dans une ville du futur, avec des aéronefs qui serpentent entre des publicités holographiques. En vous référant à la fille de l’Image 2 : d’abord un plan moyen où elle libère une lanterne volante argentée portant une projection holographique, puis la caméra recule pour révéler un ciel rempli de lanternes flottantes. L’image devient progressivement floue, puis le logo de l’Image 1 apparaît. Style général : animation 3D de science-fiction cyberpunk.

Référence multi-sujets

Résultat

Supports de référence

Tutorial illustration

Prompt

En vous référant au chat et au chien dans les images : dans un appartement cosy, le chien est couché et mange dans sa gamelle ; le chat s’approche et lui donne un petit coup de patte ; le chien s’arrête de manger en voyant le chat, puis le chat vient se blottir contre lui. Palette de couleurs chaleureuse.

Référence multi-éléments

Résultat

Supports de référence

Tutorial illustration

Prompt

La scène se déroule dans le restaurant de l’Image 4, animé par de nombreux clients. La fille de l’Image 1, habillée avec la tenue de l’Image 2, range des objets sur le comptoir. Le garçon de l’Image 3 est un client ; il s’approche, espérant demander ses coordonnées à la fille. Le logo de l’Image 5 reste visible dans le coin inférieur droit de l’image du début à la fin.

Référence storyboard multi-cases

Résultat

Supports de référence

Tutorial illustration

Prompt

En vous référant au storyboard dans l’image, générez une scène de combat intense. La composition de chaque case apparaît dans l’ordre, puis les deux personnages se battent avec acharnement.

Référence storyboard

Résultat

Supports de référence

Tutorial illustration

Prompt

En vous référant au cadrage de la case Image 3 : une fille attend que son père finisse de cuisiner et dit : « 아빠, 배고파요! 밥 다 됐어요? » — son apparence fait référence à l’Image 1. La caméra effectue ensuite un panoramique vers la droite et passe au cadrage de l’Image 4 ; le père, dont l’apparence fait référence à l’Image 2, répond : « 거의 다 됐어, 조금만 기다려! » Retour en gros plan sur le visage légèrement déçu de la fille qui dit : « 아직 멀었어요? 맛있는 냄새 나는데… » Puis cut sur un gros plan du père, qui dit : « 이제 진짜 금방이야。 "빨리빨리" 하지 말고 손부터 씻고 와! »

Référence vidéo

Seedance 2.0 prend en charge la référence vidéo : indiquez simplement de façon explicite ce qu’il faut générer et ce qu’il faut utiliser comme référence.

Si l’ordre des vidéos est important, importez-les dans l’ordre et mentionnez-les précisément dans le prompt comme Vidéo 1, Vidéo 2, … Vidéo n.

Référence d’action

Cinéma et télévision

Résultat

Supports de référence

Vidéo 1
Tutorial illustration

Prompt

En vous référant aux mouvements de personnage et au langage de prise de vue de la Vidéo 1, générez une scène de combat entre l’Image 2 et l’Image 1 : l’Image 2 est la personne à gauche, l’Image 1 la personne à droite. Musique de fond intense.

Marketing

Résultat

Supports de référence

Vidéo 1

Prompt

En vous référant à la posture de galop du cheval dans la Vidéo 1, générez un destrier doré galopant à travers une prairie, puis figez sa magnifique pose de course lorsqu’il se transforme en pendentif en or en forme de cheval.

Référence de mouvement de caméra

Résultat

Supports de référence

Vidéo 1
Image 1
Image 1

Prompt

En vous référant au mouvement de caméra de la Vidéo 1, réalisez une vidéo conceptuelle d’un parc technologique : l’immeuble de grande hauteur de l’Image 1 est le centre visuel, avec la même plongée en vue subjective, pour transmettre l’atmosphère futuriste du campus de l’Image 1.

Référence d’effets

Cinéma et télévision

Résultat

Supports de référence

Vidéo 1
Image 1
Image 1

Prompt

En vous référant à l’effet de particules dorées dans la Vidéo 1 : lorsque le personnage de l’Image 2 joue de la flûte, le même effet de particules tourbillonne autour de lui.

Effets originaux

Résultat

Supports de référence

Vidéo 1
Image 1
Image 1

Prompt

En vous référant à l’effet de la Vidéo 1, donnez à la fille de l’Image 1 les mêmes ailes, avec une trajectoire de croissance des ailes identique.

Montage vidéo

Seedance 2.0 prend en charge le montage vidéo : ajout, suppression ou modification d’éléments ; extension d’une vidéo vers l’avant ou l’arrière ; et complétion de piste.

Si l’ordre des vidéos est important, importez-les dans l’ordre et mentionnez-les précisément dans le prompt comme Vidéo 1, Vidéo 2, … Vidéo n.

Ajouter / supprimer / modifier des éléments

Ajouter des éléments

Résultat

Supports de référence

Vidéo 1

Prompt

Ajoutez du poulet frit, de la pizza et d’autres snacks sur le plan de travail dans la Vidéo 1.

Supprimer des éléments

Résultat

Supports de référence

Vidéo 1

Prompt

Débarrassez le bureau des autres pièces et outils dans la Vidéo 1, afin qu’il reste propre et ordonné : seuls les objets que les deux personnes tiennent en main restent visibles.

Modifier des éléments

Résultat

Supports de référence

Vidéo 1
Image 1
Image 1

Prompt

Remplacez le parfum dans la Vidéo 1 par la crème pour le visage de l’Image 1, en conservant les mouvements et le travail de caméra inchangés.

Extension vidéo

Remarque

Le modèle découpe automatiquement le segment de raccord pour le compositing : il ne regénère pas les séquences déjà présentes dans la vidéo d’entrée.

Étendre vers l’arrière

Résultat

Supports de référence

Vidéo 1

Prompt

Générez ce qui se passe après la Vidéo 1 : les deux hommes arrivés en retard courent vers eux, les cinq finissent par se retrouver et discutent chaleureusement.

Étendre vers l’avant

Résultat

Supports de référence

Vidéo 1

Prompt

Étendez la Vidéo 1 vers l’avant : plan par-dessus l’épaule de l’homme en blanc, qui dit : « Ce n’est pas si grave. Tu es juste stressée. Tout le monde traverse ça, il faut simplement continuer. »

Complétion de piste

Conseil

  • Seedance 2.0 accepte au maximum 3 vidéos d’entrée, pour une durée totale n’excédant pas 15 secondes.
  • La génération découpe automatiquement les segments de raccord des première et dernière vidéos, en ne conservant que ce qui est nécessaire au compositing.

Résultat

Supports de référence

Vidéo 1
Vidéo 2

Prompt

Vidéo 1 — à l’instant où la feuille touche le sol, elle soulève un effet de particules dorées ; une rafale de vent passe — puis Vidéo 2.

Formule avancée

Seedance 2.0 fonctionne essentiellement comme un réalisateur IA multimodal : il lit simultanément votre prompt textuel, vos images, vos vidéos et vos audios, puis les sépare en interne en une couche spatiale (ce qui se trouve dans le cadre) et une couche temporelle (comment les éléments évoluent dans le temps) pour comprendre et générer les séquences.

Un bon prompt n’est donc pas une accumulation d’adjectifs publicitaires, mais une instruction de type ingénierie : qui, dans quelle scène, fait quelle action, avec quel mouvement de caméra, dans quel ordre — chaque information étant transmise aux couches spatiale et temporelle. La formule :

Formule de prompt avancée : Sujet précis + Détails de l’action + Scène et environnement + Lumière et tonalité + Mouvement de caméra + Style visuel + Qualité d’image + Contraintes

En bref : commencez par verrouiller qui fait quoi, puis définissez et quelle ambiance, indiquez ensuite au modèle comment filmer, et enfin affinez le résultat avec des termes de style, de qualité et de contraintes. Chaque élément est détaillé ci-dessous.

1. Définir vos sujets

Une seule image de référence contient souvent plusieurs sujets. Pour référencer précisément un objet spécifique, vous devez définir vos sujets explicitement. Un sujet peut être une personne, un accessoire ou une scène.

  • Structure recommandée : Définir les [subject's core traits] dans <Image/Video N> comme <Subject N>
  • Exigences pour les traits principaux : utilisez 2 à 3 traits clairs, stables et statiques (vêtements, coiffure, apparence, catégorie) afin que le sujet soit identifiable sans ambiguïté
  • Exemples :
  • Définir la femme en robe rouge portant un chapeau de paille dans l’Image 1 comme Sujet 1
  • Définir la femme en robe rouge portant un chapeau de paille dans l’Image 1 comme Zhang Hong

Remarque

  • Mentionnez explicitement les sujets à chaque apparition : ne laissez pas la référence implicite. Deux usages sont pris en charge :
  • Pour les scènes simples sans sujets prédéfinis, écrivez <Subject N>@<Image N> à chaque apparition du sujet, afin de renforcer le lien entre le sujet et la ressource. Exemple : Zhang San@Image 1.
  • Pour les scènes avec sujets prédéfinis, continuez à utiliser le même libellé à chaque fois. Exemple : définissez le grand homme dans la Vidéo 1 comme le Policier et l’homme plus petit comme le Voleur, puis désignez-les systématiquement comme Policier et Voleur jusqu’à la fin.
  • Gardez des descriptions concises. Évitez les redondances et les conflits sémantiques, comme des traits contradictoires pour un même sujet.
  • Privilégiez l’expression des relations spatiales au moyen d’images de référence plutôt que de descriptions textuelles complexes.

2. Utiliser un découpage plan par plan

La représentation interne du modèle dissocie l’espace et le temps. Pour une vidéo complexe, la forme idéale du prompt est donc une chronologie de plans : divisez la vidéo en quelques plans et décrivez chacun dynamiquement, dans l’ordre des événements — qui + où + fait quoi + comment la caméra bouge.

Conseil pratique : rédigez un découpage simple « Plan 1 / Plan 2 / Plan 3 » pour la vidéo, puis fusionnez-le dans le prompt complet.

  • Exemple faible : « Un homme court nerveusement dans les rues ; l’image est très cinématographique. »
  • Exemple solide :
  • Plan 1 : Vue latérale d’une ruelle ; l’homme commence lentement à courir, avec une impression de respiration urgente.
  • Plan 2 : L’homme percute un étal de fruits ; la caméra fouette rapidement et se fixe sur un gros plan de son visage terrifié.
  • Plan 3 : L’homme saute par-dessus un muret et disparaît ; la caméra recule lentement et reste sur la rue vide.

Règles spécifiques

  • Utilisez des marqueurs comme Plan 1, Plan 2, Plan 3 et organisez le contenu dans l’ordre des événements (l’action principale d’abord). N’imposez pas de durée à chaque segment : laissez le modèle rythmer naturellement l’histoire.

Conseil

La prise en charge par le modèle d’un minutage précis (par exemple « 0–3 secondes ») est instable. Imposer des durées exactes peut produire des résultats anormaux.

Chaque plan est idéalement organisé dans cet ordre :

  1. Mouvement de caméra ou transition : p. ex. « plan large avec lente avancée », « caméra fixe », « cut vers… ».
  2. Action et expression du sujet : les actions clés et changements d’expression du personnage / objet principal.
  3. Position ou changement spatial : la scène, la position ou les relations spatiales du sujet.
  4. Informations audio : les effets sonores, dialogues ou la musique de fond de ce plan.

3. Description de l’action

  • Parties du corps précises + intensité quantifiée — Décrivez les actions jusqu’aux mains, jambes, tête, épaules et dos, et ajoutez amplitude, vitesse et force. Exemples : lève lentement une main, tourne rapidement la tête, pousse fortement sur le sol avec le pied, baisse légèrement la tête.
  • Privilégier les petits mouvements lents, doux et continus — Favorisez les micro-actions lentes, souples et enchaînées ; évitez les sprints, grands sauts, roulades violentes et autres mouvements très explosifs ou de grande amplitude. Exemples : marcher lentement, lever doucement une main, baisser légèrement la tête, s’asseoir d’un mouvement fluide.
  • Décrire les transitions entre actions — Précisez l’élan et le passage d’une action à l’autre pour conserver la cohérence du mouvement. Exemples : utilise l’élan du demi-tour pour lever la main, passe naturellement de l’immobilité au geste de lever la main.
  • Extérioriser l’émotion par des détails physiques — Exprimez l’émotion avec des détails corporels concrets plutôt qu’avec des mots abstraits comme « très triste » ou « furieux ». Voir le tableau ci-dessous :
Émotion abstraiteActions et détails extériorisés
TristesseTête baissée, épaules qui tremblent légèrement, yeux qui rougissent, doigts agrippant inconsciemment l’ourlet des vêtements, larmes aux yeux sans tomber
JoieCoins de la bouche qui se relèvent malgré soi, sourcils et regard détendus, pas plus légers, fredonne inconsciemment un air, ne peut s’empêcher de tourner sur place
Nervosité / anxiétéRegarde fréquemment sa montre, doigts tapotant la table sans arrêt, respiration rapide, regard fuyant, se ronge inconsciemment les ongles
ColèrePoings serrés, mâchoire crispée, poitrine qui se soulève violemment, regard tranchant comme une lame, mots arrachés entre les dents
SoulagementLongue expiration, épaules tendues qui se relâchent complètement, léger sourire longtemps retenu qui apparaît, regard qui se lève vers l’horizon

4. Mouvement de caméra

Le modèle comprend très bien le vocabulaire de caméra : utilisez directement les termes standards du cinéma, par exemple « plan moyen, gros plan, plan large, lente avancée, travelling latéral fluide, caméra fixe ».

Remarque

Indiquez un seul mouvement de caméra par plan. Demander simultanément une avancée, un recul, un panoramique et un travelling augmente l’instabilité de l’image.

5. Qualité, style et contraintes

Les termes de qualité, de style et de contrainte sont essentiels pour contrôler la sortie. Ils définissent les limites créatives du modèle, unifient la qualité d’image et la direction artistique, et réduisent les défauts visuels ainsi que les dérives aléatoires : un paramétrage nécessaire pour des résultats stables et conformes.

1. Qualité d’image — définit la netteté, la richesse des détails et la sensation de lumière, en élevant le niveau de qualité de base de la sortie. Exemple : haute définition, détails riches, texture cinématographique, couleur naturelle, éclairage doux.

2. Style — fixe la direction artistique générale et le ton visuel, en unifiant l’atmosphère artistique. Exemple : palette cyberpunk bleu-violet froide, film vintage, tons frais de style japonais.

3. Contraintes — extrêmement importantes. Les contraintes réduisent efficacement les défauts visuels, les déformations et les éléments incohérents, encadrent la génération et améliorent la stabilité. Modèles courants :

  • Éviter les sous-titres : « garder la vidéo sans sous-titres », « éviter de générer du texte ou des sous-titres »
  • Éviter les logos : « ne pas générer de logos »
  • Éviter les filigranes : « ne pas générer de filigranes »

6. Exemples détaillés

Deux exemples montrant comment la formule avancée et ses éléments se combinent dans un prompt réel.

Ressources :

  • @Image 1 : photo mi-corps de la fille principale
  • @Image 2 : image de référence de scène de dortoir
  • @Video 1 : référence de caméra pour dialogue en intérieur (plan moyen avec avancée/recul ou léger panoramique)
  • @Audio 1 : ambiance intérieure ou musique légère

Prompt

La fille dans @Image 1 est le personnage principal ; @Image 2 sert de référence de style pour la scène de dortoir ; le travail de caméra fait référence à @Video 1. Plan 1 : Au crépuscule, la fille @Image 1 marche d’un pas vif jusqu’à la porte du dortoir @Image 2. Suivi stable en plan moyen ; une lumière jaune et chaude entre dans le couloir par la fenêtre. Elle s’arrête devant la porte, inspire profondément, l’air légèrement nerveux. Plan 2 : La fille @Image 1 pousse la porte et entre. Cut sur un plan moyen en intérieur : ses colocataires lèvent les yeux en triant des livres, et l’une demande avec un sourire {Comment s’est passé l’examen ? Tu l’as réussi ?}. La caméra alterne lentement entre des plans rapprochés mi-corps du groupe. Plan 3 : La fille @Image 1 baisse d’abord la tête avec un air abattu — la caméra passe en gros plan sur elle — puis elle relève les yeux, incapable de retenir un sourire, éclate de rire et dit {Je vous ai bien eus}. Ses colocataires la poursuivent en riant ; la caméra recule lentement et reste sur un plan large du dortoir rempli de rires. Tout au long de la vidéo : rendu documentaire en haute définition, tons chauds, éclairage doux ; visages stables sans déformation, mouvements naturels et fluides, aucun à-coup ni scintillement ; l’ambiance sonore se mélange naturellement avec @Audio 1.

Conseils pratiques

Génération de texte

Seedance 2.0 peut générer du texte courant à l’écran. Le modèle adapte automatiquement un style et une couleur appropriés au contexte, et vous permet aussi de préciser dans le prompt la couleur, le style, l’animation d’entrée, le moment d’apparition et la position du texte. Pour un rendu optimal, privilégiez les caractères courants et évitez les caractères rares ainsi que les symboles spéciaux. Les scénarios actuellement pris en charge incluent les slogans, les sous-titres et les bulles de dialogue : consultez les exemples de Génération de texte ci-dessus pour des structures concrètes.

Étendre ou assembler

  • Long plan continu (extension vidéo) : idéal pour les scènes « calmes » centrées sur le dialogue dans un même lieu : longues conversations, montée émotionnelle, déplacement sur un trajet unique — pour une sensation immersive de plan-séquence.
  • Virages de scène / d’action (assemblage segmenté) : idéal pour les retournements d’intrigue ou les scènes d’action complexes et rapides : poursuites, combats, montages. Générez les segments séparément, puis assemblez-les au montage pour préserver le rythme et l’impact visuel.

Les vrais projets combinent généralement les deux : étendez d’abord pour obtenir une conversation cohérente, puis insérez des plans de coupe ou de transition afin de conserver l’immersion tout en variant le rythme.

Stratégie de configuration des ressources

Considérez vos ressources comme quatre rôles fonctionnels :

  1. Ancrage du personnage : verrouille l’apparence du personnage
  2. Définition du ton de scène : verrouille l’environnement et le style
  3. Référence de caméra : verrouille le langage de prise de vue et le rythme de l’action
  4. Rythme et ambiance : utilise l’audio pour contrôler l’émotion et le timbre de voix

Configuration recommandée (4 à 5 ressources au total) : 1 à 2 images de personnage (gros plan visage / corps entier) + 1 image de scène + 1 vidéo de référence caméra + 1 extrait audio.

Conseil

N’utilisez pas systématiquement le nombre maximal de ressources. Trop de ressources compliquent la priorisation des caractéristiques par le modèle, ce qui peut facilement provoquer des conflits de style, une identification floue des sujets et des résultats qui s’éloignent des attentes.

Bonnes pratiques d’utilisation

Cohérence linguistique

Gardez les dialogues dans une seule langue. Évitez de mélanger plusieurs langues dans une même réplique (noms propres exceptés).

Caractères spéciaux

Utiliser les symboles de manière cohérente aide le modèle à distinguer les différents types d’informations :

Type d’informationSymboleExemple
Musique()(Une musique rock rythmée joue en arrière-plan)
Effets sonores<><Un chien aboie au loin>
Dialogue{}{Bonjour, le monde}. Pour un dialogue dans une langue moins courante (hors chinois/anglais), indiquez la langue, par exemple : dit en japonais {こんにちは}.
Sous-titres / légendes【】【Chapitre 1 : Le départ】

FAQ

Dérive d’identité du personnage

Symptôme — Le personnage généré ne correspond pas à l’image de référence, ou son visage change au milieu de la vidéo (dérive d’identité), ce qui peut parfois déclencher les filtres de vérification s’il ressemble à une célébrité.

Cause principale — La référence du visage n’est pas assez efficace :

  • Images de référence mélangées : la référence du visage est fusionnée dans une seule image avec des poses en pied, des références de tenue ou des plans de détail.
  • Visage trop petit dans le cadre : dans une image de référence mélangée, le visage occupe une part trop faible de l’image ; le modèle sous-pondère donc les traits faciaux et se laisse distraire par l’arrière-plan ou d’autres éléments.

Solution — Renforcer l’indépendance et le poids de la référence visage :

  1. Préparer un gros plan visage dédié : en plus du plan en pied, ajoutez une image contenant uniquement la tête du personnage (portrait — visage seul, expression neutre de préférence, épaules/arrière-plan minimaux).
  2. Définir clairement le sujet dans le prompt : « Les traits du visage de Sujet 1 font référence à l’Image 1 (portrait) ; le maquillage et le styling font référence à l’Image 2 (plan en pied) ».
  3. Placer les ressources importantes en premier : plus une ressource doit être référencée précisément, plus elle doit apparaître tôt dans le prompt.

Remarque

Utilisez un portrait + un plan en pied pour la référence de personnage. Les planches multi-vues sont déconseillées : elles montrent la même personne sous plusieurs angles, ce que le modèle a tendance à interpréter comme plusieurs sujets différents, aggravant la dérive d’identité.

Avant

Le visage du personnage change en cours de vidéo et ressemble à une célébrité

Après

Le visage reste cohérent avec l’image de référence tout au long de la vidéo

Sous-titres indésirables

Symptôme — Le prompt ne demandait jamais de sous-titres, mais la vidéo générée en contient.

Conseil

Il n’existe actuellement aucun moyen d’empêcher les sous-titres dans 100 % des cas : les méthodes ci-dessous réduisent la probabilité et augmentent votre taux de réussite sur plusieurs essais.

  1. Ajoutez des contraintes explicites au prompt : « garder la vidéo sans sous-titres », « éviter de générer du texte ou des sous-titres ».
  2. Si le texte présent dans vos images/vidéos de référence n’est pas essentiel, supprimez-le d’abord (par exemple avec Seedream / l’édition image ou vidéo de Seedance), puis utilisez la ressource sans texte comme entrée.
  3. Lorsque votre cas d’usage le permet, générez d’abord en format paysage (les sous-titres apparaissent nettement moins souvent qu’en portrait), puis recadrez en portrait dans un logiciel de montage.

Apparition de logos / filigranes

Symptôme — Le prompt ne mentionnait jamais de filigranes, mais la vidéo générée contient des logos ou filigranes provenant d’autres plateformes vidéo.

Solution — Ajoutez des contraintes explicites au prompt : « ne pas générer de filigranes », « ne pas générer de logos ».

Dérive de style

Symptôme — Vous voulez une sortie anime 2D ou 3D, mais l’image de référence est plutôt photoréaliste et le prompt n’insiste pas sur le style ; le résultat peut donc dériver vers un rendu en prise de vues réelles.

Solution — Ajoutez des contraintes de style explicites, comme « style anime japonais 2D » ou « animation 3D de style chinois ». Pour un contrôle plus strict, convertissez d’abord l’image de référence dans le style cible, puis générez la vidéo à partir de celle-ci.

Avant

Le style xianxia dérive vers la prise de vues réelles

Après

Le style xianxia CG d’animation chinoise 3D reste stable

Saut aux raccords d’extension

Symptôme — Après avoir généré une extension et l’avoir raccordée à l’original, la jonction peut montrer un saut visible ou un retour en arrière dans le contenu.

Solution — Pour l’instant, corrigez en postproduction en alignant les images clés (une correction de fond arrivera avec une itération du modèle) :

  1. Importez les clips à raccorder dans CapCut ou un autre logiciel de montage.
  2. Au premier raccord, coupez 6 images à la fin du clip précédent.
  3. Coupez également 1 image au début du clip suivant.
  4. Répétez l’opération pour chaque point de raccord.
  5. Exportez et vérifiez que la vidéo assemblée se lit de manière fluide.

Conseil

Même avec les images alignées, de légers sauts peuvent subsister. Lorsque vous générez une suite, terminez le clip sur un moment de coupe de scène et laissez le clip suivant commencer depuis la nouvelle scène après la coupe.

Avant

Sauts d’image visibles / régression du contenu aux raccords (5 s, 20 s)

Après

Raccords beaucoup plus fluides

Le problème des « jumeaux »

Symptôme — Dans les scènes avec de nombreux personnages, surtout lorsqu’une planche de rotation de personnage (trois vues) est utilisée comme référence, un même cadre peut contenir deux copies identiques d’un personnage.

Cause principale :

  • Les sujets personnages ne sont pas clairement définis dans le prompt, le modèle ne peut donc pas distinguer précisément les rôles.
  • Les planches de rotation / multi-vues perturbent la reconnaissance des personnages et produisent des doublons similaires.

Conseil

Il n’existe actuellement aucun moyen d’empêcher les jumeaux dans 100 % des cas : les méthodes ci-dessous réduisent la probabilité et augmentent votre taux de réussite sur plusieurs essais.

  1. Lier chaque personnage à sa référence : définissez chaque personnage clairement et indiquez à quelle image il correspond, en gardant un format cohérent. Exemple : Zhang San (depuis l’Image 1) lance le livret vert à Li Si debout (depuis l’Image 2).
  2. Ajouter une contrainte globale à la fin du prompt : « Tout au long de la vidéo, ne jamais montrer de personnages ayant une apparence, des vêtements et des accessoires identiques ; aucun clone ni effet de jumeaux ; ne garder qu’une seule instance de chaque personnage par image ; aucun personnage dupliqué. »
  3. Optimiser les ressources de référence : privilégiez les photos d’une seule personne ; évitez les planches trois vues / multi-vues.
  4. Alléger le prompt : ne collez pas un script complet comme prompt ; les passages redondants perturbent le modèle. Supprimez le texte non pertinent et gardez des instructions ciblées.

Avant

Un « jumeau » apparaît à la 8e seconde

Après

Perte de qualité lors de l’extension

Symptôme — Utiliser une vidéo générée comme entrée pour une extension supplémentaire dégrade la qualité d’image. Les extensions répétées cumulent cette dégradation, avec des taches de couleur mouchetées qui apparaissent surtout sur les visages.

Solution — Mesures d’atténuation pour l’instant (une correction de fond arrivera avec une itération du modèle) :

  1. Convertissez d’abord la vidéo originale en rendu argile blanche avec Seedance 2.0, puis utilisez ce résultat comme entrée d’extension. Prompt de référence : « Convertir la vidéo en modèle 3D blanc : tous les personnages deviennent des modèles 3D entièrement blancs, sans couleur, sans texture, sans ombres, arrière-plan blanc pur, structure stable, mouvement fluide. »
  2. Privilégiez les images haute résolution comme ressources de référence.
  3. Limitez le nombre d’extensions en chaîne ; évitez d’empiler de nombreux cycles.

Avant

Extension directe de la sortie du modèle

Après

Conversion de la sortie en rendu argile blanche avant extension

Les effets ne correspondent pas aux attentes

Symptôme — Décrire un effet visuel précis en texte peut échouer. Exemple : le prompt demande « le nombre 2999 qui entre sous forme d’animation de compte à rebours », mais les chiffres générés défilent avec des sauts chaotiques au lieu d’un vrai compte à rebours.

Solution — Définir l’effet avec une vidéo de référence : fournissez un clip de l’effet cible afin que le modèle comprenne précisément sa forme et sa logique de mouvement. Exemple : « Le nombre 2999 entre de la même manière que dans la Vidéo 1. »

Avant

Supports de référence

Vidéo 1 — référence d’effet

L’effet de défilement des chiffres saute de manière chaotique

Après

Avec la bonne vidéo d’effet de défilement des chiffres ajoutée en entrée, le résultat correspond aux attentes

Trop de personnages de référence

Symptôme — Avec plus de 4 personnages de référence, la stabilité de sortie diminue : la vidéo peut afficher un nombre incorrect de personnes (manquantes ou en trop) ou des personnages dupliqués.

Solution — Mesures d’atténuation pour l’instant (une correction de fond arrivera avec une itération du modèle) :

  1. Générer des images de groupe par étapes : divisez les personnages en groupes de 4 maximum par image. Par exemple, 6 personnages peuvent être divisés en 2 groupes de 3, chaque groupe générant une image.
  2. Puis passer de l’image à la vidéo : utilisez ces images groupées comme ressources de référence pour générer la vidéo finale.

Avant

8 personnages en référence en entrée → 9 personnes en sortie

Après

8 personnages composés d’abord en 2 images, puis génération image-vers-vidéo

Le timbre de voix ne correspond pas à la référence

Symptôme — Lorsque vous utilisez un extrait audio de référence pour définir la voix, la voix de la vidéo générée peut s’écarter nettement du timbre de référence.

Solution :

  1. Ajoutez au prompt des descriptions détaillées du timbre de voix, par exemple : « parle avec la voix masculine d’âge mûr, grave, chaleureuse et légèrement rocailleuse de @Audio 1 ».
  2. Gardez le ton et le style de formulation du dialogue proches de l’audio de référence : cela améliore la fidélité et la stabilité du timbre.

Avant

Supports de référence

Audio 1 — audio d’entrée

La voix ne correspond pas à l’audio d’entrée

Après

Avec les traits de timbre décrits dans le prompt, la correspondance s’améliore nettement