Tutorial

Guía de prompts de Seedance 2.0

La serie Seedance 2.0 admite de forma nativa la generación conjunta de audio y vídeo, con una comprensión semántica sobresaliente y potentes capacidades de interacción multimodal. En este tutorial aprenderás a escribir prompts para Seedance 2.0 y descubrirás técnicas prácticas para generar con más eficiencia vídeos de alta calidad que se ajusten a tu visión.

Fórmula básica

Los modelos de Seedance 2.0 pueden usar simultáneamente recursos de vídeo, imagen y audio como referencia, fijando con precisión la apariencia de los personajes, los efectos de movimiento, el estilo visual, el timbre de voz y mucho más. Esto reduce drásticamente la dificultad de escribir prompts: con unas cuantas fórmulas base sencillas, puedes guiar al modelo para que aproveche tus recursos multimodales y genere rápidamente vídeos adaptados a necesidades concretas.

Los flujos de trabajo de referencia a vídeo se dividen en tres tipos de tareas: referencia multimodal, edición de vídeo y extensión de vídeo. Elige la fórmula base que corresponda a tu tipo de tarea.

Referencia multimodal

Extrae elementos concretos de tus recursos (como un sujeto, un estilo, una escena o un sonido) y genera un vídeo completamente nuevo.

  • Ideal para: transferir movimiento, reutilizar sujetos, tomar prestada una atmósfera y tareas similares
  • Patrones recomendados:
  • Referencia de imagen: Tomando como referencia el <Subject N> de <Image N>, genera...
  • Referencia de vídeo: Tomando como referencia el <motion / camera work / style / sound> de <Video N>, genera...
  • Referencia de audio: Tomando como referencia el timbre de voz de <Audio N>, genera...

Edición de vídeos

Realiza modificaciones locales o globales sobre un vídeo existente. Todo lo que no menciones se mantiene sin cambios de forma predeterminada.

  • Ideal para: sustitución local, eliminación de sujetos, cambios de atributos y tareas similares
  • Patrones recomendados:
  • Añadir un elemento: describe claramente los <element traits> + <when it appears> + <where it appears>
  • Modificar un elemento: Edita estrictamente <Video N>, cambiando el <original trait> por el <new trait>
  • Eliminar un elemento: indica el elemento que quieres quitar; para los elementos que deban permanecer sin cambios, mencionarlos explícitamente en el prompt mejora los resultados

Extensión de vídeos

Continúa el vídeo original en el eje temporal, manteniendo la coherencia del estilo audiovisual, los sujetos y la narrativa.

  • Ideal para: continuar una historia, prolongar una acción, completar segmentos que faltan
  • Patrones recomendados:
  • Extender un vídeo: Extiende <Video N> hacia delante/atrás, generando...
  • Completar pista: <Video 1> + <transition description> + luego <Video 2> + <transition description> + luego <Video 3>

Nota

Para tareas de edición o extensión, menciona el vídeo directamente como <Video N>. No escribas «tomando como referencia <Video N>», porque la tarea podría clasificarse por error como una tarea de referencia.

Tareas combinadas

Los tres tipos de tareas anteriores también pueden combinarse.

  • Ideal para: usar un recurso como referencia mientras editas otro
  • Patrón recomendado: Tomando como referencia la [reference dimension] de <Image/Video N>, edita estrictamente <Video X>, [specific edits]

Ejemplos de prompts

Ejemplos de prompts para distintos escenarios con Seedance 2.0, pensados para ayudarte a dominar el control de referencias multimodales y la generación de texto. Elige el patrón más parecido a tu tarea y adáptalo.

Generación de texto

Eslogans

Plantilla de prompt:

「contenido del texto」+「cuándo aparece」+「dónde aparece」+「cómo entra」,「rasgos del texto (color, estilo)」

Consejo

Seedance 2.0 adapta por sí solo un estilo de texto adecuado al contexto. Si tienes requisitos estrictos sobre el aspecto del texto, consulta más abajo «Referencia de varias imágenes → Referencia de logotipo».

Materiales de referencia

Imagen 1
Imagen 1

Resultado

Prompt

Estilo de cómic dibujado a mano. Tres personas se sientan juntas a comer el pollo frito de la Imagen 1, en un ambiente cálido y amistoso. Después, el encuadre se desenfoca gradualmente y aparece en el centro el texto «快乐尽在 Seedance» («La alegría está en Seedance»).

Subtítulos

Plantilla de prompt:

Aparecen subtítulos en la parte inferior del encuadre con el texto «…», perfectamente sincronizados con el audio.

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Genera un vídeo con voz en off. Una voz masculina profunda y serena dice: «En la inmensidad del cosmos, nuestro mundo no es más que un instante fugaz. Y, sin embargo, en él, la vida prospera contra todo pronóstico». La escena transiciona lentamente de la noche al amanecer: las estrellas se apagan mientras el sol asoma tras las montañas. Aparecen subtítulos en la parte inferior del encuadre siguiendo la narración.

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Las dos personas de la imagen charlan en una oficina. La mujer habla primero: «你每次卡点到,是不是很享受这种刚刚好的感觉?» («Siempre llegas justo a tiempo; ¿te gusta vivir tan al límite?»). El hombre responde con una sonrisa: «我有我的节奏» («Tengo mi propio ritmo»). La conversación resulta informal y natural, con subtítulos de diálogo sincronizados en la parte inferior del encuadre.

Bocadillos de diálogo

Plantilla de prompt:

「Personaje」dice: «…»; mientras habla, aparece junto a él/ella un bocadillo con la frase escrita dentro.

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Las dos personas de la Imagen 1, vestidas con ropa deportiva, corren por la pista del colegio. La chica mira al chico y dice con una sonrisa segura: «¡Seguro que podemos hacerlo!». Corte a un primer plano del chico, que responde con duda: «¿Estás segura?». Corte de vuelta a un plano medio corto de la chica, que dice con energía: «¡Sí!», con tono optimista y firme. Aparece un bocadillo junto a quien está hablando, con la frase correspondiente dentro.

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Tomando como referencia a la chica de la Imagen 1 y la Imagen 2: en un campo de fresas, ella recoge una fresa, le da un mordisco y dice sonriendo: «¡Esto sí que es auténtico!». Aparece a su alrededor un bocadillo con la frase escrita dentro.

Referencia de imagen

Seedance 2.0 admite referencias de sujetos en varias vistas, así como referencias de varias imágenes, como imágenes de escenas y storyboards.

Si el orden de las imágenes importa, súbelas en orden y menciónalas con precisión en el prompt como Imagen 1, Imagen 2, … Imagen n.

Referencia de sujeto en varias vistas

Basta con dejar claro el objetivo de referencia: el modelo responde a instrucciones como estas, entre otras. Productos:

Electrónica de consumo

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Extrae la cámara de la Imagen 1, la Imagen 2 y la Imagen 3, y cambia el fondo a blanco. La cámara está sobre una mesa blanca; el objetivo la enfoca en primer plano y luego gira lentamente a su alrededor como sujeto principal, mostrando con claridad el frontal, los laterales y la parte trasera.

Artículos para el hogar

Resultado

Materiales de referencia

Tutorial illustration

Prompt

En una escena doméstica de tonos cálidos, un plano medio presenta el termo de las imágenes de referencia. La cámara avanza suavemente hasta un primer plano; una mano entra en el encuadre de forma natural, sujeta el cuerpo del termo y lo levanta, mientras la cámara sigue el ligero movimiento de rotación de la mano para mostrar el producto.

Personajes:

Materiales de referencia

Tutorial illustration

Resultado

Prompt

Tomando como referencia a la mujer de la Imagen 1, la Imagen 2 y la Imagen 3, genera una escena de ella comiendo tarta en una cafetería.

Referencia de varias imágenes

Referencia de logotipo

Resultado

Materiales de referencia

Tutorial illustration

Prompt

El fondo es una pasarela aérea iluminada con neones en una ciudad del futuro, con aeronaves serpenteando entre anuncios holográficos. Tomando como referencia a la chica de la Imagen 2: primero un plano medio de ella soltando un farol flotante plateado que lleva una proyección holográfica; después, la cámara se aleja para revelar un cielo lleno de faroles suspendidos. El encuadre se desenfoca gradualmente y aparece el logotipo de la Imagen 1. Estilo general: animación 3D de ciencia ficción cyberpunk.

Referencia de varios sujetos

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Tomando como referencia al gato y al perro de las imágenes: en un apartamento acogedor, el perro está tumbado comiendo de su cuenco; el gato se acerca y le da un toque con la pata; el perro deja de comer al ver al gato, y el gato se acurruca contra él. Paleta de colores cálida.

Referencia de varios elementos

Resultado

Materiales de referencia

Tutorial illustration

Prompt

La escena transcurre dentro del restaurante de la Imagen 4, lleno de clientes y actividad. La chica de la Imagen 1, vestida con el conjunto de la Imagen 2, está ordenando objetos en el mostrador. El chico de la Imagen 3 es un cliente; se acerca con la intención de pedirle a la chica sus datos de contacto. El logotipo de la Imagen 5 permanece visible en la esquina inferior derecha del encuadre durante todo el vídeo.

Referencia de storyboard con varias viñetas

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Tomando como referencia el storyboard de la imagen, genera una escena de combate intensa. La composición de cada viñeta aparece en orden y, después, los dos luchan con ferocidad.

Referencia de storyboard

Resultado

Materiales de referencia

Tutorial illustration

Prompt

Tomando como referencia el encuadre de la viñeta Imagen 3: una niña espera a que su padre termine de cocinar y dice: «아빠, 배고파요! 밥 다 됐어요?»; su aspecto toma como referencia la Imagen 1. Luego la cámara panea a la derecha y cambia al encuadre de la Imagen 4; el padre, cuyo aspecto toma como referencia la Imagen 2, responde: «거의 다 됐어, 조금만 기다려!». Corte de vuelta a un primer plano del rostro ligeramente decepcionado de la hija mientras dice: «아직 멀었어요? 맛있는 냄새 나는데…». Después, corte a un primer plano del padre, que dice: «이제 진짜 금방이야。 "빨리빨리" 하지 말고 손부터 씻고 와!»

Referencia de vídeo

Seedance 2.0 admite referencias de vídeo: solo tienes que especificar con claridad qué quieres generar y qué debe tomarse como referencia.

Si el orden de los vídeos importa, súbelos en orden y menciónalos con precisión en el prompt como Vídeo 1, Vídeo 2, … Vídeo n.

Referencia de acción

Cine y TV

Resultado

Materiales de referencia

Vídeo 1
Tutorial illustration

Prompt

Tomando como referencia el movimiento de los personajes y el lenguaje de cámara del Vídeo 1, genera una escena de pelea entre la Imagen 2 y la Imagen 1: la Imagen 2 es la persona de la izquierda y la Imagen 1, la persona de la derecha. Música de fondo intensa.

Marketing

Resultado

Materiales de referencia

Vídeo 1

Prompt

Tomando como referencia la forma de galopar del caballo en el Vídeo 1, genera un corcel dorado galopando por una pradera; después congela su magnífica pose en carrera mientras se transforma en un colgante de oro con forma de caballo.

Referencia de movimiento de cámara

Resultado

Materiales de referencia

Vídeo 1
Imagen 1
Imagen 1

Prompt

Tomando como referencia el movimiento de cámara del Vídeo 1, crea un vídeo conceptual de un parque tecnológico: el rascacielos de la Imagen 1 es el centro visual, con la misma inmersión en primera persona, transmitiendo la sensación futurista del campus de la Imagen 1.

Referencia de efectos

Cine y TV

Resultado

Materiales de referencia

Vídeo 1
Imagen 1
Imagen 1

Prompt

Tomando como referencia el efecto de partículas doradas del Vídeo 1: mientras el personaje de la Imagen 2 toca la flauta, el mismo efecto de partículas gira a su alrededor.

Efectos creativos

Resultado

Materiales de referencia

Vídeo 1
Imagen 1
Imagen 1

Prompt

Tomando como referencia el efecto del Vídeo 1, dale a la chica de la Imagen 1 las mismas alas, con una trayectoria idéntica de crecimiento de las alas.

Edición de vídeo

Seedance 2.0 permite editar vídeos: añadir, eliminar o modificar elementos; extender un vídeo hacia delante o hacia atrás; y completar pistas.

Si el orden de los vídeos importa, súbelos en orden y menciónalos con precisión en el prompt como Vídeo 1, Vídeo 2, … Vídeo n.

Añadir / eliminar / modificar elementos

Añadir elementos

Resultado

Materiales de referencia

Vídeo 1

Prompt

Añade pollo frito, pizza y otros aperitivos a la encimera del Vídeo 1.

Eliminar elementos

Resultado

Materiales de referencia

Vídeo 1

Prompt

Retira las demás piezas y herramientas del escritorio en el Vídeo 1, dejando el escritorio limpio y ordenado; solo permanecen los objetos que los dos sostienen en las manos.

Modificar elementos

Resultado

Materiales de referencia

Vídeo 1
Imagen 1
Imagen 1

Prompt

Sustituye el perfume del Vídeo 1 por la crema facial de la Imagen 1, manteniendo sin cambios el movimiento y el trabajo de cámara.

Extensión de vídeo

Nota

El modelo recorta automáticamente el segmento de unión para la composición: no volverá a generar metraje que ya esté incluido en el vídeo de entrada.

Extender hacia atrás

Resultado

Materiales de referencia

Vídeo 1

Prompt

Genera lo que ocurre después del Vídeo 1: los dos hombres que llegan tarde corren hacia ellos, los cinco por fin se encuentran y charlan con calidez.

Extender hacia delante

Resultado

Materiales de referencia

Vídeo 1

Prompt

Extiende el Vídeo 1 hacia delante: plano sobre el hombro del hombre vestido de blanco, que dice: «No es para tanto. Solo estás estresado. A todo el mundo le pasa; solo tienes que seguir adelante».

Completar pista

Consejo

  • Seedance 2.0 acepta como máximo 3 vídeos de entrada, con una duración total no superior a 15 segundos.
  • La generación recorta automáticamente los segmentos de unión del primer y el último vídeo, conservando solo lo necesario para la composición.

Resultado

Materiales de referencia

Vídeo 1
Vídeo 2

Prompt

Vídeo 1: en el instante en que la hoja cae, levanta un efecto de partículas doradas; una ráfaga de viento pasa de largo; luego Vídeo 2.

Fórmula avanzada

Seedance 2.0 es, en esencia, un director de IA multimodal: lee simultáneamente tu prompt de texto, imágenes, vídeos y audio, y los divide internamente en una capa espacial (lo que aparece en el encuadre) y una capa temporal (cómo cambian las cosas con el tiempo) para entender y generar metraje.

Por eso, un buen prompt no consiste en «adjetivos publicitarios», sino en una instrucción de estilo técnico: quién, en qué escena, haciendo qué acción, con qué movimiento de cámara y en qué orden, llevando cada dato a las capas espacial y temporal. La fórmula:

Fórmula avanzada de prompt: sujeto preciso + detalles de la acción + escena y entorno + iluminación y tono + movimiento de cámara + estilo visual + calidad de imagen + restricciones

En resumen: primero fija quién hace qué; después define dónde y qué atmósfera; luego indica al modelo cómo rodarlo; y por último afina el resultado con términos de estilo, calidad y restricciones. A continuación se desglosa cada elemento.

1. Define los sujetos

Una sola imagen de referencia suele contener varios sujetos. Para referenciar un objeto concreto con precisión, debes definir los sujetos de forma explícita. Un sujeto puede ser una persona, un accesorio o una escena.

  • Patrón recomendado: Define los [subject's core traits] de <Image/Video N> como <Subject N>
  • Requisitos de los rasgos principales: usa 2 o 3 rasgos claros, estables y estáticos (ropa, peinado, apariencia, categoría) para que el sujeto sea identificable de forma única
  • Ejemplos:
  • Define a la mujer del vestido rojo con sombrero de paja en la Imagen 1 como Sujeto 1
  • Define a la mujer del vestido rojo con sombrero de paja en la Imagen 1 como Zhang Hong

Nota

  • Menciona los sujetos de forma explícita cada vez que aparezcan; no dejes la referencia implícita. Se admiten dos usos:
  • Para escenas sencillas sin sujetos predefinidos, escribe <Subject N>@<Image N> cada vez que aparezca el sujeto, para reforzar la vinculación entre sujeto y recurso. Ejemplo: Zhang San@Imagen 1.
  • Para escenas con sujetos predefinidos, sigue usando siempre la misma etiqueta. Ejemplo: define al hombre alto del Vídeo 1 como el Policía y al hombre más bajo como el Ladrón; después, menciónalos como Policía y Ladrón en todo momento.
  • Mantén las descripciones concisas. Evita redundancias y conflictos semánticos, como rasgos contradictorios para el mismo sujeto.
  • Es preferible expresar las relaciones espaciales mediante imágenes de referencia en lugar de descripciones textuales complejas.

2. Usa una secuencia plano a plano

La representación interna del modelo desacopla el espacio y el tiempo. Por eso, para un vídeo complejo, la forma ideal del prompt es una línea de tiempo de planos: divide el vídeo en unos pocos planos y describe cada uno de forma dinámica, en el orden en que ocurren los acontecimientos: quién + dónde + haciendo qué + cómo se mueve la cámara.

Consejo práctico: escribe un desglose sencillo tipo «Plano 1 / Plano 2 / Plano 3» para el vídeo y luego intégralo en el prompt completo.

  • Ejemplo débil: «Un hombre corre nervioso por las calles; el encuadre se siente muy cinematográfico».
  • Ejemplo sólido:
  • Plano 1: Vista lateral de un callejón; el hombre empieza a correr lentamente, con sensación de respiración urgente.
  • Plano 2: El hombre se estrella contra un puesto de fruta; la cámara hace un barrido rápido y termina en un primer plano de su rostro aterrado.
  • Plano 3: El hombre salta un muro bajo y desaparece; la cámara se aleja lentamente y se mantiene sobre la calle vacía.

Reglas concretas

  • Usa marcadores como Plano 1, Plano 2, Plano 3 y organiza el contenido en el orden en que ocurren los acontecimientos (lo principal primero). No fuerces una duración para cada segmento: deja que el modelo marque el ritmo de la historia de forma natural.

Consejo

El soporte del modelo para tiempos exactos, por ejemplo «0–3 segundos», es inestable. Forzar duraciones precisas puede producir resultados anómalos.

Lo más recomendable es organizar cada plano en este orden:

  1. Movimiento de cámara o transición: por ejemplo, «plano general con acercamiento lento», «cámara fija», «corte a…».
  2. Acción y expresión del sujeto: las acciones clave y los cambios de expresión del personaje u objeto principal.
  3. Posición o cambio espacial: la escena, la posición o las relaciones espaciales del sujeto.
  4. Información de audio: los efectos de sonido, el diálogo o la música de fondo de ese plano.

3. Descripción de la acción

  • Partes del cuerpo concretas + intensidad cuantificada: describe las acciones hasta el nivel de manos, piernas, cabeza, hombros y espalda, y añade amplitud, velocidad y fuerza. Ejemplos: levanta una mano lentamente, gira la cabeza con rapidez, se impulsa con fuerza contra el suelo, baja ligeramente la cabeza.
  • Prioriza movimientos pequeños, lentos, suaves y continuos: favorece microacciones lentas, suaves y conectadas; evita esprints, grandes saltos, volteretas violentas y otros movimientos explosivos o de gran dinamismo. Ejemplos: caminar despacio, levantar suavemente una mano, bajar ligeramente la cabeza, sentarse con un único movimiento fluido.
  • Describe las transiciones entre acciones: explicita el impulso y el traspaso entre acciones consecutivas para que el movimiento se mantenga coherente. Ejemplos: aprovecha el impulso del giro para levantar una mano, pasa de la quietud a levantar una mano de forma natural.
  • Exterioriza la emoción mediante detalles físicos: expresa la emoción con detalles corporales concretos en lugar de palabras abstractas como «muy triste» o «furioso». Consulta la tabla siguiente:
Emoción abstractaAcciones y detalles exteriorizados
TristezaCabeza baja, hombros temblando ligeramente, ojos enrojecidos, dedos apretando inconscientemente el dobladillo de la ropa, lágrimas acumulándose sin llegar a caer
AlegríaComisuras de la boca elevándose sin control, cejas y ojos relajados, pasos más ligeros, tararea una melodía sin darse cuenta, no puede evitar girar sobre sí mismo/a
Nerviosismo / ansiedadMira el reloj con frecuencia, dedos golpeando la mesa sin parar, respiración rápida, mirada inquieta, se muerde las uñas de forma inconsciente
IraPuños cerrados, mandíbula tensa, pecho agitado con violencia, mirada afilada como cuchillas, palabras que salen entre dientes
AlivioUna larga exhalación, hombros tensos que se relajan por completo, aparece una leve sonrisa añorada, la mirada se eleva hacia la distancia

4. Movimiento de cámara

El modelo entiende muy bien el vocabulario de cámara: usa directamente términos estándar de cinematografía, por ejemplo «plano medio, primer plano, plano general, acercamiento lento, travelling lateral suave, cámara fija».

Nota

Especifica solo un movimiento de cámara por plano. Pedir acercamiento, alejamiento, paneo y travelling al mismo tiempo aumenta la inestabilidad del encuadre.

5. Calidad, estilo y restricciones

Los términos de calidad, estilo y restricciones son clave para controlar la salida. Definen el marco creativo del modelo, unifican la calidad de imagen y la dirección artística, y reducen defectos visuales y desviaciones aleatorias: una configuración necesaria para obtener resultados estables y conformes.

1. Calidad de imagen: define la nitidez, la textura del detalle y la sensación de iluminación, elevando la calidad base de la salida. Ejemplo: alta definición, gran nivel de detalle, textura cinematográfica, color natural, iluminación suave.

2. Estilo: establece la dirección artística general y el tono visual, unificando la atmósfera artística. Ejemplo: paleta cyberpunk fría en azul y morado, película vintage, tonos frescos de estilo japonés.

3. Restricciones: son extremadamente importantes. Las restricciones reducen de forma efectiva defectos visuales, deformidades y elementos poco razonables, delimitan la generación y mejoran la estabilidad. Plantillas habituales:

  • Evitar subtítulos: «mantén el vídeo sin subtítulos», «evita generar cualquier texto o subtítulo»
  • Evitar logotipos: «no generes logotipos»
  • Evitar marcas de agua: «no generes marcas de agua»

6. Ejemplos desarrollados

Dos ejemplos que muestran cómo se combinan la fórmula avanzada y sus elementos en un prompt real.

Recursos:

  • @Imagen 1: foto de medio cuerpo de la chica protagonista
  • @Imagen 2: imagen de referencia de la escena del dormitorio
  • @Vídeo 1: referencia de cámara para diálogo en interior (acercamiento/alejamiento en plano medio o ligero paneo)
  • @Audio 1: ambiente interior o música ligera

Prompt

La chica de @Imagen 1 es la protagonista; @Imagen 2 es la referencia de estilo para la escena del dormitorio; el trabajo de cámara toma como referencia @Vídeo 1. Plano 1: Al atardecer, la chica @Imagen 1 camina a paso rápido hacia la puerta del dormitorio @Imagen 2. Seguimiento estable en plano medio; la cálida luz amarilla del día entra en el pasillo por la ventana. Ella se detiene ante la puerta, respira hondo y parece algo nerviosa. Plano 2: La chica @Imagen 1 abre la puerta y entra. Corte a un plano medio interior: sus compañeras de cuarto levantan la vista mientras ordenan libros, y una pregunta con una sonrisa {¿Qué tal el examen? ¿Has aprobado?}. La cámara corta lentamente entre primeros planos de medio cuerpo del grupo. Plano 3: La chica @Imagen 1 primero baja la cabeza con gesto abatido —la cámara pasa a su primer plano—; luego levanta la mirada, no puede contener una sonrisa, se ríe en voz alta y dice {Os he engañado a todas}. Las compañeras la persiguen jugando por la habitación; la cámara se aleja lentamente y se queda en un plano general del dormitorio lleno de risas. Durante todo el vídeo: aspecto de documental cinematográfico en alta definición, tonos cálidos, iluminación suave; rostros estables sin deformación, movimiento natural y fluido, sin tirones ni parpadeos; el ambiente se integra de forma natural con @Audio 1.

Consejos prácticos

Generación de texto

Seedance 2.0 puede generar texto común en pantalla. El modelo adapta automáticamente un estilo y un color adecuados al contexto, y también te permite especificar en el prompt el color, el estilo, la animación de entrada, el momento de aparición y la posición del texto. Para obtener el mejor renderizado, prioriza caracteres habituales y evita caracteres raros y símbolos especiales. Los escenarios admitidos actualmente incluyen eslogans, subtítulos y bocadillos de diálogo; consulta los ejemplos de Generación de texto anteriores para ver patrones concretos.

Extender frente a ensamblar

  • Plano secuencia continuo (extensión de vídeo): ideal para escenas «tranquilas» basadas en diálogo dentro de una sola ubicación: conversaciones largas, construcción emocional, movimiento por una única trayectoria; logra una sensación inmersiva de toma única.
  • Giros de escena / acción (ensamblaje por segmentos): ideal para giros de trama o escenas de «acción» complejas y rápidas: persecuciones, peleas, montajes. Genera los segmentos por separado y edítalos juntos para conservar el ritmo y el impacto visual.

Los proyectos reales suelen combinar ambas estrategias: primero extiende para obtener una conversación coherente y luego ensambla planos de recurso o de transición, manteniendo la inmersión mientras varías el ritmo.

Estrategia de configuración de recursos

Piensa en tus recursos como si cumplieran cuatro funciones:

  1. Ancla de personaje: fija la apariencia del personaje
  2. Definidor de tono de escena: fija el entorno y el estilo
  3. Referencia de cámara: fija el lenguaje de plano y el ritmo de acción
  4. Ritmo y atmósfera: usa el audio para controlar la emoción y el timbre de voz

Configuración recomendada (4–5 recursos en total): 1–2 imágenes de personaje (primer plano del rostro / cuerpo completo) + 1 imagen de escena + 1 vídeo de referencia de cámara + 1 clip de audio.

Consejo

No agotes el límite de recursos. Demasiados recursos dificultan que el modelo priorice características, lo que puede provocar conflictos de estilo, identificación borrosa de sujetos y resultados que se alejan de lo esperado.

Pautas de uso

Coherencia de idioma

Mantén el diálogo en un único idioma. Evita mezclar idiomas en la misma línea, salvo nombres propios.

Caracteres especiales

Usar símbolos de forma coherente ayuda al modelo a distinguir distintos tipos de información:

Tipo de informaciónSímboloEjemplo
Música()(Suena música rock de ritmo rápido de fondo)
Efectos de sonido<><Un perro ladra a lo lejos>
Diálogo{}{Hola, mundo}. Para diálogos en un idioma menos habitual (que no sea chino/inglés), etiqueta el idioma; por ejemplo: dice en japonés {こんにちは}.
Subtítulos / rótulos【】【Capítulo 1: Partida】

Preguntas frecuentes

Deriva de identidad del personaje

Síntoma: el personaje generado no coincide con la imagen de referencia, o el rostro cambia a mitad del vídeo (deriva de identidad), lo que a veces puede activar filtros de revisión por parecerse a celebridades.

Causa raíz: la referencia del rostro no es lo bastante efectiva:

  • Imágenes de referencia mezcladas: la referencia del rostro se combina en una sola imagen con poses de cuerpo completo, referencias de vestuario o planos de detalle.
  • Rostro demasiado pequeño en el encuadre: en una imagen de referencia mezclada, el rostro ocupa una proporción demasiado pequeña, por lo que el modelo da poco peso a los rasgos faciales y se distrae con el fondo u otros elementos.

Solución: refuerza la independencia y el peso de la referencia del rostro:

  1. Prepara un primer plano dedicado del rostro: además del plano de cuerpo completo, añade una imagen que contenga solo la cabeza del personaje (headshot: solo rostro, preferiblemente expresión neutra, con hombros/fondo mínimos).
  2. Define el sujeto con claridad en el prompt: «Los rasgos faciales de Sujeto 1 toman como referencia la Imagen 1 (headshot); el maquillaje y el estilismo toman como referencia la Imagen 2 (plano de cuerpo completo)».
  3. Coloca primero los recursos importantes: cuanto más precisa deba ser la referencia a un recurso, más temprano debe aparecer en el prompt.

Nota

Usa un headshot + un plano de cuerpo completo como referencia de personaje. No se recomiendan las hojas multivista: contienen a la misma persona desde varios ángulos, y el modelo tiende a leerlas como varios sujetos distintos, empeorando la deriva de identidad.

Antes

El rostro del personaje cambia a mitad del vídeo y se parece a una celebridad

Después

El rostro se mantiene coherente con la imagen de referencia durante todo el vídeo

Subtítulos no deseados

Síntoma: el prompt no pedía subtítulos, pero el vídeo generado los contiene.

Consejo

Actualmente no existe una forma de evitar los subtítulos el 100 % de las veces; los métodos siguientes reducen la probabilidad y aumentan tu tasa de acierto entre intentos.

  1. Añade restricciones explícitas al prompt: «mantén el vídeo sin subtítulos», «evita generar cualquier texto o subtítulo».
  2. Si el texto de tus imágenes o vídeos de referencia no es esencial, elimínalo primero (por ejemplo, con la edición de imagen o vídeo de Seedream / Seedance) y usa después el recurso sin texto como entrada.
  3. Cuando tu caso de uso lo permita, genera primero en horizontal (los subtítulos aparecen con mucha menos frecuencia que en vertical) y luego recorta a vertical en un editor.

Aparecen logotipos / marcas de agua

Síntoma: el prompt no mencionaba marcas de agua, pero el vídeo generado contiene logotipos o marcas de agua de otras plataformas de vídeo.

Solución: añade restricciones explícitas al prompt: «no generes marcas de agua», «no generes logotipos».

Deriva de estilo

Síntoma: quieres una salida de anime 2D o 3D, pero la imagen de referencia es bastante fotorrealista y el prompt no enfatiza el estilo; por eso el resultado puede desviarse hacia una estética de imagen real.

Solución: añade restricciones de estilo explícitas, como «estilo anime japonés 2D» o «animación 3D de estilo chino». Para un control más estricto, convierte primero la imagen de referencia al estilo objetivo y luego genera el vídeo a partir de ella.

Antes

El estilo xianxia deriva hacia imagen real

Después

Mantiene el estilo xianxia de CG de animación china 3D

Saltos en las uniones de extensión

Síntoma: después de generar una extensión y unirla al original, la unión puede mostrar un salto visible o un retroceso en el contenido.

Solución: por ahora, corrígelo en posproducción alineando fotogramas clave (la corrección de raíz llegará con una iteración del modelo):

  1. Importa los clips que vas a unir en CapCut u otro editor.
  2. En la primera unión, recorta 6 fotogramas del final del clip anterior.
  3. Recorta también 1 fotograma del inicio del clip posterior.
  4. Repite el proceso en cada punto de unión.
  5. Exporta y comprueba que el vídeo unido se reproduce con fluidez.

Consejo

Incluso con los fotogramas alineados, pueden quedar pequeños saltos. Al generar una continuación, termina el clip en un momento de corte de escena y deja que el siguiente clip empiece desde la nueva escena después del corte.

Antes

Saltos de fotograma visibles / regresión de contenido en las uniones (5 s, 20 s)

Después

Uniones mucho más suaves

El problema de los «gemelos»

Síntoma: en escenas con muchos personajes, especialmente cuando se usa como referencia una hoja de giro del personaje (tres vistas), el mismo encuadre puede contener dos copias idénticas de un personaje.

Causa raíz:

  • Los sujetos de personaje no están definidos con claridad en el prompt, así que el modelo no puede distinguir los roles con precisión.
  • Las hojas de giro / multivista confunden el reconocimiento de personajes y producen duplicados con el mismo aspecto.

Consejo

Actualmente no existe una forma de evitar gemelos el 100 % de las veces; los métodos siguientes reducen la probabilidad y aumentan tu tasa de acierto entre intentos.

  1. Vincula cada personaje a su referencia: define cada personaje con claridad e indica a qué imagen corresponde, manteniendo un formato coherente. Ejemplo: Zhang San (de la Imagen 1) lanza la libreta verde al Li Si que está de pie (de la Imagen 2).
  2. Añade una restricción global al final del prompt: «Durante todo el vídeo, no muestres nunca personajes con apariencia, ropa y accesorios idénticos; sin clones ni efecto gemelo; mantén solo una instancia de cada personaje por encuadre; sin personajes duplicados».
  3. Optimiza los recursos de referencia: prioriza fotos de una sola persona; evita hojas de tres vistas / multivista.
  4. Recorta el prompt: no pegues un guion completo como prompt; el texto redundante confunde al modelo. Elimina contenido irrelevante y mantén las instrucciones enfocadas.

Antes

Aparece un «gemelo» en el segundo 8

Después

Pérdida de calidad al extender

Síntoma: usar un vídeo generado como entrada para una extensión posterior degrada la calidad de imagen. Las extensiones repetidas acumulan la degradación, con manchas de color moteadas que aparecen especialmente en los rostros.

Solución: mitigaciones por ahora (la corrección de raíz llegará con una iteración del modelo):

  1. Convierte primero el vídeo original a un render de arcilla blanca con Seedance 2.0 y usa ese resultado como entrada de extensión. Prompt de referencia: «Convierte el vídeo en un modelo 3D blanco: todos los personajes se convierten en modelos 3D de color blanco puro, sin color, sin textura, sin sombras, fondo blanco puro, estructura estable, movimiento fluido».
  2. Prioriza imágenes de alta resolución como recursos de referencia.
  3. Limita cuántas veces encadenas extensiones; evita acumular muchas rondas.

Antes

Extender directamente la salida del modelo

Después

Convertir la salida a un render de arcilla blanca antes de extender

Los efectos no coinciden con lo esperado

Síntoma: describir un efecto visual concreto en texto puede fallar. Ejemplo: el prompt pide «que el número 2999 entre como una animación de cuenta atrás», pero los dígitos generados se desplazan con saltos caóticos en lugar de una cuenta atrás correcta.

Solución: define el efecto con un vídeo de referencia: proporciona un clip del efecto objetivo para que el modelo entienda con precisión su forma y su lógica de movimiento. Ejemplo: «El número 2999 entra igual que en el Vídeo 1».

Antes

Materiales de referencia

Vídeo 1 — referencia de efecto

El efecto de desplazamiento de dígitos salta de forma caótica

Después

Al añadir como entrada el vídeo correcto de efecto de desplazamiento de dígitos, el resultado coincide con lo esperado

Demasiados personajes de referencia

Síntoma: con más de 4 personajes de referencia, la estabilidad de salida baja: el vídeo puede mostrar un número incorrecto de personas (faltan o sobran) o personajes duplicados.

Solución: mitigaciones por ahora (la corrección de raíz llegará con una iteración del modelo):

  1. Genera imágenes de grupo por pasos: divide los personajes en grupos de como máximo 4 por imagen. Por ejemplo, 6 personajes pueden dividirse en 2 grupos de 3, generando una imagen por grupo.
  2. Luego, imagen a vídeo: usa esas imágenes agrupadas como recursos de referencia para generar el vídeo final.

Antes

8 personajes de referencia entran → 9 personas salen

Después

Primero se componen 8 personajes en 2 imágenes y luego se genera imagen a vídeo

El timbre de voz no coincide con la referencia

Síntoma: al usar un clip de audio de referencia para definir la voz, la voz del vídeo generado puede desviarse de forma notable del timbre de referencia.

Solución:

  1. Añade descripciones detalladas del timbre de voz al prompt, por ejemplo: «habla con la voz masculina de mediana edad, grave, cálida y ligeramente rasposa de @Audio 1».
  2. Mantén el tono y el estilo de formulación del diálogo cerca del audio de referencia; esto mejora la fidelidad y la estabilidad del timbre.

Antes

Materiales de referencia

Audio 1 — audio de entrada

La voz no coincide con el audio de entrada

Después

Al describir los rasgos del timbre en el prompt, la coincidencia mejora claramente