使用教程

Seedance 2.0 提示词指南

Seedance 2.0 系列原生支持音视频联合生成,具备出色的语义理解与多模态交互能力。本教程将带您掌握 Seedance 2.0 提示词的撰写方法与实用技巧,助您更高效地生成符合创作预期的优质视频。

基础公式

Seedance 2.0 模型支持同时参考视频、图像和音频资产,能够精准锁定角色外观、运动效果、视觉风格及声音音色等。这大幅降低了提示词的撰写门槛:只需套用几个简单的主公式,即可引导模型充分利用您的多模态资产,快速生成满足特定需求的视频。

基于视频参考的任务主要分为三类:多模态参考视频编辑视频续写。请根据您的任务类型选择对应的套用公式。

多模态参考

提取参考素材中的特定元素(如主体、风格、场景或声音)并生成全新的视频。

  • 适用场景:动作转移、主体套用、氛围借鉴等任务
  • 推荐句式
  • 图像参考:参考 <图像 N> 中的 <主体 N>,生成……
  • 视频参考:参考 <视频 N> 中的 <动作 / 镜头轨迹 / 风格 / 声音>,生成……
  • 音频参考:参考 <音频 N> 的音色,生成……

视频编辑

在现有视频的基础上进行局部或全局修改。默认情况下,未提及的内容将保持不变。

  • 适用场景:局部替换、主体消除、属性改变等任务
  • 推荐句式
  • 新增元素:明确描述 <元素特征> + <出现时间> + <出现位置>
  • 修改元素:严格修改 <视频 N>,将 <原特征> 替换为 <新特征>
  • 删除元素:指出需要移除的元素;若想让某些元素保持不变,在提示词中明确强调它们能带来更好的效果

视频续写

在时间轴上延伸原视频,同时保持视听风格、主体和叙事的一致性。

  • 适用场景:剧情延续、动作延伸、补全缺失片段等任务
  • 推荐句式
  • 视频单向续写:向后/向前延伸 <视频 N>,生成……
  • 多段首尾拼接<视频 1> + <过渡描述> + 然后 <视频 2> + <过渡描述> + 然后 <视频 3>

注意

在进行视频编辑或续写任务时,请直接将视频代称为 <视频 N>切记不要写“参考 <视频 N>”,否则任务可能会被误识别为参考类任务。

组合任务

上述三种任务类型也可以结合使用。

  • 适用场景:在编辑一个视频的同时,参考另一个素材的元素
  • 推荐句式:参考 <图像/视频 N> 中的 [参考维度],严格修改 <视频 X>[具体修改内容]

提示词案例

以下为您提供 Seedance 2.0 在不同场景下的提示词案例,助您轻松玩转多模态参考控制和文本生成。只需选取与您当前任务最接近的句式,稍作调整即可直接使用。

文本生成

品牌文案 / Slogan

提示词模板:

「文字内容」+「出现时间」+「出现位置」+「入场方式」,「文字特征(如颜色、风格)」

小贴士

Seedance 2.0 会自动根据上下文配对相符的文字风格。若您对文字外观有严格要求,请参考下文“多图参考 → Logo参考”部分。

参考素材

图像 1
图像 1

生成效果

提示词 (Prompt)

手绘动漫风格。三个人聚在一起,快乐地分食着图像 1 中的炸鸡,现场氛围温馨融洽。随后画面逐渐模糊,镜头中央浮现出文字 “快乐尽在 Seedance”。

视频字幕

提示词模板:

字幕出现在画面底部,内容为“……”,其出场节奏与音频台词完美同步。

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

生成带旁白的视频。一个富有磁性且深沉的男声旁白说道:“在浩瀚的宇宙中,我们的世界不过是沧海一粟。然而,哪怕历经重重磨难,生命依然在此繁衍不息。”画面随之从深夜缓慢过渡到黎明——随着太阳从群山后升起,繁星逐渐隐去。画面底部浮现与旁白同步的字幕。

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

图中两人正在办公室聊天。女人率先开口:“你每次卡点到,是不是很享受这种刚刚好的感觉?”男人微笑着回答:“我有我的节奏。”两人的交谈显得轻松自然,画面底部同步浮现切合口型的对话字幕。

对话气泡

提示词模板:

「角色」说道:“……”;说话时,其身旁浮现一个带有所说台词的对话气泡。

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

图像 1 中身着运动服的两人正在学校操场上跑步。女孩看着男孩,一脸自信地鼓励道:“我们一定可以的!”镜头切换至男孩的特写,他略显迟疑地反问:“你确定吗?”镜头再次切回女孩的中特写,她语气坚定、充满希望地大声回答:“当然!”说话者的身旁随即浮现对应的台词气泡。

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

参考图像 1 和图像 2 中的女孩:在草莓地里,她摘下一颗草莓咬了一口,并笑着说:“这味道绝了!”她的身旁同步浮现带此台词的对话气泡。

图像参考

Seedance 2.0 支持多视角主体参考,以及场景图、分镜脚本等多图参考输入。

若图像顺序对生成效果有影响,请按顺序上传,并在提示词中使用:图像 1、图像 2……图像 n 的命名规则进行精准指代。

多视角主体参考

只需在提示词中明确参考目标,模型就会执行指令。以下为参考范例。商品类

消费电子产品

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

提取图像 1、图像 2 和图像 3 中的相机,并将背景更换为纯白色。相机放置在白色桌面上,镜头对其进行近距离对焦,随后以相机为主体缓慢进行环绕旋转拍摄,清晰展现相机的正面、侧面及背面细节。

家居用品

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

在暖色调的家居场景下,用中景呈现参考图中的保温杯。镜头平滑推成特写,一只手自然入镜,握住保温杯杯身将其提起,镜头跟随手部微弱的旋转动作全方位展示商品。

人物类

参考素材

Tutorial illustration

生成效果

提示词 (Prompt)

参考图像 1、图像 2 和图像 3 中的女人,生成她在咖啡馆里品尝蛋糕的场景视频。

多图综合参考

Logo 参考

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

背景是未来都市中霓虹闪烁的空中廊道,飞行器在全息广告牌间穿梭。参考图像 2 中的女孩:首先用中景展现女孩放飞一个带有全息投影的银色悬浮天灯,随后镜头拉远,展现漫天漂浮的天灯。画面逐渐模糊,浮现图像 1 中的 Logo。视频整体风格:3D赛博朋克科幻动画。

多主体参考

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

参考图中的猫和狗:在温馨的公寓里,狗趴在地上吃着碗里的狗粮;猫咪走过来,用爪子轻轻拍了拍狗;狗看到猫后停止进食,猫顺势依偎在狗的身旁。暖色调画面。

多元素参考

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

场景设在图像 4 中的餐厅里,店内顾客熙熙攘攘。图像 1 中的女孩身着图像 2 中的服饰,正在吧台整理物品。图像 3 中的男孩作为顾客走上前去,试图询问女孩的联系方式。画面右下角全程保留图像 5 中的 Logo。

多格分镜参考

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

参考图中的分镜剧本,生成一段激烈的打斗视频。画面依次呈现每个分格的构图,随后两名角色展开猛烈的近身搏斗。

分镜脚本参考

生成效果

参考素材

Tutorial illustration

提示词 (Prompt)

参考分镜图像 3 的画幅构图:一个女孩焦急地等待爸爸做饭并说道:“아빠, 배고파요! 밥 다 됐어요?”(爸爸,我饿了!饭做好了吗?),其长相参考图像 1。随后镜头右摇,切换至图像 4 的画幅构图;爸爸的长相参考图像 2,他回答道:“거의 다 됐어, 조금만 기다려!”(快好啦,再等一小会!)。随后画面切回女儿略显失落的特写,她说道:“아직 멀었어요? 맛있는 냄새 나는데…”(还没好吗?闻起来好香啊……)。接着切回爸爸的特写,他笑着说:“이제 진짜 금방이야。 "빨利빨利" 하지 말고 손부터 씻고 와!”(马上就真的好啦。别催啦,去洗手准备吃饭!)

视频参考

Seedance 2.0 原生支持视频参考,只需在提示词中明确指出需要生成的场景以及具体参考的维度即可。

若视频的上传顺序对效果有影响,请按顺序上传,并在提示词中使用:视频 1、视频 2……视频 n 的命名规则进行指代。

动作参考

影视制作

生成效果

参考素材

视频 1
Tutorial illustration

提示词 (Prompt)

参考视频 1 中的人物动作和运镜方式,生成一段图像 2 与图像 1 之间打斗的视频——其中图像 2 是左边的人,图像 1 是右边的人。搭配节奏感强的背景音乐。

创意营销

生成效果

参考素材

视频 1

提示词 (Prompt)

参考视频 1 中马儿奔跑的姿态,生成一匹金色骏马在草原上飞奔的画面,随后定格其矫健的奔跑身姿,并幻化演变成为一款马形黄金吊坠。

运镜轨迹参考

生成效果

参考素材

视频 1
图像 1
图像 1

提示词 (Prompt)

参考视频 1 的镜头移动轨迹,制作科技园区概念片:以图像 1 中的高楼为视觉中心,沿用同样的第一人称俯冲运镜,展现出图像 1 园区十足的未来科技感。

特效参考

片场视效

生成效果

参考素材

视频 1
图像 1
图像 1

提示词 (Prompt)

参考视频 1 中的金色粒子特效:当图像 2 中的角色吹奏笛子时,同样的金色粒子光芒环绕着其旋转起舞。

创意变装/变形效果

生成效果

参考素材

视频 1
图像 1
图像 1

提示词 (Prompt)

参考视频 1 中的特效,让图像 1 中的女孩生出同样闪耀的翅膀,翅膀舒展生长的动画轨迹需与参考视频保持一致。

视频编辑与处理

Seedance 2.0 完美支持视频编辑任务:包括新增、删除或修改特定元素;对视频进行双向延展、以及多轨道补全。

若视频的上传顺序对效果有影响,请按顺序上传,并在提示词中使用:视频 1、视频 2……视频 n 的命名规则进行指代。

增、删、改特定元素

新增元素

生成效果

参考素材

视频 1

提示词 (Prompt)

在视频 1 的台面上添加炸鸡、烤披萨以及其他休闲零食。

删除元素

生成效果

参考素材

视频 1

提示词 (Prompt)

清除视频 1 中办公桌上的其他零件和杂乱工具,保持桌面干净整洁——仅保留他们两人手中拿着的物件。

修改元素

生成效果

参考素材

视频 1
图像 1
图像 1

提示词 (Prompt)

将视频 1 中的香水瓶瓶身替换为图像 1 中的面霜瓶,保持手部动作和相机运镜轨迹完好不变。

视频双向续写

注意

模型将自动对衔接处进行智能无缝过渡处理——输入视频中已包含的画面不会被重复渲染生成。

向后延伸

生成效果

参考素材

视频 1

提示词 (Prompt)

续写视频 1 之后的画面:两位迟到的男士气喘吁吁地朝他们跑来,五个人终于顺利碰头并热络地攀谈起来。

向前延伸

生成效果

参考素材

视频 1

提示词 (Prompt)

向前延伸视频 1:给白衣男子一个越肩镜头,他宽慰道:“情况没那么糟,你只是压力太大了。每个人都会经历这段时期,熬迎头赶上就好了。”

多段首尾拼接

小贴士

  • Seedance 2.0 最多支持导入 3 段输入视频,总时长建议不要超过 15 秒。
  • 合成时系统会自动对前后视频的衔接段进行裁切,仅保留无缝融合所需的必要过渡帧。

生成效果

参考素材

视频 1
视频 2

提示词 (Prompt)

视频 1——在树叶着地的那一瞬间,激荡起一阵耀眼的金色光流粒子特效;随后一阵大风刮过画面——紧接着切入视频 2。

进阶公式

Seedance 2.0 在本质上扮演着多模态 AI 导演的角色:它能够同时读取你的文本提示词、图片、视频和音频,并在内部将其拆解为空间层(画面中包含什么)和时间层(画面随时间如何变化),以此来理解并生成视频画面。

因此,一条优秀的提示词不应该堆砌“广告文案式的形容词”,而应该是一份工程化的指令:谁、在什么场景、做什么动作、镜头如何运动、以什么顺序进行——将这些要素精准地投喂给空间层和时间层。其核心公式如下:

进阶提示词公式:精准主体 + 动作细节 + 场景与环境 + 光影与色调 + 镜头运动 + 视觉风格 + 画面质量 + 限制条件

简而言之:先锁定在做什么,接着交代在哪里以及什么氛围,然后告诉模型怎么拍,最后通过风格、质量和限制词来规范生成结果。下面我们将逐一拆解这些要素。

1. 明确定义主体

单张参考图通常包含多个元素。为了精准指代特定对象,你必须明确定义主体。主体可以是一个人、一个道具或一个场景。

  • 推荐模式:将 <图片/视频 N>[主体的核心特征] 定义为 <主体 N>
  • 核心特征要求:使用 2-3 个清晰、稳定、静态的特征(衣着、发型、外貌、类别等),以便精确识别主体
  • 示例
  • 将图片 1 中穿红裙、戴草帽的女人定义为主体 1
  • 将图片 1 中穿红裙、戴草帽的女人定义为张红

注意

  • 主体每次出现时都要进行显式指代,切勿让模型猜测。支持以下两种写法:
  • 对于没有预先定义主体的简单场景,每次出现该主体时,写作 <主体 N>@<图片 N>,以此强调主体与素材的绑定关系。例如:张三@图片 1。
  • 对于已预先定义主体的场景,后续要持续使用相同的标签。例如:将视频 1 中的高个子男人定义为警察,矮个子男人定义为小偷,之后便在全文中交替使用警察小偷进行指代。
  • 描述保持简练。避免冗余信息以及语义冲突(例如对同一主体的特征进行前后矛盾的描述)。
  • 尽量通过参考图来表达空间位置关系,避免使用复杂的文字描述。

2. 使用分镜头叙事

模型在内部会将空间和时间解耦。因此,对于复杂的视频,最理想的提示词结构是分镜头时间轴:将视频拆解为若干个镜头,并按照事件发生的先后顺序,动态描述每个镜头内部的细节:谁 + 在哪里 + 在做什么 + 镜头怎么动。

实用建议:先为视频写一份简单的“镜头 1 / 镜头 2 / 镜头 3”大纲,然后将其融合成一条完整的提示词。

  • 欠佳示例:“一个男人在街上神色慌张地奔跑,画面非常有电影感。”
  • 推荐示例
  • 镜头 1:小巷侧面视角;男人缓缓起跑,伴随急促的呼吸感。
  • 镜头 2:男人撞翻了路边的水果摊;镜头快速甩过,定格在他惊恐万分的脸部特写上。
  • 镜头 3:男人翻过一堵矮墙并消失;镜头缓缓拉远,定格在空无一人的街道上。

具体规则

  • 使用 Shot 1Shot 2Shot 3 等镜头标记,并按照情节发生的先后顺序组织内容。无需强行规定每个分镜头的时长,让模型自然控制主次和叙事节奏。

小贴士

目前模型对精准时长(如“0-3秒”)的控制尚不稳定。强行指定具体秒数可能会导致画面生成异常。

建议每个镜头的描述按照如下顺序组织:

  1. 运镜或转场:例如“全景缓缓推进”、“固定机位”、“切至……”等。
  2. 主体的动作与神态:核心人物/对象的关键动作和神情变化。
  3. 位置或空间变化:主体的场景、所处位置或空间关系的变化。
  4. 音频信息:当前镜头配有的音效、台词或背景音乐。

3. 动作描述规范

  • 细化到具体部位 + 量化动作幅度——将动作拆解到手、腿、头、肩膀和背部细节,并明确幅度、速度和力度。例如:缓缓抬手、快速转头、用力蹬地起跑、微微低下头。
  • 首选平缓、温柔、连贯的微动作——优先考虑慢速、饱满且过渡自然的微观动作,避免使用狂奔、大跳、剧烈翻滚等高爆发、大动态的动作。例如:缓缓踱步、轻柔抬手、神色微动轻轻低头、丝滑地坐下。
  • 描述动作之间的衔接——点明前后动作的连贯性和惯性过渡,让动态更加流畅自然。例如:顺着转身的惯性顺势抬手、由静止自然过渡到抬起手臂。
  • 将情绪转化为具象的神态与肢体细节——与其使用“非常伤心”、“暴怒”等抽象词汇,不如通过具体躯体神态来传达。参考下表:
抽象情绪描述具象神态/躯体动作细节
悲伤耷拉着头,肩膀微微颤抖,眼圈泛红,手指不自觉地抓紧衣角,眼泪在眼眶里打转却强忍着不落下来
喜悦嘴角止不住往上扬,眉眼舒展,步伐变得轻盈欢快,嘴里哼着不知名的小曲,甚至忍不住原地转个圈
紧张/焦虑频繁看表,手指有节奏地、不停地敲击桌面,呼吸急促,眼神飘忽不定,下意识咬手指甲
愤怒双手握拳,咬紧牙关,胸口剧烈起伏,眼神凌厉,每一个字都像是从牙缝里挤出来的一样
释怀长一口气,紧绷的肩膀完全放松下来,脸上浮现出久违的淡淡微笑,目光投向远方

4. 运镜与镜头语言

模型对镜头专业词汇的理解非常到位,请直接使用标准电影运镜名词,例如“中景、特写、全景、慢速推进、平滑横移拉镜头、固定机位”等。

注意

单个镜头内建议只指定 1 种运镜轨迹。同时要求推、拉、摇、移容易导致画面不稳定。

5. 质量、风格与限制词

质量、风格和限制词是精确控制输出画面的关键。它们能为模型框定创作边界,统一画面质感与美术走向,并有效抑制坏肢、噪点和画面不受控漂移,是保障生成效果稳定、合规的护栏。

1. 画面质量——界定画面的清晰度、细节纹理和光影质感,拉高生成画面的下限。例如:高动态范围、细节丰富、电影质感、色彩自然、光影意境润泽。

2. 视觉风格——确立整体的美术走向和画面色调,统一艺术氛围。例如:赛博朋克冷调蓝紫配色、复古胶片质感、日系清新色调。

3. 限制性术语——至关重要。反向限制词能有效压制画面中崩坏的肢体、畸变和不合常理的元素,框定画幅边界,极大提高生成稳定性。常用模板

  • 无字幕要求:“画面干净无字幕”、“避免生成任何文字及字幕信息”
  • 无徽标要求:“不要生成任何标志、图标”
  • 无水印要求:“画面无水印痕迹”

6. 实战案例

以下通过两个实战案例,直观展示上述进阶公式和关键要素如何融入一条真实的提示词中。

参考素材(Assets)

  • @Image 1:女主角的半身正面照
  • @Image 2:宿舍场景参考图
  • @Video 1:室内对话镜头参考视频(中景推拉或轻微横移)
  • @Audio 1:室内环境噪音或轻音乐

提示词 (Prompt)

@Image 1 中的女生为女主角;图 @Image 2 为宿舍场景风格参考;运镜节奏参考视频 @Video 1。 Shot 1:黄昏时分,女生 @Image 1 迈着轻快的步伐走到宿舍门口 @Image 2。镜头跟拍中景,平稳推进,温暖的夕阳余晖透过走廊窗户洒进来。她在门口停下脚步,深吸了一口气,神色中透出一丝紧张。 Shot 2:女生 @Image 1 推门走进宿舍。画面切至室内中景:舍友们正整理书本,纷纷抬头看向她,其中一人笑着问道 {考得怎么样?通过了吗?}。镜头在众人半身人像特写间匀速切换。 Shot 3:女生 @Image 1 先是沮丧地低下头——镜头拉近至其脸部特写——随即她忍不住扑哧一笑,大笑着说出台词 {骗你们的啦}。舍友们笑闹着上前打闹追逐,镜头缓缓拉远,定格在充满欢声笑语的宿舍全景画面。 全局要求:高清纪录片级电影质感,色调温暖,光影柔和;人物面部稳定不畸变,肢体动作连贯自然,无卡顿频闪;环境声自然融合音频素材 @Audio 1

实用技巧

文本生成

Seedance 2.0 支持在生成的视频中融入常见的文本内容。模型会根据上下文自动适配契合的字体风格和颜色;你也可以在提示词中显式指定文本的颜色、样式、入场动画、出现时间以及在画面中的相对位置。由于对字符渲染的拟合度不同,为了获得最佳渲染效果,建议优先选用常用汉字或英文字符,避免使用生僻字特殊符号。目前支持的场景包括口号 (slogan)、字幕、以及对话气泡等,具体应用模式可参考上文的 Text Generation 示例。

长焦延展 vs. 分段拼接

  • 连续长镜头(视频延展):极度适合在同一固定空间内由对话驱动的“静止型”日常场景。如长谈、情感层层铺垫、沿单一路径的运镜走位,能带来一镜到底的沉浸感。
  • 场景/动作转场(分段拼接):极度适合带有情节转折或复杂高动态的“动作型”镜头。如追逐、对打、快节奏蒙太奇。将这些片段独立生成,最后在后期中剪接在一起,叙事节奏和视觉冲击力更佳。

在实际项目创作中,这两种策略通常会结合使用:先通过视频延展获得一段连贯的对话镜头,再通过后期拼接插播空镜头或过渡镜头,在保持沉浸感的同时让叙事节奏张弛有度。

参考素材配置策略

我们可以将输入的参考素材分为以下四种功能角色:

  1. 角色锚定(Character anchor):精准锁定人物的外形特征
  2. 场景基调(Scene tone-setter):精确锁定场景环境与视觉风格
  3. 镜头参考(Camera reference):精确参考镜头语言与动作脉络
  4. 节奏与氛围控制(Rhythm & mood):利用音频来控制画面情感起伏和人声音色

推荐配置组合(共 4-5 个素材):1-2 张核心人物图(面部特写/全身照)+ 1 张场景参考图 + 1 个运镜参考视频 + 1 段音频片段。

小贴士

无需一味填满素材槽位的上限。提示词中引用的素材过多会导致模型难以调和权重,极易出现风格打架、主体指向混乱以及最终生成画面发生严重偏移的情况。

使用指南与规范

语种一致性

保持同一句对话中的语言统一。避免在同一句话中中英夹杂(专有名词除外)。

特殊符号规范

规范且统一地使用特定符号,有助于模型准确区分不同类别的信息流:

信息类型专用符号应用示例
音乐()(背景中响起节奏明快的摇滚乐)
音效<><远处传来狗吠声>
对话{}{Hello, world}。如需输出非中英等常用语种的台词,需要特意标注语种,例如:用日语说 {こんにちは}。
花字 / 旁白字幕【】【第一章:启程】

常见问题解答

角色人脸漂移(ID 漂移)

问题表现 — 生成的角色与参考图不一致,或者在视频播放过程中人脸发生变化(即 ID 漂移),有时甚至因形似某些明星而触发审核过滤。

根本原因 — 人脸参考不够精准高效:

  • 参考图混杂:将人脸参考与全身姿态、服装参考或细节图混在一起,拼成了一张图。
  • 人脸在画面中占比过小:在混杂的参考图中,人脸区域太小,导致模型降低了对面部特征的权重,并受到背景或其他元素的干扰。

解决方案 — 提高人脸参考图的独立性与权重:

  1. 准备一张专用的人脸特写图:除了全身照外,再额外提供一张仅包含角色头部的图片(即免冠大头照 —— 最好是表情自然、几乎没有肩膀和复杂背景的纯面部图)。
  2. 在提示词中明确定义主体:例如“主体 1 的面部特征参考图 1(大头照);妆容和造型参考图 2(全身照)”。
  3. 将重要素材前置:素材需要参考得越精准,在提示词中出现的位置就要越靠前

注意

建议使用“大头照 + 全身照”的组合作为角色参考。不推荐使用多视角人设图(三视图) —— 这类图包含同一人物的多个角度,模型容易将其识别为多个不同的个体,从而加剧 ID 漂移问题。

修改前

视频中途角色人脸发生变化,且形似某位明星

修改后

人脸全程与参考图保持高度一致

视频意外出现字幕

问题表现 — 提示词中并未要求添加字幕,但生成的视频中却带有字幕。

小贴士

目前还没有办法 100% 避免字幕生成 —— 以下方法可以降低出现概率,并在多次尝试中提高成功率。

  1. 在提示词中加入明确的限制条件:“视频不包含任何字幕”、“避免生成任何文字或字幕”。
  2. 如果参考图/视频中的文字并非必不可少,请先将其去除(例如使用 Seedream / Seedance 的图像或视频编辑功能),然后再将无文字的素材作为输入。
  3. 在适用场景下,可以先生成横屏视频(横屏出现字幕的概率明显低于竖屏),然后再通过视频编辑器裁剪为竖屏。

视频中出现 Logo/水印

问题表现 — 提示词中并未提及水印,但生成的视频中带有其他视频平台的 Logo 或水印。

解决方案 — 在提示词中加入明确的限制条件:“不要生成水印”、“不要生成任何 Logo”。

风格漂移

问题表现 — 想要生成 2D 或 3D 动漫风格的视频,但输入的画风参考图偏向写实,且提示词中未强调风格,导致最终成片的画面偏向真人实拍质感。

解决方案 — 在提示词中添加明确的风格限制,例如“2D 日式动漫风”或“3D 国漫风”。如需更精准的控制,建议先将参考图转换为目标风格,再用转换后的图片生成视频。

修改前

仙侠风格发生漂移,偏向真人实拍画风

修改后

完美保持 3D 国漫 CG 仙侠画风

视频续写连接处出现跳跃/回退

问题表现 — 生成续写视频并与原视频拼接后,连接处可能会出现明显的画面跳跃,或内容出现短暂回退。

解决方案 — 目前可以通过在后期剪辑中对齐关键帧来缓解该问题(根本解决需等待后续模型迭代升级):

  1. 将需要拼接的视频片段导入剪映(CapCut)或其他视频剪辑软件中。
  2. 在首个拼接点,剪掉前一个视频片段末尾的 6 帧
  3. 同时,剪掉后一个视频片段开头的 1 帧
  4. 对所有拼接点重复此操作。
  5. 导出视频并检查拼接处播放是否平滑顺畅。

小贴士

即使对齐了帧,也可能会残留轻微的跳跃感。在生成续写时,建议尽量让片段结束在切镜头的瞬间,让下一个片段自然地从新镜头开始。

修改前

拼接处(5 秒和 20 秒位置)有明显的画面跳跃和内容回退

修改后

视频连接处平滑自然

“双胞胎”现象(多出重复人物)

问题表现 — 在多角色场景中,尤其是使用角色三视图作为参考时,同一帧画面中可能会出现两个一模一样的角色。

根本原因

  • 提示词中没有明确定义各个角色,导致模型无法精准区分角色身份。
  • 三视图或多视角参考图容易干扰角色识别,从而产生复制人效果。

小贴士

目前还没有办法 100% 避免双胞胎现象 —— 以下方法可以降低出现概率,并在多次尝试中提高成功率。

  1. 将每个角色与其参考绑定:清晰定义每个角色并指出对应的参考图,保持格式一致。例如:“张三(参考图 1)向站着的李四(参考图 2)扔出了绿色存折。”
  2. 在提示词末尾加入全局限制条件:“在整个视频中,绝不出现外貌、衣服、配饰完全相同的角色;无克隆或双胞胎效果;每帧画面中每个角色仅出现一个实例;不出现重复角色。”
  3. 优化参考素材:优先选择单人照片,避免使用三视图或多视角图。
  4. 精简提示词:不要直接把一整段脚本粘进去,冗余的文字会干扰模型。剃掉无关文本,保持指令聚焦。

修改前

视频第 8 秒时出现了一个“双胞胎”复制人

修改后

多次续写导致画质受损

问题表现 — 将生成的视频作为输入再次进行续写时,画面质感会下降。多次循环续写会导致画质折损累积,面部等区域可能出现花脸、杂色块等现象。

解决方案 —— 临时规避方案如下(根本解决需等待后续模型迭代升级):

  1. 先使用 Seedance 2.0 将原视频转换为白模结构,再以此结构作为续写输入。参考提示词: “将视频转换成白模:所有人物变为纯白色 3D 模型,无色彩、无纹理、无阴影,背景纯白,结构稳定,动作流畅。”
  2. 优先使用高分辨率的图片作为参考素材。
  3. 限制连续续写的次数,避免过多轮次的累加升级。

修改前

直接对视频成片进行续写

修改后

在续写前先将视频成片转换为白模结构

特效不符合预期

问题表现 — 仅通过文字描述某种特定的视觉特效,模型容易理解偏差。例如:提示词要求“数字 2999 以倒计时动画效果切入”,但在成片中,数字只是杂乱跳动,并没有呈现正常的倒计时效果。

解决方案 — 使用视频参考来定义特效。提供一段带有目标特效的视频片段,让模型精准理解其形态和运动逻辑。例如:“数字 2999 以视频 1 中的方式切入。”

修改前

参考素材

视频 1 — 特效参考

数字滚动效果出现无序乱跳

修改后

加入正确的数字滚动特效视频进行参考后,成片符合预期

参考角色数量过多

问题表现 — 当参考角色超过 4 个时,成片稳定性会下降:视频可能出现人数不对(多出或缺少人物)、或出现重复人物。

解决方案 — 临时规避方案如下(根本解决需等待后续模型迭代升级):

  1. 拆分生成多人图片:将角色分组,确保每张参考图中的人数不超过 4 人。例如,6 个角色可以拆分为 2 张图,每张图包含 3 人。
  2. 再通过图生视频输出:使用这些拆分好的人物合照作为参考素材,来生成最终的视频。

修改前

输入 8 个参考角色 → 生成了 9 人

修改后

先将 8 个角色合成到 2 张图片中,然后再进行图生视频

声音音色与参考音色不符

问题表现 — 使用参考音频合成配音时,生成的视频音色可能会与输入的参考音色产生较为明显的偏差。

解决方案

  1. 在提示词中加入详细的音色特质描述,例如:“使用 @音频 1 中低沉、温暖、略带沙哑的中年男性声音说话”。
  2. 尽量让生成的台词语气与参考音频的表达风格相匹配,这能大幅提升音色还原度和稳定性。

修改前

参考素材

音频 1 — 输入参考音频

生成的音色与输入的参考音频不匹配

修改后

在提示词中加入音色特质描述后,音色拟真度显著提升