使用教程
Seedance 2.0 提示词指南
Seedance 2.0 系列原生支持音视频联合生成,具备出色的语义理解与多模态交互能力。本教程将带您掌握 Seedance 2.0 提示词的撰写方法与实用技巧,助您更高效地生成符合创作预期的优质视频。
基础公式
Seedance 2.0 模型支持同时参考视频、图像和音频资产,能够精准锁定角色外观、运动效果、视觉风格及声音音色等。这大幅降低了提示词的撰写门槛:只需套用几个简单的主公式,即可引导模型充分利用您的多模态资产,快速生成满足特定需求的视频。
基于视频参考的任务主要分为三类:多模态参考、视频编辑和视频续写。请根据您的任务类型选择对应的套用公式。
多模态参考
提取参考素材中的特定元素(如主体、风格、场景或声音)并生成全新的视频。
- 适用场景:动作转移、主体套用、氛围借鉴等任务
- 推荐句式:
- 图像参考:参考
<图像 N>中的<主体 N>,生成…… - 视频参考:参考
<视频 N>中的<动作 / 镜头轨迹 / 风格 / 声音>,生成…… - 音频参考:参考
<音频 N>的音色,生成……
视频编辑
在现有视频的基础上进行局部或全局修改。默认情况下,未提及的内容将保持不变。
- 适用场景:局部替换、主体消除、属性改变等任务
- 推荐句式:
- 新增元素:明确描述
<元素特征>+<出现时间>+<出现位置> - 修改元素:严格修改
<视频 N>,将<原特征>替换为<新特征> - 删除元素:指出需要移除的元素;若想让某些元素保持不变,在提示词中明确强调它们能带来更好的效果
视频续写
在时间轴上延伸原视频,同时保持视听风格、主体和叙事的一致性。
- 适用场景:剧情延续、动作延伸、补全缺失片段等任务
- 推荐句式:
- 视频单向续写:向后/向前延伸
<视频 N>,生成…… - 多段首尾拼接:
<视频 1>+<过渡描述>+ 然后<视频 2>+<过渡描述>+ 然后<视频 3>
注意
在进行视频编辑或续写任务时,请直接将视频代称为 <视频 N>。切记不要写“参考 <视频 N>”,否则任务可能会被误识别为参考类任务。
组合任务
上述三种任务类型也可以结合使用。
- 适用场景:在编辑一个视频的同时,参考另一个素材的元素
- 推荐句式:参考
<图像/视频 N>中的[参考维度],严格修改<视频 X>,[具体修改内容]
提示词案例
以下为您提供 Seedance 2.0 在不同场景下的提示词案例,助您轻松玩转多模态参考控制和文本生成。只需选取与您当前任务最接近的句式,稍作调整即可直接使用。
文本生成
品牌文案 / Slogan
提示词模板:
「文字内容」+「出现时间」+「出现位置」+「入场方式」,「文字特征(如颜色、风格)」
小贴士
Seedance 2.0 会自动根据上下文配对相符的文字风格。若您对文字外观有严格要求,请参考下文“多图参考 → Logo参考”部分。
参考素材

生成效果
提示词 (Prompt)
手绘动漫风格。三个人聚在一起,快乐地分食着图像 1 中的炸鸡,现场氛围温馨融洽。随后画面逐渐模糊,镜头中央浮现出文字 “快乐尽在 Seedance”。
视频字幕
提示词模板:
字幕出现在画面底部,内容为“……”,其出场节奏与音频台词完美同步。
生成效果
参考素材

提示词 (Prompt)
生成带旁白的视频。一个富有磁性且深沉的男声旁白说道:“在浩瀚的宇宙中,我们的世界不过是沧海一粟。然而,哪怕历经重重磨难,生命依然在此繁衍不息。”画面随之从深夜缓慢过渡到黎明——随着太阳从群山后升起,繁星逐渐隐去。画面底部浮现与旁白同步的字幕。
生成效果
参考素材

提示词 (Prompt)
图中两人正在办公室聊天。女人率先开口:“你每次卡点到,是不是很享受这种刚刚好的感觉?”男人微笑着回答:“我有我的节奏。”两人的交谈显得轻松自然,画面底部同步浮现切合口型的对话字幕。
对话气泡
提示词模板:
「角色」说道:“……”;说话时,其身旁浮现一个带有所说台词的对话气泡。
生成效果
参考素材

提示词 (Prompt)
图像 1 中身着运动服的两人正在学校操场上跑步。女孩看着男孩,一脸自信地鼓励道:“我们一定可以的!”镜头切换至男孩的特写,他略显迟疑地反问:“你确定吗?”镜头再次切回女孩的中特写,她语气坚定、充满希望地大声回答:“当然!”说话者的身旁随即浮现对应的台词气泡。
生成效果
参考素材

提示词 (Prompt)
参考图像 1 和图像 2 中的女孩:在草莓地里,她摘下一颗草莓咬了一口,并笑着说:“这味道绝了!”她的身旁同步浮现带此台词的对话气泡。
图像参考
Seedance 2.0 支持多视角主体参考,以及场景图、分镜脚本等多图参考输入。
若图像顺序对生成效果有影响,请按顺序上传,并在提示词中使用:图像 1、图像 2……图像 n 的命名规则进行精准指代。
多视角主体参考
只需在提示词中明确参考目标,模型就会执行指令。以下为参考范例。商品类:
消费电子产品
生成效果
参考素材

提示词 (Prompt)
提取图像 1、图像 2 和图像 3 中的相机,并将背景更换为纯白色。相机放置在白色桌面上,镜头对其进行近距离对焦,随后以相机为主体缓慢进行环绕旋转拍摄,清晰展现相机的正面、侧面及背面细节。
家居用品
生成效果
参考素材

提示词 (Prompt)
在暖色调的家居场景下,用中景呈现参考图中的保温杯。镜头平滑推成特写,一只手自然入镜,握住保温杯杯身将其提起,镜头跟随手部微弱的旋转动作全方位展示商品。
人物类:
参考素材

生成效果
提示词 (Prompt)
参考图像 1、图像 2 和图像 3 中的女人,生成她在咖啡馆里品尝蛋糕的场景视频。
多图综合参考
Logo 参考
生成效果
参考素材

提示词 (Prompt)
背景是未来都市中霓虹闪烁的空中廊道,飞行器在全息广告牌间穿梭。参考图像 2 中的女孩:首先用中景展现女孩放飞一个带有全息投影的银色悬浮天灯,随后镜头拉远,展现漫天漂浮的天灯。画面逐渐模糊,浮现图像 1 中的 Logo。视频整体风格:3D赛博朋克科幻动画。
多主体参考
生成效果
参考素材

提示词 (Prompt)
参考图中的猫和狗:在温馨的公寓里,狗趴在地上吃着碗里的狗粮;猫咪走过来,用爪子轻轻拍了拍狗;狗看到猫后停止进食,猫顺势依偎在狗的身旁。暖色调画面。
多元素参考
生成效果
参考素材

提示词 (Prompt)
场景设在图像 4 中的餐厅里,店内顾客熙熙攘攘。图像 1 中的女孩身着图像 2 中的服饰,正在吧台整理物品。图像 3 中的男孩作为顾客走上前去,试图询问女孩的联系方式。画面右下角全程保留图像 5 中的 Logo。
多格分镜参考
生成效果
参考素材

提示词 (Prompt)
参考图中的分镜剧本,生成一段激烈的打斗视频。画面依次呈现每个分格的构图,随后两名角色展开猛烈的近身搏斗。
分镜脚本参考
生成效果
参考素材

提示词 (Prompt)
参考分镜图像 3 的画幅构图:一个女孩焦急地等待爸爸做饭并说道:“아빠, 배고파요! 밥 다 됐어요?”(爸爸,我饿了!饭做好了吗?),其长相参考图像 1。随后镜头右摇,切换至图像 4 的画幅构图;爸爸的长相参考图像 2,他回答道:“거의 다 됐어, 조금만 기다려!”(快好啦,再等一小会!)。随后画面切回女儿略显失落的特写,她说道:“아직 멀었어요? 맛있는 냄새 나는데…”(还没好吗?闻起来好香啊……)。接着切回爸爸的特写,他笑着说:“이제 진짜 금방이야。 "빨利빨利" 하지 말고 손부터 씻고 와!”(马上就真的好啦。别催啦,去洗手准备吃饭!)
视频参考
Seedance 2.0 原生支持视频参考,只需在提示词中明确指出需要生成的场景以及具体参考的维度即可。
若视频的上传顺序对效果有影响,请按顺序上传,并在提示词中使用:视频 1、视频 2……视频 n 的命名规则进行指代。
动作参考
影视制作
生成效果
参考素材

提示词 (Prompt)
参考视频 1 中的人物动作和运镜方式,生成一段图像 2 与图像 1 之间打斗的视频——其中图像 2 是左边的人,图像 1 是右边的人。搭配节奏感强的背景音乐。
创意营销
生成效果
参考素材
提示词 (Prompt)
参考视频 1 中马儿奔跑的姿态,生成一匹金色骏马在草原上飞奔的画面,随后定格其矫健的奔跑身姿,并幻化演变成为一款马形黄金吊坠。
运镜轨迹参考
生成效果
参考素材

提示词 (Prompt)
参考视频 1 的镜头移动轨迹,制作科技园区概念片:以图像 1 中的高楼为视觉中心,沿用同样的第一人称俯冲运镜,展现出图像 1 园区十足的未来科技感。
特效参考
片场视效
生成效果
参考素材

提示词 (Prompt)
参考视频 1 中的金色粒子特效:当图像 2 中的角色吹奏笛子时,同样的金色粒子光芒环绕着其旋转起舞。
创意变装/变形效果
生成效果
参考素材

提示词 (Prompt)
参考视频 1 中的特效,让图像 1 中的女孩生出同样闪耀的翅膀,翅膀舒展生长的动画轨迹需与参考视频保持一致。
视频编辑与处理
Seedance 2.0 完美支持视频编辑任务:包括新增、删除或修改特定元素;对视频进行双向延展、以及多轨道补全。
若视频的上传顺序对效果有影响,请按顺序上传,并在提示词中使用:视频 1、视频 2……视频 n 的命名规则进行指代。
增、删、改特定元素
新增元素
生成效果
参考素材
提示词 (Prompt)
在视频 1 的台面上添加炸鸡、烤披萨以及其他休闲零食。
删除元素
生成效果
参考素材
提示词 (Prompt)
清除视频 1 中办公桌上的其他零件和杂乱工具,保持桌面干净整洁——仅保留他们两人手中拿着的物件。
修改元素
生成效果
参考素材

提示词 (Prompt)
将视频 1 中的香水瓶瓶身替换为图像 1 中的面霜瓶,保持手部动作和相机运镜轨迹完好不变。
视频双向续写
注意
模型将自动对衔接处进行智能无缝过渡处理——输入视频中已包含的画面不会被重复渲染生成。
向后延伸
生成效果
参考素材
提示词 (Prompt)
续写视频 1 之后的画面:两位迟到的男士气喘吁吁地朝他们跑来,五个人终于顺利碰头并热络地攀谈起来。
向前延伸
生成效果
参考素材
提示词 (Prompt)
向前延伸视频 1:给白衣男子一个越肩镜头,他宽慰道:“情况没那么糟,你只是压力太大了。每个人都会经历这段时期,熬迎头赶上就好了。”
多段首尾拼接
小贴士
- Seedance 2.0 最多支持导入 3 段输入视频,总时长建议不要超过 15 秒。
- 合成时系统会自动对前后视频的衔接段进行裁切,仅保留无缝融合所需的必要过渡帧。
生成效果
参考素材
提示词 (Prompt)
视频 1——在树叶着地的那一瞬间,激荡起一阵耀眼的金色光流粒子特效;随后一阵大风刮过画面——紧接着切入视频 2。
进阶公式
Seedance 2.0 在本质上扮演着多模态 AI 导演的角色:它能够同时读取你的文本提示词、图片、视频和音频,并在内部将其拆解为空间层(画面中包含什么)和时间层(画面随时间如何变化),以此来理解并生成视频画面。
因此,一条优秀的提示词不应该堆砌“广告文案式的形容词”,而应该是一份工程化的指令:谁、在什么场景、做什么动作、镜头如何运动、以什么顺序进行——将这些要素精准地投喂给空间层和时间层。其核心公式如下:
进阶提示词公式:精准主体 + 动作细节 + 场景与环境 + 光影与色调 + 镜头运动 + 视觉风格 + 画面质量 + 限制条件
简而言之:先锁定谁在做什么,接着交代在哪里以及什么氛围,然后告诉模型怎么拍,最后通过风格、质量和限制词来规范生成结果。下面我们将逐一拆解这些要素。
1. 明确定义主体
单张参考图通常包含多个元素。为了精准指代特定对象,你必须明确定义主体。主体可以是一个人、一个道具或一个场景。
- 推荐模式:将
<图片/视频 N>中[主体的核心特征]定义为<主体 N> - 核心特征要求:使用 2-3 个清晰、稳定、静态的特征(衣着、发型、外貌、类别等),以便精确识别主体
- 示例:
- 将图片 1 中穿红裙、戴草帽的女人定义为主体 1
- 将图片 1 中穿红裙、戴草帽的女人定义为张红
注意
- 主体每次出现时都要进行显式指代,切勿让模型猜测。支持以下两种写法:
- 对于没有预先定义主体的简单场景,每次出现该主体时,写作
<主体 N>@<图片 N>,以此强调主体与素材的绑定关系。例如:张三@图片 1。 - 对于已预先定义主体的场景,后续要持续使用相同的标签。例如:将视频 1 中的高个子男人定义为警察,矮个子男人定义为小偷,之后便在全文中交替使用警察和小偷进行指代。
- 描述保持简练。避免冗余信息以及语义冲突(例如对同一主体的特征进行前后矛盾的描述)。
- 尽量通过参考图来表达空间位置关系,避免使用复杂的文字描述。
2. 使用分镜头叙事
模型在内部会将空间和时间解耦。因此,对于复杂的视频,最理想的提示词结构是分镜头时间轴:将视频拆解为若干个镜头,并按照事件发生的先后顺序,动态描述每个镜头内部的细节:谁 + 在哪里 + 在做什么 + 镜头怎么动。
实用建议:先为视频写一份简单的“镜头 1 / 镜头 2 / 镜头 3”大纲,然后将其融合成一条完整的提示词。
- 欠佳示例:“一个男人在街上神色慌张地奔跑,画面非常有电影感。”
- 推荐示例:
- 镜头 1:小巷侧面视角;男人缓缓起跑,伴随急促的呼吸感。
- 镜头 2:男人撞翻了路边的水果摊;镜头快速甩过,定格在他惊恐万分的脸部特写上。
- 镜头 3:男人翻过一堵矮墙并消失;镜头缓缓拉远,定格在空无一人的街道上。
具体规则
- 使用
Shot 1、Shot 2、Shot 3等镜头标记,并按照情节发生的先后顺序组织内容。无需强行规定每个分镜头的时长,让模型自然控制主次和叙事节奏。
小贴士
目前模型对精准时长(如“0-3秒”)的控制尚不稳定。强行指定具体秒数可能会导致画面生成异常。
建议每个镜头的描述按照如下顺序组织:
- 运镜或转场:例如“全景缓缓推进”、“固定机位”、“切至……”等。
- 主体的动作与神态:核心人物/对象的关键动作和神情变化。
- 位置或空间变化:主体的场景、所处位置或空间关系的变化。
- 音频信息:当前镜头配有的音效、台词或背景音乐。
3. 动作描述规范
- 细化到具体部位 + 量化动作幅度——将动作拆解到手、腿、头、肩膀和背部细节,并明确幅度、速度和力度。例如:缓缓抬手、快速转头、用力蹬地起跑、微微低下头。
- 首选平缓、温柔、连贯的微动作——优先考虑慢速、饱满且过渡自然的微观动作,避免使用狂奔、大跳、剧烈翻滚等高爆发、大动态的动作。例如:缓缓踱步、轻柔抬手、神色微动轻轻低头、丝滑地坐下。
- 描述动作之间的衔接——点明前后动作的连贯性和惯性过渡,让动态更加流畅自然。例如:顺着转身的惯性顺势抬手、由静止自然过渡到抬起手臂。
- 将情绪转化为具象的神态与肢体细节——与其使用“非常伤心”、“暴怒”等抽象词汇,不如通过具体躯体神态来传达。参考下表:
| 抽象情绪描述 | 具象神态/躯体动作细节 |
|---|---|
| 悲伤 | 耷拉着头,肩膀微微颤抖,眼圈泛红,手指不自觉地抓紧衣角,眼泪在眼眶里打转却强忍着不落下来 |
| 喜悦 | 嘴角止不住往上扬,眉眼舒展,步伐变得轻盈欢快,嘴里哼着不知名的小曲,甚至忍不住原地转个圈 |
| 紧张/焦虑 | 频繁看表,手指有节奏地、不停地敲击桌面,呼吸急促,眼神飘忽不定,下意识咬手指甲 |
| 愤怒 | 双手握拳,咬紧牙关,胸口剧烈起伏,眼神凌厉,每一个字都像是从牙缝里挤出来的一样 |
| 释怀 | 长一口气,紧绷的肩膀完全放松下来,脸上浮现出久违的淡淡微笑,目光投向远方 |
4. 运镜与镜头语言
模型对镜头专业词汇的理解非常到位,请直接使用标准电影运镜名词,例如“中景、特写、全景、慢速推进、平滑横移拉镜头、固定机位”等。
注意
单个镜头内建议只指定 1 种运镜轨迹。同时要求推、拉、摇、移容易导致画面不稳定。
5. 质量、风格与限制词
质量、风格和限制词是精确控制输出画面的关键。它们能为模型框定创作边界,统一画面质感与美术走向,并有效抑制坏肢、噪点和画面不受控漂移,是保障生成效果稳定、合规的护栏。
1. 画面质量——界定画面的清晰度、细节纹理和光影质感,拉高生成画面的下限。例如:高动态范围、细节丰富、电影质感、色彩自然、光影意境润泽。
2. 视觉风格——确立整体的美术走向和画面色调,统一艺术氛围。例如:赛博朋克冷调蓝紫配色、复古胶片质感、日系清新色调。
3. 限制性术语——至关重要。反向限制词能有效压制画面中崩坏的肢体、畸变和不合常理的元素,框定画幅边界,极大提高生成稳定性。常用模板:
- 无字幕要求:“画面干净无字幕”、“避免生成任何文字及字幕信息”
- 无徽标要求:“不要生成任何标志、图标”
- 无水印要求:“画面无水印痕迹”
6. 实战案例
以下通过两个实战案例,直观展示上述进阶公式和关键要素如何融入一条真实的提示词中。
参考素材(Assets):
- @Image 1:女主角的半身正面照
- @Image 2:宿舍场景参考图
- @Video 1:室内对话镜头参考视频(中景推拉或轻微横移)
- @Audio 1:室内环境噪音或轻音乐
提示词 (Prompt)
图 @Image 1 中的女生为女主角;图 @Image 2 为宿舍场景风格参考;运镜节奏参考视频 @Video 1。 Shot 1:黄昏时分,女生 @Image 1 迈着轻快的步伐走到宿舍门口 @Image 2。镜头跟拍中景,平稳推进,温暖的夕阳余晖透过走廊窗户洒进来。她在门口停下脚步,深吸了一口气,神色中透出一丝紧张。 Shot 2:女生 @Image 1 推门走进宿舍。画面切至室内中景:舍友们正整理书本,纷纷抬头看向她,其中一人笑着问道 {考得怎么样?通过了吗?}。镜头在众人半身人像特写间匀速切换。 Shot 3:女生 @Image 1 先是沮丧地低下头——镜头拉近至其脸部特写——随即她忍不住扑哧一笑,大笑着说出台词 {骗你们的啦}。舍友们笑闹着上前打闹追逐,镜头缓缓拉远,定格在充满欢声笑语的宿舍全景画面。 全局要求:高清纪录片级电影质感,色调温暖,光影柔和;人物面部稳定不畸变,肢体动作连贯自然,无卡顿频闪;环境声自然融合音频素材 @Audio 1。
实用技巧
文本生成
Seedance 2.0 支持在生成的视频中融入常见的文本内容。模型会根据上下文自动适配契合的字体风格和颜色;你也可以在提示词中显式指定文本的颜色、样式、入场动画、出现时间以及在画面中的相对位置。由于对字符渲染的拟合度不同,为了获得最佳渲染效果,建议优先选用常用汉字或英文字符,避免使用生僻字和特殊符号。目前支持的场景包括口号 (slogan)、字幕、以及对话气泡等,具体应用模式可参考上文的 Text Generation 示例。
长焦延展 vs. 分段拼接
- 连续长镜头(视频延展):极度适合在同一固定空间内由对话驱动的“静止型”日常场景。如长谈、情感层层铺垫、沿单一路径的运镜走位,能带来一镜到底的沉浸感。
- 场景/动作转场(分段拼接):极度适合带有情节转折或复杂高动态的“动作型”镜头。如追逐、对打、快节奏蒙太奇。将这些片段独立生成,最后在后期中剪接在一起,叙事节奏和视觉冲击力更佳。
在实际项目创作中,这两种策略通常会结合使用:先通过视频延展获得一段连贯的对话镜头,再通过后期拼接插播空镜头或过渡镜头,在保持沉浸感的同时让叙事节奏张弛有度。
参考素材配置策略
我们可以将输入的参考素材分为以下四种功能角色:
- 角色锚定(Character anchor):精准锁定人物的外形特征
- 场景基调(Scene tone-setter):精确锁定场景环境与视觉风格
- 镜头参考(Camera reference):精确参考镜头语言与动作脉络
- 节奏与氛围控制(Rhythm & mood):利用音频来控制画面情感起伏和人声音色
推荐配置组合(共 4-5 个素材):1-2 张核心人物图(面部特写/全身照)+ 1 张场景参考图 + 1 个运镜参考视频 + 1 段音频片段。
小贴士
无需一味填满素材槽位的上限。提示词中引用的素材过多会导致模型难以调和权重,极易出现风格打架、主体指向混乱以及最终生成画面发生严重偏移的情况。
使用指南与规范
语种一致性
保持同一句对话中的语言统一。避免在同一句话中中英夹杂(专有名词除外)。
特殊符号规范
规范且统一地使用特定符号,有助于模型准确区分不同类别的信息流:
| 信息类型 | 专用符号 | 应用示例 |
|---|---|---|
| 音乐 | () | (背景中响起节奏明快的摇滚乐) |
| 音效 | <> | <远处传来狗吠声> |
| 对话 | {} | {Hello, world}。如需输出非中英等常用语种的台词,需要特意标注语种,例如:用日语说 {こんにちは}。 |
| 花字 / 旁白字幕 | 【】 | 【第一章:启程】 |
常见问题解答
角色人脸漂移(ID 漂移)
问题表现 — 生成的角色与参考图不一致,或者在视频播放过程中人脸发生变化(即 ID 漂移),有时甚至因形似某些明星而触发审核过滤。
根本原因 — 人脸参考不够精准高效:
- 参考图混杂:将人脸参考与全身姿态、服装参考或细节图混在一起,拼成了一张图。
- 人脸在画面中占比过小:在混杂的参考图中,人脸区域太小,导致模型降低了对面部特征的权重,并受到背景或其他元素的干扰。
解决方案 — 提高人脸参考图的独立性与权重:
- 准备一张专用的人脸特写图:除了全身照外,再额外提供一张仅包含角色头部的图片(即免冠大头照 —— 最好是表情自然、几乎没有肩膀和复杂背景的纯面部图)。
- 在提示词中明确定义主体:例如“主体 1 的面部特征参考图 1(大头照);妆容和造型参考图 2(全身照)”。
- 将重要素材前置:素材需要参考得越精准,在提示词中出现的位置就要越靠前。
注意
建议使用“大头照 + 全身照”的组合作为角色参考。不推荐使用多视角人设图(三视图) —— 这类图包含同一人物的多个角度,模型容易将其识别为多个不同的个体,从而加剧 ID 漂移问题。
修改前
视频中途角色人脸发生变化,且形似某位明星
修改后
人脸全程与参考图保持高度一致
视频意外出现字幕
问题表现 — 提示词中并未要求添加字幕,但生成的视频中却带有字幕。
小贴士
目前还没有办法 100% 避免字幕生成 —— 以下方法可以降低出现概率,并在多次尝试中提高成功率。
- 在提示词中加入明确的限制条件:“视频不包含任何字幕”、“避免生成任何文字或字幕”。
- 如果参考图/视频中的文字并非必不可少,请先将其去除(例如使用 Seedream / Seedance 的图像或视频编辑功能),然后再将无文字的素材作为输入。
- 在适用场景下,可以先生成横屏视频(横屏出现字幕的概率明显低于竖屏),然后再通过视频编辑器裁剪为竖屏。
视频中出现 Logo/水印
问题表现 — 提示词中并未提及水印,但生成的视频中带有其他视频平台的 Logo 或水印。
解决方案 — 在提示词中加入明确的限制条件:“不要生成水印”、“不要生成任何 Logo”。
风格漂移
问题表现 — 想要生成 2D 或 3D 动漫风格的视频,但输入的画风参考图偏向写实,且提示词中未强调风格,导致最终成片的画面偏向真人实拍质感。
解决方案 — 在提示词中添加明确的风格限制,例如“2D 日式动漫风”或“3D 国漫风”。如需更精准的控制,建议先将参考图转换为目标风格,再用转换后的图片生成视频。
修改前
仙侠风格发生漂移,偏向真人实拍画风
修改后
完美保持 3D 国漫 CG 仙侠画风
视频续写连接处出现跳跃/回退
问题表现 — 生成续写视频并与原视频拼接后,连接处可能会出现明显的画面跳跃,或内容出现短暂回退。
解决方案 — 目前可以通过在后期剪辑中对齐关键帧来缓解该问题(根本解决需等待后续模型迭代升级):
- 将需要拼接的视频片段导入剪映(CapCut)或其他视频剪辑软件中。
- 在首个拼接点,剪掉前一个视频片段末尾的 6 帧。
- 同时,剪掉后一个视频片段开头的 1 帧。
- 对所有拼接点重复此操作。
- 导出视频并检查拼接处播放是否平滑顺畅。
小贴士
即使对齐了帧,也可能会残留轻微的跳跃感。在生成续写时,建议尽量让片段结束在切镜头的瞬间,让下一个片段自然地从新镜头开始。
修改前
拼接处(5 秒和 20 秒位置)有明显的画面跳跃和内容回退
修改后
视频连接处平滑自然
“双胞胎”现象(多出重复人物)
问题表现 — 在多角色场景中,尤其是使用角色三视图作为参考时,同一帧画面中可能会出现两个一模一样的角色。
根本原因:
- 提示词中没有明确定义各个角色,导致模型无法精准区分角色身份。
- 三视图或多视角参考图容易干扰角色识别,从而产生复制人效果。
小贴士
目前还没有办法 100% 避免双胞胎现象 —— 以下方法可以降低出现概率,并在多次尝试中提高成功率。
- 将每个角色与其参考绑定:清晰定义每个角色并指出对应的参考图,保持格式一致。例如:“张三(参考图 1)向站着的李四(参考图 2)扔出了绿色存折。”
- 在提示词末尾加入全局限制条件:“在整个视频中,绝不出现外貌、衣服、配饰完全相同的角色;无克隆或双胞胎效果;每帧画面中每个角色仅出现一个实例;不出现重复角色。”
- 优化参考素材:优先选择单人照片,避免使用三视图或多视角图。
- 精简提示词:不要直接把一整段脚本粘进去,冗余的文字会干扰模型。剃掉无关文本,保持指令聚焦。
修改前
视频第 8 秒时出现了一个“双胞胎”复制人
修改后
多次续写导致画质受损
问题表现 — 将生成的视频作为输入再次进行续写时,画面质感会下降。多次循环续写会导致画质折损累积,面部等区域可能出现花脸、杂色块等现象。
解决方案 —— 临时规避方案如下(根本解决需等待后续模型迭代升级):
- 先使用 Seedance 2.0 将原视频转换为白模结构,再以此结构作为续写输入。参考提示词: “将视频转换成白模:所有人物变为纯白色 3D 模型,无色彩、无纹理、无阴影,背景纯白,结构稳定,动作流畅。”
- 优先使用高分辨率的图片作为参考素材。
- 限制连续续写的次数,避免过多轮次的累加升级。
修改前
直接对视频成片进行续写
修改后
在续写前先将视频成片转换为白模结构
特效不符合预期
问题表现 — 仅通过文字描述某种特定的视觉特效,模型容易理解偏差。例如:提示词要求“数字 2999 以倒计时动画效果切入”,但在成片中,数字只是杂乱跳动,并没有呈现正常的倒计时效果。
解决方案 — 使用视频参考来定义特效。提供一段带有目标特效的视频片段,让模型精准理解其形态和运动逻辑。例如:“数字 2999 以视频 1 中的方式切入。”
修改前
参考素材
数字滚动效果出现无序乱跳
修改后
加入正确的数字滚动特效视频进行参考后,成片符合预期
参考角色数量过多
问题表现 — 当参考角色超过 4 个时,成片稳定性会下降:视频可能出现人数不对(多出或缺少人物)、或出现重复人物。
解决方案 — 临时规避方案如下(根本解决需等待后续模型迭代升级):
- 拆分生成多人图片:将角色分组,确保每张参考图中的人数不超过 4 人。例如,6 个角色可以拆分为 2 张图,每张图包含 3 人。
- 再通过图生视频输出:使用这些拆分好的人物合照作为参考素材,来生成最终的视频。
修改前
输入 8 个参考角色 → 生成了 9 人
修改后
先将 8 个角色合成到 2 张图片中,然后再进行图生视频
声音音色与参考音色不符
问题表现 — 使用参考音频合成配音时,生成的视频音色可能会与输入的参考音色产生较为明显的偏差。
解决方案:
- 在提示词中加入详细的音色特质描述,例如:“使用 @音频 1 中低沉、温暖、略带沙哑的中年男性声音说话”。
- 尽量让生成的台词语气与参考音频的表达风格相匹配,这能大幅提升音色还原度和稳定性。
修改前
参考素材
生成的音色与输入的参考音频不匹配
修改后
在提示词中加入音色特质描述后,音色拟真度显著提升