Seedance 2.0 完整指南:功能、对比与使用教程

面向专业人士的 Seedance 2.0 完整指南。对比 Kling、Veo 和 Sora 的功能。掌握多模态 AI 视频的高级技巧。在 Morphic 上试用。

什么是 Seedance 2.0?

Seedance 2.0 是字节跳动的先进多模态 AI 视频模型,它把图片、视频、音频和文本输入结合起来,带来前所未有的创作控制力。本指南把 Seedance 与 Kling、Veo 和 Sora 做对比,并展示专业创作者如何在 Morphic 上掌握多模态视频工作流。

传统的文生视频模型只能依赖写下来的提示词,Seedance 2.0 不同:你可以直接把想要的东西通过视觉和听觉参考展示给模型看。上传参考图来确定风格与构图,用视频片段演示想要的镜头运动或动作,加入音频来确立氛围与节奏,再配上详细的文本提示词来精确指挥创作。

另有两篇配套指南深入具体问题:电影级 Seedance 2.0 视频讲手艺层面,Seedance 2.0 提示词被标记该怎么办则针对生成被拒绝的情况。

为什么专业视频创作要用 Seedance 2.0

Seedance 2.0 解决的是 AI 视频生成的根本局限:描述与构想之间的鸿沟。你不必再费力用文字去描述复杂的镜头运动、角色细节或视觉特效,而是可以直接给出范例。这种多模态方式带来:

  • 通过图片参考实现精确的视觉控制
  • 通过视频参考实现准确的运动复现
  • 通过音频整合实现节奏与情绪的同步
  • 跨多个镜头保持角色与风格稳定
  • 保持画面延续的复杂场景转换

模型擅长同时理解并综合多种参考类型,因此在商业制作、内容创作和专业视频工作流中尤其有价值。

Seedance 2.0 对比 Kling、Veo 与 Sora:功能对照

评估 AI 视频生成工具时,弄清各家平台的具体能力,才能为自己的工作流选对工具。下面是 Seedance 2.0 与几个主要替代方案的对比:

功能Seedance 2.0Kling 3.0Veo 3.1Sora
多模态输入支持图片、视频、音频、文本图片、视频、音频、文本图片、文本图片、文本
单次最长时长最长 15 秒最长 15 秒最长 8 秒(可延长至 60 秒以上)最长 60 秒
音频整合直接上传音频并作为参考原生音频,支持唇形同步与多语言对白原生音频,含音效与对白仅支持文本生成音频
视频参考能力完整复现运动与镜头完整复现运动与镜头,并有 AI 导演功能风格迁移与参考图(最多 3 张)有限
最高输出分辨率4K(10-bit)4K4K1080p

关键差异:

多模态灵活性:Seedance 2.0 和 Kling 3.0 都提供完整的多模态支持,包括直接上传视频和音频文件。Veo 3.1 支持图片参考(最多 3 张),但音频是生成的,而不是参考来的。Sora 仍以文本和图片为主。

视频参考的深度:Seedance 2.0 与 Kling 3.0 都擅长从参考素材中复现复杂的镜头运动、编舞和特效。Kling 3.0 的"AI 导演"功能可自动完成多镜头场景编排。Veo 3.1 侧重图生视频,角色稳定性强,但在视频到视频的运动复现上着力较少。

音频能力:Seedance 2.0 允许直接上传音频文件,用于精确的情绪控制和节拍同步。Kling 3.0 原生生成多语言音频,并在 5 种语言下实现准确的唇形同步。Veo 3.1 原生生成音频,但不接受音频文件参考。Sora 只能根据文本描述生成音频。

时长与延长:Sora 的单次生成最长(最长 60 秒),而 Veo 3.1 的延长功能可以把片段串到 60 秒以上。Seedance 2.0 与 Kling 3.0 都支持 15 秒生成,并具备延长能力。

分辨率与画质:Seedance 2.0 最高输出 4K,采用 10-bit 编码,能保留色彩层次,方便 HDR 与调色。这在纯分辨率上与 Kling 3.0、Veo 3.1 持平,所以真正的决定因素通常是参考控制力,而不是像素数。

编辑已有素材:Seedance 2.0 把上传的视频当作可以编辑的对象,而不只是模仿的样板。你可以在片段内部增加、删除或替换元素,向前或向后延长时间,也可以把多个片段缝成一个连续的整体。编辑在这里是一等公民,而不是附加功能,这正是它能让客户已经通过的素材继续可用的原因。

该用哪一个 Seedance 2.0 模型

Seedance 2.0 是一个包含三个模型的家族,功能集相同,区别在于质量与成本:

模型适用场景最高分辨率
Seedance 2.0最高的生成质量;三者中唯一能输出 4K 的4K
Seedance 2.0 Fast不需要顶级画质时,兼顾速度与成本720p
Seedance 2.0 Mini成本效率最佳,适合大批量迭代720p

一个实用的做法:先在 Mini 或 Fast 上打草稿,等提示词和参考素材都调顺了,再用完整版 Seedance 2.0 跑最终成片。

信息截至 2026 年 7 月准确。功能与可用性可能变动。

在 Morphic 上试用 Seedance 2.0 →

Seedance 2.0 的核心功能与能力

多模态输入系统

Seedance 2.0 接受四种可以组合使用的输入类型:

图片输入(最多 9 张)

  • 确定视觉风格与美学方向
  • 确立角色外观并保持一致
  • 设定场景构图与取景
  • 指定产品细节以便准确还原
  • 控制光线、调色与氛围

视频输入(最多 3 段,合计不超过 15 秒)

  • 参考特定的镜头运动与摄影手法
  • 复现运动模式与编舞
  • 复制场景转换与剪辑节奏
  • 演示特效与视觉技巧
  • 展示角色动作与互动

音频输入(MP3 或 WAV,最多 3 个文件,每个 2-15 秒,合计不超过 15 秒)

  • 用音乐确立氛围与情绪基调
  • 用节奏与节拍结构控制快慢
  • 加入特定音效或环境声
  • 匹配对白的嗓音特征
  • 让画面变化与音频提示同步

文本提示词(自然语言)

  • 引导叙事与故事推进
  • 指定参考素材里没有展示的动作与运动
  • 描述场景转换与时机
  • 说明参考素材该如何被使用
  • 补充视觉参考之外的细节

关于上限:不存在跨类型的总数上限。上限是按类型分别设的(最多 9 张图片、3 段视频、3 个音频),而真正的约束不是上限,而是你的克制:字节跳动建议使用的参考素材远少于允许的数量。不过确实有一种组合根本不被支持。只有文本加音频,以及只有音频,都无法生成。每次生成都需要文本,而音频永远只能与视觉参考同行。

参考能力的架构

Seedance 2.0 的核心创新在于它的参考理解系统。它不是把输入当成简单的风格指引,而是从每份参考素材中分析并提取具体元素:

从图片中:构图结构、角色特征、物体细节、布光方案、色彩关系、空间排布、风格特征

从视频中:摄影机运动轨迹、运动速度与加速度、取景变化、主体动作与时机、特效实现方式、转场手法

从音频中:节奏与节拍模式、音调情绪与氛围、音量动态、音效出现的时机、嗓音特征

这种颗粒度的理解,让你可以明确指定每份参考中的哪些方面该影响生成,从而对最终结果实现精确控制。

基础生成质量的提升

除了多模态能力,Seedance 2.0 在底层质量上也有实打实的进步:

真实的物理动态:物体和人物的运动符合真实物理规律。衣物自然垂坠,液体流动可信,元素之间的互动遵循现实世界的规则。

流畅的运动表现:连续动作不会出现突兀的跳变或形变伪影。复杂的多步动作在整个执行过程中保持稳定。

精确的提示词理解:模型能准确理解细节指令,包括空间关系("在背景中他的身后")、有序的镜头序列,以及多主体的复杂场景。精确时间码是例外,下文会详细说明。

稳定的风格保持:生成开头确立的视觉特征会一直保持稳定。角色外观、光线条件和艺术风格不会随场景推进而漂移。

复杂动作的执行:能处理有难度的序列,比如打斗编排、精细的手部动作、说话时的面部表情,以及多角色之间的协同互动。

准备好体验多模态控制了吗? 在 Morphic 上开始用 Seedance 2.0 创作 →

技术规格

参数规格
生成时长4-15 秒
输出分辨率480p、720p、1080p、4K(Seedance 2.0)。Fast 与 Mini 最高 720p
画幅比例21:9、16:9、4:3、1:1、3:4、9:16,另有跟随参考图的自适应设置
输出格式MP4。4K 采用 H.265(HEVC)10-bit 编码
音频输出整合音效、对白与背景音乐生成
图片输入JPEG、PNG、WEBP、BMP、TIFF、GIF、HEIC、HEIF。每张最大 30MB
视频输入MP4、MOV(H.264 或 H.265),24-60fps,每段 2-15 秒,每段最大 200MB
音频输入MP3、WAV。每个 2-15 秒,每个最大 15MB

关于输出设置有两点要注意。没有 2.35:1 这个选项,所以想要宽银幕质感,应该选 21:9,而不是在提示词里要求 2.35:1。另外因为 4K 使用 H.265,有些浏览器和播放器无法直接预览,尽管文件本身没有问题。

读懂 Seedance 2.0 的输入规格

文件数量与时长限制

为了在保证生成质量的同时控制算力开销,Seedance 2.0 设定了明确的输入约束:

单一类型的数量上限:

  • 图片:最多 9 个文件
  • 视频:最多 3 段
  • 音频:最多 3 个文件

合计时长上限:

  • 视频参考:所有片段合计 15 秒
  • 音频参考:所有文件合计 15 秒

每段的最短要求(很容易被忽略):

  • 每段参考视频至少 2 秒
  • 每个参考音频至少 2 秒
  • 参考视频的帧率必须在 24 到 60fps 之间

没有跨类型的总数上限。 九张图片加三段视频加三个音频,在规则上是合法的请求。但它同样是个糟糕的请求,原因见下一节。

不支持的组合:只有文本加音频,以及只有音频,都无法生成。音频永远需要一个视觉参考同行。

生成输出时长:4-15 秒。

不要把给你的名额全部填满

上面这些是上限,不是目标。字节跳动自己的指引说得很清楚:用满素材配额会让结果变差。参考太多时,模型难以判断哪些特征该优先,于是产生风格冲突、主体识别模糊,以及偏离你要求的输出。

推荐的配置是总共 4 到 5 个素材。 每一个都该有明确分工:

  • 角色锚定(1-2 张图片):锁定角色外观
  • 场景定调(1 张图片):锁定环境与风格
  • 镜头运动(1 段视频):锁定镜头语言与节奏
  • 节奏与氛围(1 段音频):控制情绪与音色

如果两份参考在争同一个岗位,那就多了一份。给同一个角色上传四张图片,并不会让模型对这个角色的把握变成四倍,只会让它更不确定该相信哪一张。

实际例子:一条 15 秒的广告,需要特定的产品外观、动感的镜头调度和欢快的音乐,五个素材就是一份完整的简报:

  • 2 张图片:产品的两个角度
  • 1 张图片:想要的调色与光线风格
  • 1 段视频:镜头运动参考
  • 1 段音频:控制节奏的音乐

其余的一切,包括环境、情绪和快慢,都该写进文本提示词。

关于人物数量的硬上限:当参考中的人物超过四个时,输出稳定性会急剧下降。你会开始看到画面里人数不对,或者出现重复的人。如果你需要六个人的群像,先分两组、每组三人生成两张图片,再用这两张图片作为视频的参考。

输入素材的质量准则

图片参考:

  • 需要准确还原时,使用清晰、光线充足的照片
  • 分辨率越高,细节还原越好
  • 多角度对产品和物体有帮助,但对人脸是有害的:见下文的头像规则,因为一张多角度的角色设定图会被读成好几个不同的人
  • 避免压缩严重或画质低劣的图片

视频参考:

  • 确保你想参考的那个具体元素清晰可见
  • 只聚焦一个要素的短片段,好过包含多个要素的长片段
  • 视频画质越高,模型对运动的理解越好
  • 把视频裁到只剩相关的那一段

音频参考:

  • 尽量使用没有背景噪音的干净音频
  • 确保音频清楚地体现你想要的节奏或情绪
  • 让音频时长与目标视频时长大致相当
  • 如果一份素材能一物多用,可以考虑直接使用视频文件里的音频

如何使用 Seedance 2.0 的多模态参考

Seedance 2.0 可以通过 Morphic 使用,Morphic 提供了上传参考素材和撰写提示词的界面。系统采用 @ 提及结构,用来指明每个上传的文件在生成中如何被使用。

首先,弄清你要的是三种任务中的哪一种

在动笔之前,先决定你交给模型的是哪一份工作,因为措辞不同,而搞错正是浪费一次生成最常见的原因。

  • 多模态参考:从素材中提取元素(一个主体、一种风格、一个镜头运动、一个嗓音),做出一条全新的视频。
  • 视频编辑:改变已有视频内部的某样东西。你没提到的部分会原样保留。
  • 视频延长:把已有视频向前或向后延续,保持风格、主体和叙事不变。

陷阱:做编辑和延长任务时,要把片段称为 @Video 1,绝不要写成"参考 @Video 1"。"参考"这个词会把模型推向参考任务的分类,于是它不会编辑你的片段,而是生成一条只是长得像的新视频。要写"严格编辑 @Video 1"或"将 @Video 1 向前延长",而不是"参考 @Video 1 并编辑它"。

引用主体之前,先定义主体

一张上传的图片里通常不止一样东西。明确给主体命名是大多数人会跳过的一步,而它恰恰是防止模型抓错元素的关键。

挑 2 到 3 个稳定、静态、能唯一识别主体的特征(服装、发型、类别),然后把它们绑定到素材上:

将 @Image 1 中的[核心特征]定义为[主体名称]

例如:将 @Image 1 中穿红裙、戴草帽的女人定义为 Subject 1。 从这一刻起,只用 Subject 1 来称呼她。她每次出现都用同一个标签。如果你在"这个女人""她"和"Subject 1"之间来回切换,模型可能会搞不清你指的是谁。

赶时间的活儿可以跳过定义,改用行内绑定,并在每次提到她时重复这个配对:Subject 1@Image 1

这里有两条重要规则。描述要短,并且不能自相矛盾,因为同一个主体上两个冲突的特征会打乱绑定。另外,凡是空间关系"展示"比"描述"更省事的,就用参考图去展示它,而不是在文本里描述它。

@ 引用系统

把素材上传到 Morphic 之后,你在提示词里用 @ 符号加上文件标识(Image 1、Video 1、Audio 1 等)来引用它们。关键在于明确说明每份参考的用途。

基本引用结构:

@[素材类型 + 编号] 用作/用于 [具体用途],[补充语境]

含糊的写法与清楚的写法:

含糊:"用 @Image 1 和 @Video 1 做一条视频"

清楚:"@Image 1 作为开场画面,展示角色的脸;参考 @Video 1 中的镜头推进运动;使用 @Audio 1 作为背景音乐,确立欢快的情绪"

把最重要的素材放在最前面。 素材在提示词里出现得越早,权重越大。如果角色的脸必须准确无误,就把它放在开头。

让模型知道它在读什么类型信息的标点

Seedance 2.0 把四种括号读作类型信号。用上它们,是防止台词被渲染成画面字幕、或音效被念出声的低成本办法。

信息类型括号示例
音乐( )(背景响起节奏明快的摇滚乐)
音效< ><远处传来狗叫声>
台词{ }{我们该走了。现在就走。}
画面字幕【 】【第一章:启程】

如果某句台词不是英文,就在花括号前注明语言:用日语说 {こんにちは}。每个场景只用一种语言。除专有名词外,在同一段提示词里混用语言会让发音变差。

写出有效的多模态提示词:CRAFTS 框架

一段好的 Seedance 2.0 提示词,更像一份工程指令,而不是一段文案。模型会同时读取你的文本、图片、视频和音频,并在内部把它们拆成空间层(画面里有什么)和时间层(它如何随时间变化)。你的任务是把这两层都喂干净。

CRAFTS 覆盖了一段完整提示词要交代的六件事:Context(语境)、Reference(参考)、Action(动作)、Framing(取景)、Timeline(时间线)、Style and constraints(风格与约束)。

C - 语境:确立场景与环境 用地点、时代、氛围和整体设定把舞台搭起来。场景类的图片参考写在这里。

示例:"在一间夜晚灯光昏暗的爵士酒吧里,室内氛围参考 @Image 1"

R - 参考:定义主体并把它们绑定到素材上 用 2 到 3 个稳定特征给每个主体命名,然后明确说明每份素材贡献什么、不贡献什么。

示例:"将 @Image 2 中穿灰西装的男人定义为钢琴师。@Image 2 只用于他的面部和体型,不用于服装。@Video 1 用于走路的节奏。@Audio 1 用于背景爵士乐。"

A - 动作:描述人物与物体的运动 详细写清场景里发生了什么:人物动作、物体互动、事件顺序。有效的动作描述和无效的,差别在两点。

小幅度、慢速度。 Seedance 2.0 处理轻柔、连续、小幅度的运动,远比处理高能量的剧烈动作可靠。冲刺、大跳、翻滚,正是肢体变形、物理失效的重灾区。多写"缓缓走过""轻轻抬起一只手""顺势坐下"。要指明身体部位,以及幅度、速度和力度:不要写"他动了动头",而写"他快速转头"。当一个动作引出下一个动作时,说明它们如何衔接,让运动带上自己的惯性:"借着转身的惯性自然地抬起一只手"。

把情绪外化为身体细节。 模型渲染不了"非常悲伤",但它能渲染悲伤在身体上的样子。把抽象的标签换成具体的迹象。

不要写改写成这样
悲伤低下头,肩膀轻微颤抖,眼眶泛红,手指无意识地攥紧衣角,泪水盈眶却没有落下
喜悦嘴角不受控地上扬,眉眼舒展开来,脚步变轻,不自觉地哼起歌,忍不住原地转了个圈
紧张反复看表,手指敲击桌面,呼吸急促,目光躲闪,咬着指甲
愤怒双拳紧握,下颌绷紧,胸口起伏,死死盯着对方,从牙缝里挤出话来
释然长长呼出一口气,绷紧的肩膀一下子塌下来,脸上重新浮起一丝笑意,抬头望向远处

示例:"钢琴师缓缓穿过房间,在吧台前停下,拿起一只玻璃杯。他啜了一口,望向门口时下颌绷紧,手指用力攥住杯子。"

F - 取景:定义镜头调度与摄影手法 用电影术语指明景别、镜头运动、角度和转场。模型对标准的摄影词汇掌握得很好,所以直接用就行。

示例:"以一个大远景开场,随着人物走向吧台推进为中近景,然后切到一个望向门口的过肩镜头"

每个镜头只做一个运动。 让一个镜头同时推进、环绕又摇摄,是让画面失稳最快的办法。想要三个运动,就该分成三个镜头。

T - 时间线:排列镜头,而不是排列秒数

这是大多数指南写错的一点,包括本文的早期版本。人的本能是给一切打时间码:0-4 秒这个,4-8 秒那个。 但 Seedance 2.0 对精确时间的支持并不稳定,把片段强行钉在固定时长上,反而可能破坏生成。

改成排列镜头顺序,让模型自己找到节奏。按事件发生的先后标注镜头1、镜头2、镜头3,每个镜头依次写:镜头运动,然后主体动作,然后位置,最后声音。

弱:"一个男人紧张地在街上奔跑,整个场面非常有电影感。"

强:

  • 镜头1:街边小巷的侧视角。男人开始奔跑,呼吸急促。
  • 镜头2:他撞翻了一个水果摊。镜头晃动,推进到他惊恐的脸部特写。
  • 镜头3:他翻过一堵矮墙消失。镜头缓缓后拉,最后停在空荡的街道上。

时间码并非禁忌,你在字节跳动自己的示例提示词里也会看到它们。把它们当作模型可能采纳的提示,而不是必须服从的指令。如果节奏确实要紧,可靠的手段是让单条片段里的镜头更少,而不是把时间码写得更死。

S - 风格与约束:把失败模式的门关上

提示词的最后一段是最常被省略的,但它做的事比人们以为的多。它有三项任务。

画面质量:说清你要什么样的成像。"高清,细节丰富,胶片质感,自然色彩,柔和光线。"

风格:说清你要的观感,哪怕你觉得参考图已经暗示了它,也要说出来。如果参考图是写实的而你想要动画,你却从没说过,输出就会飘回真人实拍。要明确写"2D 日式动画风格"或"3D 风格化 CG"。

约束:这几句话能拦住模型生产出没人要的杂质。

  • 请勿生成字幕。避免生成任何文字或字幕。
  • 请勿生成 logo。
  • 请勿生成水印。

这里值得说句实话:约束句能降低杂散字幕和水印出现的概率,但不能消除它。有两件事真正有用。如果参考图或参考片段里有你不需要的文字,上传前先把文字去掉。另外,如果项目允许,就用横版生成,因为杂散字幕在横版里出现的频率明显低于竖版。之后随时可以裁成竖版。

CRAFTS 示例提示词:

CRAFTS 示例提示词

语境:1940 年代黑色电影里的侦探办公室,夜晚,百叶窗的影子落在桌面上,光线与氛围参考 @Image 1。参考:@Image 2 用于侦探的外形(软呢帽、风衣),@Video 1 用于他缓慢而笃定的步伐。 将 @Image 2 中戴软呢帽、穿风衣的男人定义为侦探。镜头1:办公室全景。侦探从画面左侧进入, 走向他的桌子。<木地板上的脚步声。> 镜头2:镜头在他身旁跟随,随后推进为特写,他从桌上 拿起一张照片端详。镜头3:照片在他手中的插入镜头。镜头4:镜头后拉为中景。他放下照片,重重 地呼出一口气。全片贯穿:(来自 @Audio 1 的低回萨克斯旋律)。请勿生成字幕。高清,胶片颗粒, 温暖的实用光源映衬深沉的阴影。

图片参考技巧

确立视觉风格与美学方向

图片确立生成结果的整体观感。用它们来定义色板、布光方式、构图风格和艺术处理。

视觉风格方向

创作一个被雨水打湿的夜晚街景,视觉风格取自 @Image 1。匹配它湿滑路面的反光、店铺橱窗的辉光, 以及忧郁的蓝品红调色。使用 @Image 2 的垂直建筑构图。高清,胶片颗粒,自然色彩。

跨镜头保持角色一致

当多条视频里出现同一个角色时,每段提示词都引用同一张角色图片,以保持外观稳定。

角色一致性

整个序列中都出现 @Image 1 里的这位女性,保持她的面部特征、发型和服装完全一致。她从 @Image 2 的户外场景开始,随后场景转到 @Image 3 所示的室内环境。她的外观在两个地点保持一致。

细节准确的产品展示

商业或产品类内容,可以用多个角度和细节特写作为参考,以确保准确还原。

产品展示

为 @Image 1 中的手袋制作一段产品展示。侧面轮廓要与 @Image 2 一致,表面纹理与材质细节参考 @Image 3,五金件与搭扣要与 @Image 4 一致。用平滑的环绕镜头运动展示所有角度。光线明亮干净, 呈现全部细节。

视频参考技巧

复现镜头运动与摄影手法

视频参考最擅长演示那些光靠文字很难说清的具体镜头技巧。

镜头运动复现

把 @Image 1 中的角色放进 @Image 2 的走廊里。严格遵循 @Video 1 中的所有镜头运动效果:角色行走时 从背后跟拍,镜头环绕到正面并转为低角度,随后向右摇摄 90 度框住门口。作为一个连续镜头执行, 中间不切。

复制运动模式与编舞

对于舞蹈、打斗或特定的动作模式,视频参考能提供逐帧的运动指引。

动作编排

@Image 1 中的武者在 @Image 2 的训练馆里演练招式。角色要严格执行 @Video 1 中的踢击序列:旋身后踢, 转接回旋踢,最后以腾空旋踢收尾。匹配参考动作的速度、高度与流畅度。

复现特效与视觉手法

视频参考可以演示粒子特效、转场、合成手法等视觉效果,以便准确还原。

特效复现

@Image 1 中的角色完成一次魔法变身。参考 @Video 1 中的粒子效果:发光的粒子从地面升起,环绕角色 盘旋,亮度逐渐加强,随后粒子向外炸开,露出 @Image 2 中变身后的形象。

音频参考技巧

背景音乐整合与氛围确立

音频参考通过音乐的选择,确立视频的情绪基调与快慢。

背景音乐整合

制作一条 15 秒的励志健身视频,主角是 @Image 1 中的运动员,场景是 @Image 2 的健身房。用 @Audio 1 的高能音乐确立振奋、有力量的情绪。镜头运动要贴合音乐的驱动节奏,配合动感的推进与运动。

画面变化与节拍同步

把场景转换、剪切或画面变化对齐到具体的音乐节拍上,能获得干净、专业的节奏。

节拍同步

@Image 1 中的角色随 @Audio 1 的每个节拍换一套衣服。第一套来自 @Image 2,在第一个节拍上切到 @Image 3 的第二套,在第二个节拍上切到 @Image 4 的第三套,在第三个节拍上切到 @Image 5 的第四套。 每一次切换都精准落在节拍上。使用硬切,不加任何转场效果。

嗓音音色与对白匹配

当具体的嗓音特征很重要时,可以引用包含目标音质的音频或视频文件。

嗓音与对白匹配

旁白的声音要匹配 @Audio 1 中低沉、权威的音色。旁白文本:"在一个被技术改变的世界里,有一个人 敢于质疑一切。"用与参考相同的语速和戏剧性重音来演绎。

复杂的多参考示例

为商业制作组合全部输入类型

示例:产品广告

产品广告

语境:一间极简摄影棚,以 @Image 1 作为环境参考:纯白无缝背景,戏剧性的侧光。参考:@Image 2 与 @Image 3 展示产品(无线耳机)的正面与侧面。@Video 1 用于镜头运动,一个缓慢的环绕移动。@Audio 1 用于背景音乐。镜头1:大远景,耳机悬浮在画面中央。镜头开始围绕它们缓慢环绕,路径匹配 @Video 1。 镜头2:镜头继续环绕,耳机轻轻展开。<一声轻柔的机械咔哒声。> 镜头3:镜头推进为特写,耳罩上的 LED 依次亮起。<一声柔和的开机音。> 全片贯穿:(来自 @Audio 1 的欢快电子乐)。风格:高清, 干净的产品广告质感,锐利的反光,自然色彩。请勿生成 logo 或水印。请勿生成字幕。

带对白的多角色场景

示例:叙事场景

多角色对白场景

语境:白天的公司会议室,现代室内环境取自 @Image 1:大面积落地窗,一张长桌。参考:将 @Image 2 中穿藏青西装的女人定义为 CEO。将 @Image 3 中穿灰西装的男人定义为投资人。@Video 1 用于发言者之间 正反打的镜头节奏。@Audio 1 用于紧张的环境音乐。镜头1:大远景,CEO 和投资人分坐长桌两端。CEO 站起身, 手势坚定,说道 {这次合并是我们唯一的选择。} 镜头2:切到投资人的中景。他向后靠去,双臂交叉, 平淡地回应:{这话我听过了。} 镜头3:切到 CEO 的中景。她重重坐下,下颌绷紧。镜头4:大远景, 投资人起身。镜头平稳跟随他走向窗边。<硬地面上的脚步声。> 全片贯穿:(来自 @Audio 1 的紧张环境 音乐,压在混音底层)。风格:高清,冷调的商务色彩,柔和的窗光。面部保持一致,不出现变形。请勿生成字幕。

Seedance 2.0 的进阶功能

用视频延长做连续叙事

Seedance 2.0 可以用新的内容延长一段已有视频,把故事继续讲下去。它双向都能用:你可以生成片段之后发生的事,也可以生成它之前发生的事,后者在你有一个好镜头却缺一个进入方式时很有用。

视频延长怎么工作:

  1. 上传你已有的视频
  2. 说明你要哪个方向,并描述会发生什么
  3. 模型自己提取过渡帧并生成后续内容

把片段称为 @Video 1,而不是"参考 @Video 1"。这是一个编辑任务,而"参考"这个词会把模型推向生成一条相似的新视频,而不是延续你的那一条。

示例:延长一个咖啡馆场景

已有视频:10 秒的片段,一个人坐在咖啡馆的桌前看笔记本电脑

视频延长

生成 @Video 1 之后的内容。这个人合上笔记本电脑,端起咖啡杯,望向窗外喝了一口,然后放下杯子站起身。 镜头保持中景,维持原片的构图与光线。

原始素材不会被重新生成,所以你已经满意的那部分会原样保留。默认情况下,输出只带上源片段的尾部,而不是全片。如果你希望返回的视频里包含原片,就明确要求:"将 @Video 1 向前延长,[描述],然后以 @Video 1 结束。"

要提前规划的两个限制

延长确实好用,但它并非天衣无缝,提前知道这两点能让你少花一个下午的冤枉功夫。

接缝可能跳。 在新片段与原片衔接的地方,你可能看到轻微的跳变或一帧回退。目前没有哪句提示词能可靠地修好它。实用的补救在剪辑软件里:每个接缝处,从出画片段的末尾裁掉约 6 帧,从入画片段的开头裁掉 1 帧。更好的办法是规划好片段,让接缝落在一次剪切上,而不是落在运动中途,那样画面的断裂本来就看不出来。

反复串联延长会导致画质衰减。 把生成好的视频再喂回去作为下一次延长的源,画面会劣化,而且每过一遍伤害叠加。它最先表现为人脸上斑驳的色块。把链条控制得短一些,并尽量喂入你手上画质最好的源。

如果你确实需要反复延长,字节跳动记录了一个奇特但有效的变通办法:先把片段转成白模视频,再从白模继续延长。提示词大致是"将视频转换为纯白 3D 模型。所有人物变成纯白 3D 模型,无颜色,无纹理,无阴影,纯白背景,结构稳定,运动流畅。"剥掉颜色和纹理,等于给下一轮生成一个干净的结构底子,而不是让上一轮的伪影继续叠加。

延长的最佳实践:

  • 每次延长保持较短(5-8 秒),衔接最自然
  • 清楚描述原片结尾与新内容之间的衔接动作
  • 说明哪些元素要保持不变(机位、光线、人物位置)
  • 如果原片有音频,就让延长部分参考那个音频的风格

视频融合与多片段转场

通过生成一段桥接内容,在多个已有片段之间创造平滑的转场。

示例:连接两个地点

已有视频

  • @Video 1:角色走在城市街道上(结尾时角色正走近拐角)
  • @Video 2:同一个角色进入公寓(开头是门被推开)
视频融合转场

在 @Video 1 和 @Video 2 之间生成一段 5 秒的转场。@Video 1 结尾处的角色绕过拐角,走上 @Video 2 开场画面背景中可见的公寓外部台阶,走到门前,开始推门(衔接到 @Video 2 的开头)。匹配两段参考视频里 角色的外观、步速与运动方式。光线从开头的户外日光过渡到结尾 @Video 2 的室内光线。

这会生成一段桥接片段,平滑地连接两次独立拍摄,并保持角色与叙事的延续。

替换已有视频中的角色

在保留镜头调度、运动和场景细节等一切其他元素的前提下,替换视频里的角色或主体。

示例:替换音乐表演者

角色替换

在 @Video 1 中,把女主唱替换成 @Image 1 中的男艺人。表演动作要与原片完全一致:话筒的握持方式、 身体动作、面部表情,以及与乐队的互动。替换后的艺人要逐帧匹配原表演的时机与能量。其他所有元素保持 不变:乐队成员、舞台、灯光、镜头运动。

角色替换的用途:

  • 在广告创意里测试不同的出镜人选
  • 用不同演员创作同一场景的多个版本
  • 用新的品牌代言人更新已有素材
  • 为不同地区市场制作本地化出镜人的内容

剧情反转与叙事改写

在保留视觉与技术元素的前提下,彻底改变已有视频的叙事方向或结局。

示例:感情戏的反转

原视频(@Video 1):桥上求婚的浪漫场景,男人求婚,女人答应,两人相拥

剧情反转

反转 @Video 1 的剧情走向。开场完全一致:男人单膝跪地,打开戒指盒。然而,女人的表情从惊喜转为 震惊的了然。她后退一步,摇着头。男人的神情从满怀期待变得冷酷而算计。他缓缓站起,姿态从深情转为 逼人。女人说:"你从一开始就在骗我!"男人以一个冰冷的微笑回应:"这是你欠我们家的。"对峙的结局取代了 原来的浪漫拥抱。保持 @Video 1 的全部机位与镜头运动。

这个手法让你可以彻底改写叙事方向,同时保留已有素材的摄影质感与制作水准。

一镜到底的长镜头

创作跟随主体穿越多个环境、中间不切的长镜头序列。

示例:城市追逐段落

一镜到底长镜头

@Image 1、@Image 2、@Image 3、@Image 4 和 @Image 5 描绘一个跟随奔跑者的一镜到底跟拍。顺序:从街面 开始(@Image 1),大远景中奔跑者从右侧入画,全速奔跑。镜头随即从背后跟上,一直跟到他抵达建筑入口 (@Image 2)。继续跟拍,他冲上室内楼梯(@Image 3),始终保持近距离跟随。来到天台层(@Image 4), 镜头仍从背后跟随。奔跑者抵达屋顶边缘。镜头绕到他正前方拍摄最后一个画面,然后升起为俯瞰视角,展现 城市天际线(@Image 5)。镜头:全程手持质感的连续跟拍。不切。轻微的机身晃动带来紧迫与真实感。环境之间 的运动过渡平滑。上面的镜头顺序承担节奏,不要把这些段落钉死在固定秒数上。

创意模板复刻

复制参考视频的结构、风格与手法,同时换上你自己的主体和品牌。

示例:改写一支广告的风格

参考:@Video 1 是一支高端香水广告,有特定的镜头技巧、转场与节奏

创意模板复刻

参考 @Video 1 的广告风格与结构,制作一支奢华腕表广告。使用相同的镜头技巧:平滑的移动、戏剧性的 光线揭示、细节特写,以及优雅的节奏。把香水瓶换成 @Image 1 中的腕表。保持参考中精致的调色、转场时机 与韵律。环境要像 @Image 2 那样极简而现代。使用 @Audio 1 中的管弦乐来匹配高端质感。

Seedance 2.0 的用例与示例

本节展示 Seedance 2.0 在不同行业、不同复杂度下的应用。每个行业都给出基础、进阶和高级示例,展示能力的逐步提升。

商业广告制作

基础:单件产品的静态展示

场景:电商用的简单产品展示

单件产品展示

展示 @Image 1 中的智能手表,居中放在 @Image 2 的白色背景前。镜头围绕产品缓慢旋转一整圈 360 度, 全程保持相同距离。光线干净明亮,没有生硬的阴影。镜头后段,表盘亮起,显示时间。使用 @Audio 1 中 低调的环境电子乐。请勿生成字幕。请勿生成水印。

复杂度:单张图片参考,一个镜头运动,一个事件


进阶:多角度产品演示

场景:展示多项功能的科技产品演示

多角度产品演示

语境:一间干净的摄影棚,以 @Image 1 作为光线参考:柔和均匀的照明,极简背景。参考:@Image 2 (无线耳机正面)、@Image 3(侧面)、@Image 4(充电盒,打开状态)。@Audio 1 用于背景音乐。 镜头1:俯拍打开的充电盒。盒盖自行合上。<一声令人满意的咔哒。> 镜头2:正面四分之三角度。盒子打开, 耳机微微升起。<一声轻柔的呼啸。> 镜头3:镜头推进,一只耳机脱出并缓慢旋转,展示每一个侧面。 镜头4:充电盒上 LED 指示灯的特写,脉动闪烁表示正在充电。全片贯穿:(来自 @Audio 1 的欢快音乐)。 风格:高清,干净的商业质感,自然色彩。请勿生成字幕。请勿生成 logo 或水印。

复杂度:多张图片,多个镜头,多变的机位,音频同步


高级:带场景转换的完整广告

场景:15 秒的生活方式广告,展示产品在多个场景中的使用

带场景转换的完整广告

语境:为 @Image 1 与 @Image 2(两个角度)中的无线头戴耳机制作一支生活方式广告。参考:将 @Image 3 中的年轻职场女性定义为通勤者(头像)。@Image 4 用于城市街道,@Image 5 用于健身房。@Video 1 用于 健身房里的动感镜头风格。@Audio 1 用于贯穿全片的音乐。镜头1:镜头以中景在通勤者身旁跟随,她戴着 @Image 1 的耳机走过熙攘的街道。<街头噪音,密集而贴近。> 她轻点耳罩,街头噪音瞬间归零,只剩下音乐。 镜头2:在节拍上切。她此刻坐在明亮的家庭办公室里,戴着耳机开视频会议。镜头推进到耳罩与指示灯的特写。 <音乐之下有轻微的键盘敲击声。> 镜头3:在节拍上切到 @Image 5 的健身房。她全力训练,耳机稳稳戴着。 镜头随能量而动,遵循 @Video 1 的风格,随后后拉为大远景。全片贯穿:(来自 @Audio 1 的音乐,贯穿三个 地点)。风格:21:9,专业调色,匹配 @Image 1 冷调的现代色彩,高清。剪切落在节拍上。请勿生成 logo 或水印。

复杂度:5 张图片,1 段视频,1 段音频。分层音频,三个地点,专业摄影调度。

这个例子已经处在推荐素材数量的上限,而家庭办公室是用文字描述的,没有单独给一张参考图。这是一个刻意的取舍。三地点广告恰恰是最容易忍不住给每样东西都上传一张图的场合,也恰恰是这样做会开始让主体变模糊的场合。


社交媒体内容创作

基础:热门风格的快剪视频

场景:带流行转场效果的简单社媒内容

热门风格快剪视频

将 @Image 1 中的女人定义为 Subject 1。Subject 1 站在画面中央,背景是 @Image 2 的明亮环境。 镜头1:她快速抬手做了个手势。就在手势上跳切到穿着 @Image 3 服装的 Subject 1,位置和姿势完全相同。 镜头2:又一个手势,跳切到 @Image 4 的服装,位置不变。镜头3:她定住最后的姿势,微笑。全片贯穿: (来自 @Audio 1 的欢快音乐)。每一次剪切都落在节拍上。三套服装下她的脸完全一致。请勿生成字幕。

复杂度:多张图片参考,节拍同步,简单的转场效果


进阶:多地点的故事序列

场景:"一日生活"风格的 vlog 内容

多地点故事序列

语境:一支"一日生活"蒙太奇。参考:将 @Image 1 中的女人定义为创作者。@Image 2(早晨的咖啡馆)、 @Image 3(联合办公空间)、@Image 4(户外公园)。@Video 1 用于手持镜头的运动风格。@Audio 1 用于 背景音乐。镜头1:@Image 2 的咖啡馆。创作者走进来,在柜台点单,然后端着咖啡转向镜头,手持质感取自 @Video 1。<音乐之下有低低的咖啡馆人声。> 镜头2:@Image 3 的联合办公空间。她在笔记本电脑前打字, 然后抬头看向镜头微笑。<键盘敲击声。> 镜头3:笔记本屏幕的特写。镜头4:@Image 4 的公园,黄金时刻。 她坐在长椅上,合上电脑,起身,双臂向上伸展,走向镜头。<鸟鸣与轻风。> 全片贯穿:(来自 @Audio 1 的欢快 vlog 音乐)。风格:跟随 @Video 1 运动的手持 vlog 观感,中景与特写交替,在节拍上切换地点。 高清,温暖的自然色彩。请勿生成字幕。

复杂度:多个地点,手持风格参考,音频分层,人格化的内容


高级:病毒式的复杂视觉特效

场景:带流行特效的高制作水准社媒内容

病毒式视觉特效变身

语境:一支变身视频,背景是 @Image 4 的城市环境。参考:将 @Image 1 中的女人定义为舞者。@Image 2 (初始服装,休闲街头风)、@Image 3(最终服装,演出服)、@Video 1(手臂动作与旋转的编舞)、 @Video 2(粒子特效风格)、@Audio 1(音乐)。镜头1:镜头缓慢环绕舞者。她穿着 @Image 2 的街头服装 静立不动。镜头2:她按 @Video 1 的动作抬起双臂。在抬臂的顶点,画面出现数字失真的故障效果。 <一记生硬的故障音。> 镜头3:匹配 @Video 2 的粒子特效从地面炸起,绕着她盘旋。镜头继续环绕。 <一阵上扬的呼啸。> 镜头4:一道强光闪过。光散去时她已换上 @Image 3 的演出服,正在旋转中途, 遵循 @Video 1 的编舞。镜头5:她完成旋转,稳稳定住一个姿势。镜头正面停住。她身后的环境此刻变成 @Image 5 的舞台。<落地的撞击声。> 全片贯穿:(来自 @Audio 1 的高能音乐,推向高潮)。风格: 高对比,高饱和色彩,与节拍同步的特效,高清。变身前后她的脸完全一致。请勿生成字幕。

复杂度:多个复杂参考,精确的编舞匹配,特效复现,高级音频同步,流行风格的融合


影视娱乐制作

基础:营造氛围的定场镜头

场景:叙事内容的场景铺陈镜头

氛围定场镜头

@Image 1 中那座废弃宅邸的夜晚电影感定场镜头。单镜头:镜头以大远景起幅,涵盖整栋建筑与荒芜的庭院, 随后缓缓推向正门。一个连续的运动,不切。黑暗、压抑的氛围,月光穿透云层。所有窗户都是黑的,只有 二楼一扇窗里有一点微光在闪。<风穿过树林。> 全片贯穿:(来自 @Audio 1 的不祥环境音)。风格: 胶片感,高清,深沉的阴影,冷冽的月光。请勿生成字幕。

复杂度:单张图片,基础镜头运动,氛围营造


进阶:正反打的对白场景

场景:两个角色的对话,配备专业的镜头覆盖

正反打对白场景

语境:一间审讯室,冷硬的环境取自 @Image 1:一盏顶灯,一张金属桌,两把椅子。参考:将 @Image 2 中 神情严厉的中年男人定义为警探。将 @Image 3 中的年轻男人定义为嫌疑人。@Video 1 用于正反打的镜头节奏。 @Audio 1 用于紧张的环境音乐。镜头1:两人在桌前的大远景。警探身体前倾,双手交扣。嫌疑人不敢与他对视, 手指敲着桌面。<金属椅子的吱嘎声。> 镜头2:切到警探的中近景,略带低角度。他目不转睛地说 {我们知道那天晚上你在场。} 镜头3:切到嫌疑人的中近景,略带高角度。他眼神躲闪,随即镇定下来: {我不知道你在说什么。} 镜头4:切回大远景。警探把一张照片推过桌面。嫌疑人瞳孔一缩。警探向后 靠去。全片贯穿:(来自 @Audio 1 的紧张音乐,压低)以及房间底噪。<照片划过金属桌面的声音。> 风格:生硬的戏剧性光线,高清,胶片感。面部保持一致,不出现变形。请勿生成字幕。

复杂度:两张角色图片,特定的镜头技巧参考,对白节奏,心理张力


高级:复杂编舞的动作段落

场景:带具体武术编排的打斗场面

复杂编舞的动作段落

语境:日落时分的屋顶,环境取自 @Image 1:空调外机,远处的天际线,浓烈的橙色天空。参考:将 @Image 2 中的格斗者定义为主角(头像),服装取自 @Image 3。将 @Image 4 中的三个对手定义为对手们。@Video 1 用于 打斗编排:闪避、旋踢、擒抱。@Video 2 用于镜头风格:环绕动作、在击中时剪切。@Audio 1 用于音乐。 镜头1:大远景。对手们围住主角。镜头缓慢环绕这一组人。风吹动他们的衣物。镜头2:主角面部的特写。 下颌绷紧,呼吸平稳。镜头3:第一个对手冲上来。主角向右闪避,动作匹配 @Video 1。镜头4:主角使出 @Video 1 中的旋踢并击中。镜头以中景跟随这一脚。<一记沉重的撞击。> 镜头5:第二个对手逼近。主角 擒抱:抓、转、摔,如同 @Video 1。镜头以 @Video 2 的风格环绕这场缠斗。镜头6:第三个对手挥拳。主角以 慢动作从下方闪过。镜头7:主角站起,对手们躺倒在他四周。镜头推进为特写,身后的落日把他衬成剪影。 全片贯穿:(来自 @Audio 1 的音乐,推向高潮),<屋顶的风声、衣物的摩擦、沉重的呼吸>。风格: 温暖的落日色调,高对比,胶片感,高清。身体在解剖结构上保持稳定,不出现肢体变形。请勿生成字幕。

复杂度:四张图片参考,两段视频参考(编舞与镜头风格),音频参考,复杂的动作编排,慢动作。

这里要诚实地设定预期。 快速、高冲击的动作是这个模型最难的活儿,也是肢体变形、物理失效最常出现的地方。这也正是为什么这段提示词依靠的是一段编舞参考视频,而不是试图用文字描述那一脚:把动作展示出来,远比描述它可靠。即便如此,这条也要预期生成好几次。如果某个镜头总是失败,通常的解法是把动作放慢,或者把它拆成两个镜头,而不是堆更多形容词。


专业工作流的应用

用视频延长保持项目延续

场景:为已拍摄的素材续上新的内容

已有视频:8 秒的镜头,CEO 走过现代办公室,最后停在会议室门口

用视频延长保持延续

生成 @Video 1 之后的内容。视频结尾处的 CEO 推开会议室的门走进去。会议室内部与 @Image 1 的设计一致: 一张大桌,落地窗外是城市景观。@Image 2、@Image 3 和 @Image 4 中的三位高管已经落座,在 CEO 进门时 抬头看向她。CEO 走到主位坐下。镜头以平滑的跟拍跟随 CEO 穿过门口,待她坐定后切到展示整个会议室的 大远景。保持与 @Video 1 相同的专业调色与光线风格。

用途:在不重新拍摄的前提下,为已有的专业视频素材续写内容


基于模板的批量内容生产

场景:制作多条风格一致的社媒视频

主模板提示词(视频 1):

基于模板的批量生产

为 [@Image 1 中的产品] 制作产品展示,背景是 @Image 2 的白色。镜头1:镜头围绕产品旋转一整圈 360 度。 镜头2:产品旁出现一个图形标注,突出它的核心功能。镜头3:@Image 3 中的 logo 在画面中央定格。全片贯穿: (来自 @Audio 1 的音乐)。风格:干净的商业质感,高清,柔和均匀的光线。请勿生成水印。

变体提示词:把 @Image 1 换成不同的产品,同时保持 @Image 2、@Image 3 与 @Audio 1 不变,以维持品牌一致性

用途:可规模化的内容生产,适用于产品目录,在多个素材之间保持品牌识别


多语言改编

场景:为同一支广告制作不同地区的版本

基础提示词:

多语言改编

沿用 @Video 1 的 30 秒广告结构。把旁白替换为 [语言] 配音,匹配 @Audio 1 的语气与语速。@Image 1 中的 角色保持不变。画面文字改为 [语言] 版本,时机与 @Video 1 一致。

用途:需要本地化版本、同时保持统一视觉品牌的国际营销战役

Seedance 2.0 的最佳实践

CRAFTS 提示词框架(详解)

在 Seedance 2.0 上做出专业结果,需要结构化的提示词工程。CRAFTS 框架提供了一套系统方法,确保所有关键元素都被交代清楚:

C - 语境:确立场景与环境

定义动作发生的时间和地点,包括:

  • 具体地点与场地
  • 一天中的时段或历史时期
  • 大气条件(天气、光线质感)
  • 整体情绪与调性
  • 与故事相关的环境细节

示例: "在凌晨两点的地下夜店里,氛围取自 @Image 1。烟雾机制造的朦胧空气,低矮的天花板被吧台的辉光照亮,背景是挤满人的舞池。"

R - 参考:先定义主体,再明确 @ 提及与确切用途

多模态的威力就在这里。先给主体命名,再明确每份参考贡献什么:

  • 用 2 到 3 个稳定特征定义每个主体,并每次都复用这个标签
  • 清楚写出 @ 提及
  • 明确指出该参考的哪个方面被使用
  • 如果参考里包含多个元素,说明哪些不要使用
  • 把最需要准确的素材放在最前面

示例: "将 @Image 1 中剃着寸头、穿皮夹克的女人定义为 Ada。@Image 1 只用于 Ada 的面部特征与发型,不用于服装。@Image 2 用于皮夹克的造型。@Video 1 用于走路的节奏与自信的步态。@Audio 1 用于电子背景音乐。"

A - 动作:描述人物与物体的运动

详细写清场景里发生了什么,也就是你视频的动词:

  • 人物的动作与手势
  • 物体互动(拿起、放下、投掷)
  • 面部表情与情绪反应
  • 多个主体之间的互动
  • 遵循物理的事件(物体坠落、液体倾倒、烟雾升起)

示例: "角色从画面左侧入画,用 @Video 1 中那种自信的步态行走。目光快速扫过人群,随后锁定在画外的某个人身上。嘴角浮起一丝微笑。角色用右手整了整外套的领子,然后带着目的向前穿过人群。"

F - 取景:定义镜头调度与摄影手法

用规范的摄影术语指明镜头构成:

  • 景别:大远景、中景、特写、大特写、过肩镜头、主观视角
  • 镜头运动:推进/拉出、跟拍、左右摇摄、上下俯仰、升降、手持、斯坦尼康
  • 角度:低角度、高角度、平视、倾斜构图
  • 特殊手法:希区柯克变焦、甩镜、变焦换焦、浅景深

示例: "以大远景开场,交代整个夜店环境。角色入画后,镜头跟上并以中景在她身旁跟拍。当角色停下扫视人群时,缓缓推进为中近景。切到角色的主观视角,望向人群深处。再切回角色脸部特写,笑意浮起。角色继续穿过人群时恢复跟拍,镜头从背后跟随。"

T - 时间线:排列镜头顺序,让模型自己找到节奏

把你的序列拆成编号的镜头,按事件发生的先后排列:

  • 标注镜头1、镜头2、镜头3,最重要的放在前面
  • 每个镜头只给一个镜头运动、一个动作节拍、一个地点
  • 该镜头的声音就写在这个镜头里
  • 不要给每个镜头分配时长

精确的时间控制是这个模型最弱的一环。把片段钉死在具体秒数上,结果可能比放手不管更糟,所以描述事件的顺序,让模型自己呼吸。

示例:"镜头1:夜店的大远景。Ada 入画并开始行走。镜头2:镜头以中景在她身旁跟拍,她扫视人群。镜头3:特写,一丝微笑浮起。镜头4:她的主观视角,望向人群深处。镜头5:镜头恢复从背后跟拍,她继续向前。全片贯穿:(来自 @Audio 1 的电子乐,音量适中)。"

S - 风格与约束:锁定观感,排除杂质

每段提示词都要用成像质感和护栏收尾:

  • 画面质量:"高清,细节丰富,胶片质感,柔和光线"
  • 风格:明确写出来,哪怕参考图已经暗示了它
  • 约束:"请勿生成字幕。""请勿生成水印。""请勿生成 logo。"
  • 稳定性:"角色的面部保持一致,不出现变形。运动流畅,不卡顿、不闪烁。"

完整的 CRAFTS 示例:企业培训视频

CRAFTS 示例:企业培训视频

语境:上午的现代会议室,自然光从画面右侧照进来。环境与 @Image 1 的室内一致:玻璃隔墙,当代风格的 家具,墙上的屏幕。参考:将 @Image 2 中穿藏青西装外套的女人定义为讲师。@Image 3 用于围坐在桌旁的一群 学员。@Video 1 用于讲师讲解时的手势与身体语言。镜头1:从角落拍摄整个房间的大远景,交代坐在主位的 讲师和围坐四周的学员。镜头2:讲师的中景,正面四分之三角度。她指向屏幕,然后转向众人,露出坦诚的微笑。 镜头3:从讲师背后的过肩镜头,展现正在倾听的学员。有一个人身体前倾。镜头4:镜头在讲师身旁跟随,她沿着 长桌走动,一路与人目光交流。镜头5:一位学员做笔记的特写。<安静的键盘敲击声。> 镜头6:讲师回到 主位的中景,以一个笃定的手势收尾。全片贯穿:(来自 @Audio 1 的企业背景音乐,音量低,在对白下降低)。 风格:高清的企业纪录片观感,温暖的中性色调,柔和光线。面部保持一致,不出现变形,运动流畅。请勿生成 字幕。请勿生成 logo 或水印。

输入素材的准备策略

图片参考的优化

好的输入才有好的输出。有策略地准备图片参考:

为了角色一致:

  • 用一张只拍面部的头像,正面直拍,表情中性,背景简洁
  • 再加一张全身照,用于服装和身材比例。整套素材到此为止
  • 不要再加角度。 正面/侧面/四分之三的一套转面图只会让身份漂移更严重,因为模型把这些角度读成了不同的人
  • 避免可能让模型困惑的重滤镜或特效
  • 如果服装很重要,就让全身照去承担,而不是再加细节剪裁图

为了风格与美学:

  • 挑选能清楚体现目标视觉处理的图片
  • 确保调色与最终构想一致
  • 加入能体现你想要的具体布光方式的图片
  • 注意纹理和细节的丰富程度:高细节的参考会产出高细节的输出

为了产品与物体:

  • 在简洁的背景前拍摄,突出主体
  • 提供多个角度,确保准确还原
  • 包含重要细节的特写(logo、纹理、特定功能)
  • 让光线清楚地呈现形体与立体感

视频参考的优化

为了镜头运动:

  • 把视频裁到只剩你想复现的那个镜头运动
  • 确保这个运动清晰可见,没有被动作遮挡
  • 只聚焦一个技巧的短片段(3-5 秒),好过包含多个技巧的长片段
  • 使用你手上画质最好的视频:压缩伪影会影响模型的理解

为了运动与编舞:

  • 动作必须清晰可见,没有遮挡
  • 确保光线足以呈现身体的位置与运动
  • 如果有同一动作的多个角度,会有帮助
  • 制作参考片段时,可以考虑把快速动作放慢

为了特效:

  • 把你想复现的那个效果单独拎出来
  • 确保效果在背景中清晰可辨
  • 如果效果有特定的时机,把这个时机也包含在参考里

音频参考的优化

为了音乐与节奏:

  • 使用高质量音频文件(避免低码率的压缩音频)
  • 把音频裁到节奏或情绪最贴切的那一段
  • 确保音频清楚地体现你想要的东西(节拍、快慢、情绪)
  • 考虑让音频从一个强拍开始,更容易同步

为了嗓音与对白:

  • 使用背景噪音最小的清晰录音
  • 确保你想要的那个嗓音特征足够突出
  • 参考片段要短,只聚焦相关的音质

如何挑出你的四到五个素材

跨类型没有总数上限,所以没有什么能阻止你上传九张图片。分寸得你自己拿捏。用下面的方法决定谁配得上一个名额。

四个功能岗位。 一份完整的简报通常各需要一个,很少更多:

  1. 角色锚定(1-2 张图片):锁定主体是谁
  2. 场景定调(1 张图片):锁定环境与风格
  3. 镜头运动(1 段视频):锁定镜头语言与节奏
  4. 节奏与氛围(1 段音频):锁定情绪与音色

用四个问题砍掉其余的:

  1. 去掉这份参考,结果真的会变吗?不会,就砍掉。
  2. 这件事能改用文字说吗?环境、情绪和调色通常可以。脸、精确的镜头运动和具体的编舞通常不行。难以描述的才上传,其余的都用描述。
  3. 已经有别的素材在做这件事了吗?两份参考抢同一个岗位,比只留一份更糟。
  4. 这是必需品还是锦上添花?先砍锦上添花的。

决策过程示例

你在做一支音乐录影带,手上有十五份候选参考:

  • 4 张图片:不同角度的艺人
  • 3 张图片:演出场地
  • 2 张图片:布光方案
  • 2 段视频:舞蹈编排与镜头运动
  • 2 个音频:音乐音轨与环境声
  • 2 张图片:服装细节

套用这个框架:

  • 保留(角色锚定):1 张艺人头像,加 1 张全身照。不要那套四角度的图。多角度设定图是让模型以为它在看好几个不同的人的最可靠方式
  • 保留(场景):1 张场地图,选最有代表性的那张
  • 保留(镜头):1 段视频。在编舞和镜头运动之间做选择,标准是哪一个你写不出来
  • 保留(节奏):音乐音轨
  • 改用文字描述:两套布光方案、服装细节、环境声,以及另外两张场地图

结果:5 个素材。 其余十条信息依然会传达给模型,只是以文字而不是文件的形式抵达,而那正是它们本来该待的地方。

多镜头项目的一致性技巧

跨多次生成保持角色一致

要在多次视频生成中保持同一个角色的外观,需要系统化地管理参考素材:

用一张头像加一张全身照。就这两张。

这是这个模型里最反直觉的一条规则,而做错它,会正好造成你原本想避免的问题。

人的本能是给模型一套角色转面图:正面、侧面、四分之三、背面。千万别这么做。 Seedance 2.0 经常把一张多视图设定图读成好几个不同的人。这只会加剧身份漂移,而且是"双胞胎"故障的主要成因,也就是同一个画面里出现两个一模一样的角色。

真正有效的是两张分工明确的图片:

  • 一张只拍面部的头像。 只有头部,表情中性,尽量少露肩膀、脖子和背景。这是模型判断身份时依赖的图片,所以脸必须占满画面。如果一张脸只是繁杂全身照里的一小块区域,模型给它的权重就低,周围的杂讯会渗进来。
  • 一张全身照,用于造型、服装和身材比例。

然后在提示词里明确划分职责,并把脸放在前面:

角色参考分工

将 @Image 1 中的女人定义为 Subject 1。Subject 1 的面部特征参考 @Image 1(头像)。她的服装与造型 参考 @Image 2(全身照)。

注意这条只适用于人脸。对产品和物体来说,多角度确实有用,应该提供。

混合参考的错误:不要把脸、姿势、服装和细节剪裁塞进一张合成图递给模型。脸最终只占据很小一部分像素,得到的注意力也相应稀薄,身份于是漂移。

如果角色还是漂移了,有一个后果值得知道:漂移的脸可能越长越像某个真实的公众人物,而这会让生成在审核时被拦下,尽管你从没要求过名人。所以身份漂移不只是画质问题,它也是一条看起来干净的提示词却被拒绝的隐秘原因之一。我们的 Seedance 2.0 提示词被标记指南详细讲了被拒绝这一面。

保持标签一致 每段提示词里都用同一个名字称呼这个角色,并写明"保持与 @Image [X] 完全一致的外观"。

角色一致性

让 @Image 1 中的侦探出镜(保持与这张参考完全一致的面部特征、发型和服装)。在这个场景里,侦探走进 @Image 2 的仓库。侦探的所有外形特征都必须与 @Image 1 精确一致:同一张脸,同一件大衣,同样的身形。

跨场景保持风格一致

对于需要多个镜头保持同一视觉处理的项目:

手法一:风格参考模板 挑一张能完美体现你想要的视觉风格的图片:

  • 调色
  • 布光方式
  • 构图风格
  • 纹理与细节程度

在每一段生成提示词里都放上这张相同的风格参考:

风格参考模板

全片保持 @Image 1 的视觉风格:忧郁的蓝色调调色,高对比度光线,胶片颗粒质感,浅景深。

手法二:用上一次的输出作为参考 把之前成功的生成结果当作后续镜头的参考:

用上次输出作为参考

创作下一个场景,保持与 @Video 1(我上一次的生成结果)完全一致的视觉风格。调色、布光方式和整体 美学都要精确匹配。

连续镜头的时间延续

当你要创作前后相接的镜头时:

手法一:重叠描述 描述新镜头如何接上前一个:

重叠描述

这个镜头正好从 @Video 1 结束的地方接上。@Video 1 结尾时面朝门口的那个角色,此刻转向镜头开始说话。 位置和光线要与 @Video 1 的最后一帧一致。

手法二:明确衔接点 清楚说明连接的位置:

衔接点说明

这次生成从 @Video 1 结束时的机位和位置开始。角色应该处在同样的位置、动作进行到一半,这个镜头把 这个动作平滑地延续下去。

需要避开的常见陷阱

陷阱 1:参考用得含糊

问题:"@Image 1 作为参考",却没说要参考它的哪个方面

解法:始终写清这份参考提供什么:"@Image 1 用于角色的面部特征与表情,不用于背景或光线"

陷阱 2:自相矛盾的指令

问题:"快节奏的动作场面,配缓慢沉思的镜头运动和平静的环境音乐"

解法:让所有元素都朝同一个目标对齐:动作快慢、镜头能量、音乐速度、剪辑节奏

陷阱 3:把提示词写得过于复杂

问题:上传十几份区别不大的参考,再写一段 500 字、细节互相冲突的提示词。字节跳动的指引对此毫不含糊:不要把整个剧本交给模型,也不要用满素材配额

解法:用更少、更有分量的参考,配上遵循 CRAFTS 框架的清晰结构化提示词

陷阱 4:无视时长限制

问题:想把 30 秒的复杂动作塞进 15 秒的生成里

解法:把复杂序列拆成多次生成,或者简化动作以适应时长

陷阱 5:镜头交代不足

问题:"镜头四处移动",没有具体方向

解法:使用精确的摄影术语:"镜头从大远景推进为中近景,全程保持平视视角"

陷阱 6:忽视音频整合

问题:把音频当作事后补充,或者只写一句"加点音乐"

解法:说明音频是干什么用的,并把声音写进它所属的那个镜头:"(来自 @Audio 1 的驱动节奏,贯穿全片)。每一次剪切都落在节拍上。"

陷阱 7:参考素材质量参差

问题:把高分辨率的专业照片和低画质的压缩图混在一起用

解法:保持所有参考的质量一致:别让一份劣质参考拖垮整次生成

陷阱 8:指望模型自己推断

问题:"弄得好看点"或"你懂我的意思"

解法:把每个重要细节都写明白:模型执行的是你的指令,它不会去揣摩含糊的意图

快速排障指南

问题:角色外观在多次生成之间发生变化 解法:每段提示词都用同一张角色参考图,并明确写出"保持与 @Image X 完全一致的外观"

问题:镜头运动与参考对不上 解法:在文字里更具体地描述这个镜头运动,并把复杂的运动拆成几个阶段

问题:风格与参考不符 解法:除了给出参考,还要用文字描述具体的风格元素:"匹配 @Image 1 的调色:去饱和的蓝色,高对比,压暗的黑位"

问题:节奏感觉不对 解法:忍住加时间码的冲动,那通常只会更糟。减少你在一条片段里要求的镜头数量,并给重要的节拍单独一个镜头。

问题:音频与情绪不匹配 解法:明确描述音频的作用,而不是只指向文件:不要只写"@Audio 1",而要写"(来自 @Audio 1 的紧张、逐步累积的悬念)"。

问题:声音听起来不像我的参考音频 解法:单靠音频参考,音色往往达不到预期。除了引用它,还要用文字描述这个声音:"用 @Audio 1 那种低沉、温厚、略带沙砾感的中年男声说……"。让写下的台词在语气上贴近参考录音,也会有帮助。

问题:同一个画面里出现了两个一模一样的角色 解法:这是"双胞胎"故障。别再用多视图角色设定图,改用单人参考照片,给每个角色命名并与他的图片配对("Ada(@Image 1)把文件递给 Ben(@Image 2)"),并在结尾加上约束:"全片不要生成重复角色或双胞胎效果。每个角色在画面中只保留一个。"

问题:出现了我从没要求过的字幕或水印 解法:加上约束句("请勿生成字幕"、"请勿生成水印"),上传前把参考素材里的文字去掉,条件允许就用横版生成,因为杂散字幕在横版里明显比竖版少见。

问题:我的动画风格飘回了真人实拍 解法:写实的参考图会把输出往写实方向拽,除非你明确说不。在提示词里明确写出风格("2D 日式动画风格"),或者在生成之前先把参考图转换成目标风格。

问题:描述的效果出来后是乱的,比如倒计时的数字全乱了 解法:别再描述这个效果,把它展示出来。喂进一段带这个效果的参考视频并指向它:"数字出现的方式应该遵循 @Video 1。"运动逻辑正是模型从素材里读得远比从文字里读得好的东西之一。

问题:视频结尾有一声咔哒或者突兀的截断噪音 解法:这是带旁白片段上的已知伪影。重新生成,或者在剪辑软件里给音轨结尾加一小段音量淡出。这是 20 秒就能解决的事,不值得为它烧掉一次生成。

问题:画面跳动或拉伸,我的参考照片看起来变形了 解法:通常是画幅比例不匹配。如果参考图的比例与你选的输出比例不符,模型只能强行适配。上传前把图片裁成目标比例,或者把输出设为自适应比例,让它跟随参考。参考图的比例还需要落在 0.4 到 2.5 之间,每边 300 到 6000px。

结语

Seedance 2.0 凭借全面的多模态方式,代表了 AI 视频生成的一次根本性进步。它接受图片、视频、音频和文本作为输入,让专业创作者对创作过程拥有前所未有的控制力:从纯文本提示词,走向真正的"边看边说"式导演。

Seedance 2.0 在 AI 视频版图中的位置

多模态能力是 Seedance 2.0 与竞争平台的分水岭。Kling、Veo 和 Sora 的文生视频能力都很出色,而 Seedance 对视频与音频参考的直接整合,让镜头调度、运动模式和节奏同步的精确复现成为可能,而这些是光靠文字描述很难甚至无法做到的。这让 Seedance 成为那些需要严格把控视觉风格、角色一致性和电影化执行的专业创作者的首选。

这个平台还在持续进化,能力不断增强,功能支持不断扩展。掌握它的多模态参考系统和 CRAFTS 提示词框架,就为随平台成长而日益复杂的视频创作打下了基础。

关键要点

多模态控制:Seedance 2.0 把图片、视频、音频和文本输入结合起来,让你可以直接把想要的东西展示给 AI 看,而不必试图用文字把一切说清。这一根本转变,让过去很难交代的要求变得直接可达:精确的镜头运动、具体的编舞、与节拍同步的剪辑。

对比中的战略优势:与 Kling、Veo 和 Sora 相比,Seedance 2.0 在音频整合和视频参考深度上具有独特能力。直接上传音频文件并作为参考,让精确的情绪控制和节拍同步成为可能。视频参考能力也超越了风格迁移,达到完整的运动与镜头复现。

CRAFTS 专业框架:六段式的 CRAFTS 方法(语境、参考、动作、取景、时间线、风格与约束)覆盖了一段完整提示词必须交代的一切。人们最常跳过的两部分,恰恰决定了生成能否成功:引用之前先定义主体,以及用排除杂质的约束句给提示词收尾。

排列镜头,不要给镜头计时:写逐秒时间码的本能,是让 Seedance 输出变差的最常见方式。排好镜头顺序,让模型自己找到节奏。

克制胜过堆量:四五个精挑细选的素材,胜过一打。每多一份参考,模型就更难判断哪些特征重要,而角色转面图尤其会直接引发身份漂移。

在 Morphic 上可用:专业创作者可以在 Morphic 上使用完整的 Seedance 2.0 家族,包括用于低成本迭代的 Fast 与 Mini,以及用于 4K 成片的完整版 Seedance 2.0。

准备好创作了吗?在 Morphic 上使用 Seedance 2.0 →

常见问题

如何在多条 Seedance 2.0 视频中保持角色一致?

这个角色出现的每一次生成,都用同一张角色参考图。在提示词里明确写出"保持与 @Image X 完全一致的 外观",并描述任何变化(不同服装、不同表情),同时强调面部特征、身形等识别特征保持不变。想要最好的 效果,就用一张清晰、光线充足的正面照作为主角色参考。

如何复现我在参考视频里看到的特定镜头运动?

上传展示目标镜头调度的视频,并明确引用它:"@Video 1 只用于镜头运动。"在文本提示词里用摄影术语描述 这个运动(推进、跟拍、升降)。复杂的运动要拆成多个镜头,而不是拆成多个时间码:"镜头1:从大远景推进 为中景。镜头2:向右摇摄,保持距离。"每个镜头只保留一个镜头运动,因为把推进、环绕和摇摄堆进同一个 镜头,是让画面失稳最快的办法。

如何让 Seedance 2.0 视频与特定的音乐节拍同步?

上传你的音轨,然后用节拍而不是秒数来描述同步,因为模型对精确时间码的处理并不稳定。可以这样写: "(来自 @Audio 1 的欢快音乐)。每一次剪切都落在节拍上。"并把每次剪切写成独立镜头。相对节拍的指令, 远比"在第 6 秒"这种写法可靠。

如何在不同的 Seedance 2.0 片段之间做出平滑的转场?

使用视频延长功能或融合手法。延长:上传已有视频,写"生成 @Video 1 之后的内容",并描述衔接动作, 长度在生成设置里定,而不是写在提示词里。融合:创作一段桥接片段,同时引用一个片段的结尾和另一个片段 的开头,并明确描述连接两者的过渡动作。

如何控制 Seedance 2.0 视频里某个动作的时长?

没有你希望的那么直接,这也是这个模型最弱的一环。精确时间码("0-3 秒:[动作]")并不稳定,把片段强行 钉在固定时长上,可能让输出更糟而不是更紧凑。改成排列镜头顺序("镜头1:…… 镜头2:……"),让模型自己 找到节奏。如果某个动作显得仓促,可靠的解法是在这条片段里少要几个镜头、给这个动作单独一个镜头,或者 提高整体生成时长,而不是把时间码写得更死。

我到底该上传多少个参考文件?

比允许的上限更少。字节跳动建议 4 到 5 个素材:1 到 2 张角色图、1 张场景图、1 段镜头运动视频、1 段 音频。超过这个数,模型就很难判断哪些特征该优先,于是出现风格冲突、主体识别模糊,以及偏离需求的输出。 经验法则是:真正难以描述的才上传(一张特定的脸、一个精确的镜头运动、一套具体的编舞),其余的都写进 文本提示词。另外要注意,一旦涉及超过四个参考人物,稳定性会急剧下降。

如何复刻我在参考视频里看到的特效?

上传带有目标效果的视频并明确说明:"@Video 1 只用于粒子特效的手法。"在文本提示词里详细描述这个效果: 它何时出现、如何运动、有什么视觉特征。想要最好的效果,就用效果清晰可见且被单独呈现的参考片段: "参考 @Video 1 中从地面升起、升到头部高度时散开的发光粒子漩涡。"

如何让 Seedance 2.0 的角色用特定的嗓音说话?

上传包含目标嗓音的音频或视频参考,并明确说明:"@Audio 1 用于嗓音音色与演绎风格。"在提示词里描述这个 声音的特征:"角色以 @Audio 1 中低沉、权威的语气说出这句话:[你的台词文本]。"

生成多条相关视频时结果不一致,怎么解决?

在这个序列的所有生成中保持参考素材一致。用同一张风格参考图、同一组角色参考,以及只做必要变动的 相似提示词。并引用之前成功的输出:"保持与 @Video 1(上一次生成)一致的视觉风格",以确保延续性。

如何用 Seedance 2.0 做出超过 15 秒的视频?

使用视频延长。先生成第一段,然后上传它并写"生成 @Video 1 之后的内容",描述接下来发生的事。你可以 串联多次延长,但要把链条控制得短:每过一轮画质都会衰减,而且伤害叠加,最先表现为人脸上斑驳的色块。 也要预期接缝处会有可见的跳变,在剪辑软件里修:从出画片段的末尾裁掉约六帧,从入画片段的开头裁掉一帧。 对于更长或节奏更快的作品,分别生成片段再剪到一起,通常比一长串延长更好。

做专业视频时,Seedance 2.0 和 Kling 的主要区别是什么?

Seedance 2.0 的主要差异点在于全面的多模态输入,包括直接上传音频文件,以及它视频参考与编辑系统的深度。 两个模型都接受多模态输入,所以区别不在于你能挂上什么,而在于模型拿到一段上传的片段之后会做什么: Seedance 会在片段内部编辑、向两个方向延长、把多个片段缝合起来,而不只是模仿它的风格。在素材已经存在 且已经通过审核的项目上,这一点最重要。

Seedance 2.0 的音频整合与其他 AI 视频工具相比如何?

Seedance 2.0 接受直接上传的音频文件,并从中提取三样不同的东西:音色、旋律和台词内容。这意味着你可以 直接把真实的音乐音轨、或者你想要的那个声音的录音交给它,而不必用文字去描述它们。Veo 和 Sora 是从文本 描述生成音频,不接受参考音频。有一个实话要说:单靠音频参考,人声往往达不到预期。还要用文字描述音色, 例如"用 @Audio 1 那种低沉、温厚、略带沙砾感的中年男声"。

Seedance 2.0 能生成比 Kling 或 Veo 更长的视频吗?

Seedance 2.0 和 Kling 3.0 单次生成都最长 15 秒。Sora 更长,最长 60 秒。实际上这个上限没有听起来那么 要紧,因为大多数商业和社交作品都是由几段短而高质量的片段剪辑而成,而不是一镜拍完。Seedance 领先的 地方在片段生成之后:你可以向前或向后延长它、在它内部编辑、把多个片段缝合起来,这是另一种意义上的 "长度",与单次生成更长并不是一回事。

在复现特定风格上,Seedance 2.0 比 Runway 更准确吗?

Seedance 2.0 的多模态方式为风格复现提供了更直接的控制,因为你可以上传多张参考图、展示风格在运动中 的视频片段,以及确立情绪的音频。你不是用文字描述一种风格,而是从多个角度把范例展示出来。相比纯文本 的做法,这通常能更忠实地还原复杂风格。

Seedance 2.0 的角色一致性与其他 AI 视频模型相比如何?

只要用法正确,在各段提示词里保持角色图片一致,Seedance 2.0 的图片参考系统就能提供很强的角色一致性。 这个能力可以与 Kling 的角色一致性功能相提并论,但比 Veo 或 Sora 基于文本的角色描述更可控。关键在于 使用高质量的角色参考图,并在每次生成里明确写出"保持与 @Image X 完全一致的外观"。

商业制作该选哪个:Seedance 2.0 还是 Veo?

做商业项目时,决定因素通常是控制力而不是纯粹的生成质量,而这正是 Seedance 2.0 参考系统的价值所在: 你可以上传确切的产品照、确切的音乐音轨,以及一段确切镜头运动的片段,而当客户已经对这三样都签过字时, 这一点至关重要。Seedance 还允许你编辑和延长已有素材,让通过审核的内容可以复用而不必重做。Veo 在提示词 遵循度和长片延长上很强,如果需求更宽松、长度比精确的品牌一致性更重要,它依然是个合理的选择。

Seedance 2.0 能做到 Sora 能做的一切吗?

它们是为不同的活儿设计的。Sora 能生成更长的单次镜头,最长 60 秒,并且擅长仅凭文本推断物理规律和复杂 场景。Seedance 2.0 单次生成上限是 15 秒,但给了你 Sora 没有的控制力:直接上传音频、用视频参考复现运动 与镜头、同时使用多个视觉参考,以及编辑和延长你已有的素材。如果你的提示词是一段描述性文字,Sora 很有 吸引力。如果你手上有素材、心里有明确的目标结果,Seedance 的参考系统是更可控的工具。

Seedance 2.0 的视频参考能力与 Kling 的运动控制相比如何?

两个平台都提供运动参考能力,但 Seedance 2.0 的视频参考系统走得更深。Kling 提供运动笔刷和基础的运动 迁移,而 Seedance 允许上传完整的视频片段,不仅复现运动轨迹,还复现镜头调度、剪辑节奏和逐帧的复杂编舞。 你可以把一整段打斗或一支舞蹈展示给 Seedance,让它精确复现这些动作,而不必去描述它,也不必去画运动轨迹。

Seedance 2.0、Fast 和 Mini 有什么区别?

它们功能集相同,区别在于质量与成本。Seedance 2.0 质量最高,也是三者中唯一能输出 4K 的。Seedance 2.0 Fast 牺牲一些质量换取速度和成本。Seedance 2.0 Mini 最便宜,最适合大批量迭代。Fast 和 Mini 最高都是 720p。一个实用的工作流是:先在 Mini 或 Fast 上迭代,直到提示词和参考都调顺,再用完整版 Seedance 2.0 跑成片。

Seedance 2.0 上传时接受哪些文件格式?

图片是 JPG 或 PNG,视频是 MP4 或 MOV,音频是 MP3。输出是 MP4,其中 4K 采用 10-bit H.265 编码,有些 浏览器和播放器无法直接预览,尽管文件本身没有问题。请使用你手上质量最高的源素材:参考片段里的压缩伪影 会实实在在地削弱模型对其中运动的解读。

单次 Seedance 2.0 生成的输入上限是多少?

最多 9 张图片、3 段视频和 3 个音频文件。视频片段每段 2 到 15 秒,合计 15 秒;音频同理。跨类型没有 总数上限,所以在规则上最多可以挂 15 个文件,但你应该离这个数字远远的:推荐的实际工作区间是 4 到 5 个 素材。有一种组合根本不成立:只有文本加音频而无任何视觉素材,以及只有音频,都无法生成。

Seedance 2.0 单次生成的最长视频是多久?

Seedance 2.0 单次生成 4 到 15 秒的视频。你可以按 1 秒为步长选择具体时长。想要更长的内容,就用视频延长 功能串联多次生成,或者分别生成片段,后期再剪到一起。

我可以把 Seedance 2.0 用于商业项目和客户工作吗?

可以,通过 Morphic 使用的 Seedance 2.0 能够用于商业制作。具体的授权与使用权利以 Morphic 的服务条款为准。 关于商业用途、客户项目以及是否需要署名的细节,请查阅这些条款。

Seedance 2.0 能在整段视频里维持分辨率质量吗?

在单次生成之内可以,画质会贯穿整段片段。真正会掉链子的地方是反复串联的视频延长:每一次把生成好的 视频再喂回去延长,画面都会劣化一点,而且会叠加。它最先表现为人脸上斑驳的色块。把延长的链条控制得短 一些。

我可以用 Seedance 2.0 生成不同画幅比例的视频吗?

可以。Seedance 2.0 支持 21:9、16:9、4:3、1:1、3:4 和 9:16,在生成设置里选择。没有 2.35:1 这个选项, 所以想要宽银幕质感就选 21:9。还有一个实用的提醒:杂散字幕在横版里出现的频率明显低于竖版,所以如果 成片是竖版的,先按横版生成再裁切往往是值得的。

怎样才能用上 Seedance 2.0?

Seedance 2.0 可以通过 Morphic 使用。访问 Morphic,注册或登录账号, 在视频生成界面里选择 Seedance 2.0。多模态输入系统和 @ 引用功能都已集成在 Morphic 的工作流里。

Seedance 2.0 生成之后,我还能编辑或修改视频吗?

可以,生成的视频有几种用法:作为新生成的参考(用来修改特定元素)、作为视频延长的输入(用来续写内容)、 用在视频融合工作流里(用来与其他片段连接),或者导出到常规剪辑软件里做传统的视频编辑。生成的视频归你 所有,你可以用任何适合你项目的流程去编辑、组合和打磨它。