Seedance 2.5的功能与能力
Seedance 2.5 是 ByteDance 的新一代视频模型。相比 Seedance 2.0 系列,它的原生镜头更长,能带的参考多出一大截,音频还能直接以 10+ 种语言原生生成。这一系列一向以AI镜头控制见长,这一点在 2.5 上保留了下来。
Seedance 2.5 正在陆续开放。部分细节可能在正式发布前后还有调整,ByteDance 给出的全面发布时间是 2026 年 8 月 7 日。
| 功能 | 作用 | 适合 |
|---|---|---|
| 更长的单镜视频 | 一个连续镜头能撑住远超几秒的时长,最长 30 秒 | 广告片、短场景、长揭示 |
| 原生 1080p 输出 | 直接渲染完整的 1920x1080 画面,而非放大,从发布时的 720p 提升而来 | 面向社媒、网页和广告的全高清交付 |
| 参考驱动的连续性 | 接受最多 50 个多模态参考,把角色、场景和色板一起锁住 | 系列、多镜头序列、品牌作品 |
| 片段内编辑 | 改现有片段里的一个元素,不必整条重渲染 | 修正镜头、针对性修改 |
| 带音频的AI镜头控制 | 用平实语言执导镜头,同一次生成就带上原生音频 | 被执导的镜头、有声场景 |
| 纯音频参考 | 一段人声、音乐或音效轨道就能带动节奏、卡点和口型同步 | 音乐视频、口型同步对白、本地化配音 |
更长的单镜视频
最大的变化在时长。多数模型只能给出几秒的片段,Seedance 2.5 能把一个连续镜头撑得远比这长。一次完整的揭示,或者一段短戏,就在这一个镜头里演完,不用再拼接。写提示词的思路也要换:与其描述一帧定格画面,不如把它当成一段持续演进的运动,交代主体和镜头在整个镜头里各自怎么走。
原生 1080p 输出
Seedance 2.5 原生渲染 1080p,直接生成完整的 1920x1080 画面,而不是从更小的渲染放大得来,比它发布时搭载的 720p 更进一步。这让它成为一个全高清交付模型:片段可直接进入社媒、网页和广告流程,无需单独的放大步骤,边缘和纹理也比被拉伸的 720p 画面更干净。更长的单镜头、原生音频和最多 50 个参考,都能在一次生成中以 1080p 一并呈现。
参考驱动的连续性
外观要稳,靠的是多模态参考。你给一张角色、产品或场景的图像,模型就会把这套外观贯穿整段片段,并从一个镜头带到下一个镜头。每次生成最多可以接受 50 个参考输入,其中 30 张图、10 段视频片段、10 个音频。素材类型也不限于图像:视频片段、音频,甚至一个简单的3D白模,都能当参考用。团队把角色、地点和色板一起锁住之后,整个序列才认得出是同一套,不会一场戏一个样。
片段内编辑与延展
编辑是打补丁,不是推倒重来。现有片段里只要改一处,就在原处改这一处,画面其余部分保持不动。这样比整条镜头重新生成快,也不会把你已经满意的那条弄丢。改动的位置还可以用时间戳指定,落点由你说了算。
| 操作 | 作用 | 示例 |
|---|---|---|
| 指令编辑 | 用文字添加、移除或修改内容,也可以指定时间戳 | 替换 0:02 到 0:05 的场景,保留原有的运动与节奏 |
| 参考图编辑 | 把某个元素换成所提供图像的样子 | 把夹克换成参考图里的那件,其余不动 |
| 添加主体 | 往画面里放一个人物、道具或特效,其余不动 | 在角色手中加入一把能量弓 |
| 移除主体 | 抹掉某个物体、水印或标志,再把空缺补上 | 移除无人机及其轨迹,并对天空做修补 |
| 音频编辑 | 换掉音乐、加上音效,或者改变人声 | 更换背景音乐,保留原有画面 |
| 延展片段 | 向前续接、补出开头之前的瞬间,或衔接两段片段 | 向前延展六秒,同时天色渐暗 |
延展的保真度很高。它可以接着最后一帧往下续(向前),可以补出第一帧之前的瞬间(向后),也可以在两段片段之间生成一段自然衔接的过渡。角色、节奏和风格在这个过程里保持不变。要加几秒,由你设定。
带音频的AI镜头控制
镜头运动用平实语言执导就行,比如缓慢推进、低位跟拍、后拉。这样出来的运动读起来是有意图的镜头,而不是画面在漂。音频在同一次生成里一起产出,所以一个场景交回来时已经带着室内声或音效,不是一段无声片段。
原生音频与 10+ 种语言
声音和画面在同一次生成里一起产出,场景回来时人声、音乐或音效就已经在了。2.5 还新增了纯音频参考:一段人声、音乐或音效轨道就能带动镜头的节奏、卡点和口型同步。生成语言上,Seedance 2.5 支持 10+ 种语言原生生成,对指令的遵循也更贴近。你可以用自己的语言描述一场戏,配音和标题也照着这门语言本地化。
Seedance 2.5使用场景
长单镜建立镜头
一次跨越风景的不间断运动,时长远超几秒的节拍。长原生镜头不用剪切就能承载整段揭示,一段航拍读起来是一台连续运动的摄影机,不是拼起来的碎片。
精细的特写工艺
工作中的双手、珠宝和机械装置,在运动里也守得住细腻的细节。参考驱动的生成让物体逐帧保持一致,近距离检视的镜头始终清晰,不会糊成一片。
运动与体育动作
身体动得快,重心一直在变,整段片段依然稳得住。运动跟着动作走,而不是把动作抹糊。破晓时分的一次冲刺,时机和动作收尾都是真的。
电影感科幻场景
大型场景、氛围和体积光给了镜头规模感。镜头控制带着意图在空间里穿行,机库内部因此像是为一场戏布置过的,而不是一张静态渲染图。
旅行与纪录片
宽阔的远景配上缓慢的揭示,原生 1080p 下收得干净,上大屏也没问题。一段沙漠穿越,从前景的沙粒到远方的地平线,细节都在。
超现实、富有想象力的概念
不可能的场景之所以能成立,是因为主体在整个镜头里没有变。鲸鱼从潜水员身旁漂过,尺度和重量感一路保持,概念就传达出去了,不会在半途散架。
如何充分发挥Seedance 2.5
把镜头说明写清楚,再养成用参考守住连续性的习惯,Seedance 2.5 就会给出回报。下面几条做法承担了大部分质量:
- 为一个连续镜头而写。别停在某一瞬间,要交代主体和镜头在整个镜头时长里怎么演进。
- 把镜头运动说具体。“缓慢推进”“低位跟拍”读起来是意图,“电影感”则什么信息都没有。
- 用参考把主体锁住。给一张角色、产品或场景的清晰图像,外观就能贯穿片段,不会中途走样。
- 交代每个参考的用途。哪个管角色、哪个管场景、哪个管色板,都说明白,模型才知道该听谁的。
- 参考要跨镜头复用。同一批参考从这个剪切带到下一个,序列才前后一致。
- 复杂调度先用3D白模排。把一个简单的白模场景当参考传进去,场景布置和镜头路径可以在花掉一次渲染之前先排好。
- 原地改,别重来。现有片段要做针对性修正,改那个元素就行,不必重新生成整个镜头。
- 节奏交给纯音频参考。附上一段音乐或人声轨道,模型就能把节奏、卡点和口型同步跟上去。
为稳定效果挑选参考
参考不是越多越好,真正守住质量的是一组聚焦的参考:
- 用图像参考时,主要主体控制在 8 个或更少;实在不得已,才提到 9–12 个。
- 用视频或音频参考时,主体控制在 5 个或更少,片段尽量取 5 到 10 秒:够长,模型读得出;够短,画面不乱。视频参考加起来上限 30 秒,音频同理。
- 编辑现有视频时,源片段控制在 20 秒以内,再配 1 到 5 张参考图像;编辑确实需要,才提到 6–8 张。
- 主体在 5 个或更少时,单视图和多视图都行。超过 5 个,就优先用单视图图像,或者把不同角度分开上传。分开的多角度图像,比拼合成一张的多视图稳得多。
- 优先级按这个顺序排:先是核心角色,然后是关键产品或道具,接着是场景,最后才是整体风格。
完整的能力清单与规格,请查看Seedance 2.5模型页面。
Seedance 2.5提示词指南
一条出色的视频提示词,读起来像一份简短的镜头说明,而不是一句图片说明文字。这样模型手里才有主体、有动作、有镜头,而不是一帧用文字写成的静止画面。下面这套公式出自 ByteDance 官方提示词指南,本页其余内容都建立在它之上。
Seedance 2.5提示词公式
六个要素,按这个顺序排;用不上的可以省掉:
| 要素 | 涵盖内容 | 是否必需 |
|---|---|---|
| 主体与动作 | 画面里是谁、是什么,他们在做什么 | 必需,这是基础 |
| 场景与环境 | 地点、时间、天气、空间关系、背景 | 可选 |
| 视觉风格 | 光线、色彩、材质、质感、整体氛围 | 可选 |
| 镜头运动或剪辑 | 景别、角度、运动、聚焦主体、转场 | 可选 |
| 音频 | 对白、人声、环境声、音效、音乐 | 可选 |
写出来就是四行短句:
[Subject] performs [primary action or event] in [scene and environment].
The visuals feature [visual style].
Use [shot size, camera angle, camera movement, or cuts].
Audio includes [dialogue, ambience, sound effects, or music].
一个实操示例:
A ceramic artist finishes a pale blue cup in a studio at dawn, lifts it from
the wheel, and places it in the center of a wooden shelf.
Soft morning light enters through the window. The wet clay has a delicate
sheen, and the workbench remains tidy.
Begin with a medium shot of the wheel-throwing process, slowly push in toward
the cup's surface texture, then cut to a frontal view of the shelf.
Retain the low hum of the pottery wheel, the friction of clay, and subtle
indoor ambience.
画面比例、时长这些生成设置不写进提示词。它们在生成页面上设置,不在文字里。
音频、对白与字幕语法
平实语言也能生效。不过四种括号能把话说死:你指的到底是哪一类声音或文字。想避免一句对白被当成字幕显示,或者一段音效被念出来,这是最省事的办法。
| 内容 | 括号 | 示例 |
|---|---|---|
| 音乐 | ( ) | (Soft, rhythmic piano music plays in the background) |
| 音效 | < > | <A bell rings in the distance> |
| 对白 | { } | {Hello, welcome back.} |
| 字幕 | 【 】 | 【Chapter One: Departure】 |
非中文的台词,说之前先点明语言;模型如果还是选错,就再说一遍。顺序是这样的:先语言,再地区变体或口音,然后表达风格,接着说话人,最后才是台词内容:
Dialogue language: American English. The girl says in natural, conversational
American English: {I thought you weren't coming.}
最后这一层比看上去重要。写“地道的洛杉矶英语”,而不是只写“英语”,你拿到的才是具体的表达方式,不是一段中性的朗读。
为参考命名并定义其角色
参考是 Seedance 2.5 拉开与早期模型差距的地方,也是大多数薄弱提示词栽跟头的地方。上传一张图像,指令只完成了一半。提示词还得说清楚:这张图贡献了什么,图里哪些东西要忽略。
@Image 1 defines the ceramic artist's facial features, hairstyle, and dark
green apron. Do not use the image background.
@Image 2 defines the wooden workbench, window placement, and morning light of
the pottery studio. Do not use the people in the image.
@Video 1 defines the pacing of throwing clay with both hands, lifting the cup,
and placing it down. Do not use the person's identity, clothing, or scene.
可靠性主要靠下面三条规则:
- 一次只把一个参考绑到一个主体上。 每一组对应关系都写出来。像“@Image 1 到 4 分别定义四个角色”这样写,永远说不清哪张图对应哪个角色。
- 别忘了排除项。 背景、路人和构图会跟着参考一起进画面,除非你明确排除它们。
- 同一个东西,要说出来。 同一盏台灯的四个角度,得写成“这四张图像共同定义同一盏折叠台灯,输出中自始至终只能有一盏灯”,否则你会拿到四盏灯。
如果参考视频本身已经带着运动和镜头调度,那就只说明要继承哪些属性。再用文字把动作重描一遍,反而会跟你附上的参考打架。
同时调度多个参考
参考多到一定数量,事情的性质就变了:不再是描述,而是选角。顺序这样走:先定义每份素材的角色,再映射主体,按类型分组,给重要的主体建档案,最后按场景挑参考。
分组能让长长的清单保持可读:
[Characters]
<Conservator> corresponds to @Image 1. Use only the appearance,
hairstyle, and clothing.
<Registrar> corresponds to @Image 2. Use only the appearance,
hairstyle, and clothing.
Do not interchange their appearances, clothing, actions, or dialogue.
[Props]
<Sample Case> corresponds to @Image 5 and belongs only to <Conservator>.
[Scenes]
<Conservation Lab> references @Image 7. Use only the space,
materials, and lighting.
有些角色会反复出现在多个场景里。给这类角色写一份档案,把附着在他身上的参考全都汇总进去,再加一行“不要使用”的说明。然后按场景挑:每个镜头只调用它自己需要的参考。
Scene 1 | Inspection in the Conservation Lab
Use: <Conservator>, <Sample Case>, <Conservation Lab>, and the
case-opening motion from @Video 1.
Event: <Conservator> opens <Sample Case> at the workbench and
inspects the sample inside.
End state: <Conservator> remains on the inner side of the workbench,
<Sample Case> beside their right hand.
五十个参考是一个选角池,不是一张购物清单。你要做的是帮模型为眼前这个镜头挑对素材,而不是把所有东西一股脑塞进画面。
更长、经过编辑与延展的Seedance 2.5镜头
Seedance 2.5 就是冲着时长设计的。一条30秒的镜头,提示词结构跟5秒的不一样。编辑和延展模式也一样特殊,它们作用在你已有的片段上,而不是一帧空白画面。
写一条30秒的Seedance 2.5视频
把故事拆成前后相接的阶段。一个阶段只安排一个主要变化,并写清这个阶段结束时画面上应该是什么样子。承接上下两个阶段的连续性,靠的就是这个结束状态:
[Generation Goal]
Generate an instructional video showing a flower shop's order-packing process.
[Stage 1]
Initial state: <Florist> stands behind the workbench. Loose stems,
scissors, and wrapping paper lie on the tabletop.
Primary event: <Florist> arranges the stems and trims them to length.
End state: <Florist> holds the bouquet in the left hand, scissors
back on the right of the workbench.
[Stage 2]
Continue from the previous stage: both characters keep the same
identities and clothing.
Primary event: <Store Assistant> unfolds the wrapping paper,
<Florist> places the bouquet inside and ties it.
End state: the wrapped bouquet lies flat in the center of the
workbench, bow facing camera.
[Maintain Consistency]
Keep character identities, clothing, prop ownership, and workbench
orientation consistent.
时机与节奏
分阶段是默认做法。只有当交接、登场、转场或某个节拍必须落在特定时刻上,才动用时间戳。
| 模式 | 适用场景 | 示例 |
|---|---|---|
| 时间区间 | 为整段片段分配节奏 | 0–3 秒…3–7 秒…7–12 秒… |
| 精确时间点 | 一个关键节拍 | 在第5秒,镜头向左快速摇镜并完成转场 |
| 相对时间 | 两个事件之间的延迟 | 角色按下按钮三秒后,灯光熄灭 |
区间要前后相接,不要重叠。它们是时间预算,不是剪辑点,动作落在边界前后一点没关系。一个区间里内容太少,模型就有游移的空间;内容太多,就会出现仓促的剪切,或者干脆漏掉事件。想在一秒里塞进三个动作,这是行不通的。
编辑现有片段
一次编辑是一次补丁式修改,不是一条全新的提示词。指明源片段是唯一的编辑母版,说清改动范围,再列出哪些内容不能动:
[Edit Goal]
Edit @Video 1. Only from 4-7 seconds, change the cool blue light on
the right wall to warm orange light.
[Source Video Role]
@Video 1 is the sole editing master. It defines the character, room
layout, actions, composition, camera movement, audio, and event order.
[Edit Scope]
Change only the light color on the right wall and the area it
illuminates. Allow skin tone to respond naturally.
[Content to Preserve]
Keep the character's identity, clothing, expression, position, motion,
room structure, camera movement, dialogue, and ambience from @Video 1.
替换主体要多加一个模块,而这个模块最容易被忘掉。替换物必须继承原主体的时间线:每一次出现、移动、遮挡和离场,时机、路径、速度都得照旧。少了这一步,新物体是出现在正确的画面里了,节奏却是错的。替换背景是同样的做法,作用范围换成主体轮廓以外的一切。
音频编辑和画面编辑要分开写。说明是哪个说话人、哪一类声音,要做什么改动,以及要保留什么。去掉音乐,同时保留对白、口型同步、环境声和音效,这就是一条完整的指令。
向前或向后延展片段
延展是把新素材接到一帧边界画面上。所以先描述这一帧,再描述新的动作。向前延展,新片段的第一帧要衔接源片段的最后一帧;向后延展,新片段的最后一帧要抵达源片段的第一帧:
@Video 1 is the source video to extend forward.
Extend @Video 1 forward. The first frame of the extended segment directly
continues from the last frame of @Video 1. Maintain the same locked-off medium
shot, the paper airplane's position and orientation, the classroom-window
background, the afternoon lighting, and its movement toward frame right.
Then, the paper airplane continues gliding right and exits the frame while the
curtain beside the window sways slightly.
向后延展还要多设一道防线。哪些素材只属于原片段,得说清楚,否则本该稍后登场的角色和道具,会提前出现在你刚生成的这一段里。另外,“衔接到源视频”这句话本身不够用:要把源片段的第一帧明确写成结束状态,不然画面到达之后还会继续变。
无法覆盖的锁定设置
编辑、延展和首帧生成,各自都会把一部分参数锁死,锁成你输入素材的参数。
| 任务 | 画面比例 | 时长 |
|---|---|---|
| 视频编辑 | 继承自输入视频,无法设置 | 继承自输入视频,无法设置,误差在约0.3秒以内 |
| 首帧或首尾帧 | 继承自首帧图像 | 可以设置 |
| 视频延展 | 继承自输入视频,无法设置 | 可以设置 |
实际操作里的关键陷阱在首尾帧工作流:两张图像必须用相同的画面比例,否则尾帧会被拉伸,去迁就首帧。
Seedance 2.5高阶调度
关键帧、故事板与3D白模
一个镜头的结构,你可以直接交给 Seedance 2.5,不必用文字描述。有四种方式,控制力从低到高:
- 首帧与尾帧。 第一行就说明哪张是首帧、哪张是尾帧,然后描述二者之间那一段连续的动作。两个锚点要分别描述;一句笼统的“这两张是首尾帧”,哪一张都绑不住。
- 多关键帧序列。 开头写“按此顺序使用@Image 1到@Image N作为关键帧”,再说明每张图代表哪个关键状态。分开的图像比拼合成一张网格图更容易对齐。它们控制的是阶段顺序,不是逐帧还原。
- 故事板网格。 网格图传达的是镜头顺序和大致构图,不是精确细节。格数控制在约15格以内,用干净的线稿,文字标注尽量少,说明阅读顺序,并明确排除网格自身的风格,免得线稿风混进最终渲染。
- 3D白模。 粗略的白模承载的是时机信息:路径、走位、镜头运动、剪切点、光线变化、声音节奏。每个灰色形体都要按名称对应到它最终的主体。精细白模已经具备完整结构,用途不一样:结构与镜头运动保持不变,重新渲染材质、角色、场景与风格。用精细白模之前,先把路径线、坐标轴和镜头视锥体去掉,否则它们也会被一起渲染出来。
调度表演与情绪
情绪词能指出方向,但表演本身还是开放的。真正把它收紧的,是说出观众实际看得到、听得到的细节:眼神变化、眉头的紧绷、嘴部动作、呼吸、视线方向、手部动作。一次情绪转折,两到四条线索通常就够了,不需要把每个面部细节都列出来。
默认的结构是四拍:一个触发事件,一个即时反应,一段渐变,最后停在定格的表情上:
The overall emotion shifts from [starting emotion] to [ending emotion].
After [triggering event], [subject] first shows [immediate observable reaction].
Then, [eyes, brows, mouth, breathing, gaze, or hand movement] gradually [changes].
Finally, [subject] expresses [target emotion] through [outward behavior].
如果情绪会转好几次,就把它挂在事件上,而不是挂在情绪上:角色每听到或看到一件新事情,表演就往前推一步。
Seedance 2.5能理解的镜头语言
标准词汇可以直接写进提示词。景别从大远景到大特写都行;运动可以写推进、拉远、摇镜、横移、跟随、环绕、俯冲、后拉、上仰、手持晃动;机位可以写低角度、俯视、第一人称。
常见的技法同样有效,前提是说明它作用在哪个主体上,运动又从哪里开始、到哪里结束。一镜到底要按顺序说明它经过哪些空间。变焦推轨要说明主体尺寸保持不变,背景该往哪个方向走。子弹时间要说明动作在哪里定格,环绕方向如何。变速要说明动作在哪里加速,又在哪里回落。
有些术语模型可能不熟,或者业内用法本来就不统一。这时候把词保留,同时把它翻译成可见的画面变化:
Rack focus: shift focus smoothly from the leaves in the foreground to the
person in the background. The leaves gradually blur while the person's face
changes from soft to sharp.
光圈、焦距、快门数值都可以写。不过几乎每一次,直接说出你想要的可见效果,都是更清晰的指令。
发送前检查清单
在花掉一次生成之前,先过一遍这份清单:
- 主体和主要动作已经写明白。
- 每个参考都交代了要用什么、不要用什么。
- 每个不同的角色、产品和道具都已命名,并绑到一个参考上。
- 参考是按场景挑的,没有全部塞进每一个镜头。
- 长视频的每个阶段只有一个主要变化,结束状态清晰。
- 角色数量、服装、道具归属和空间关系前后一致。
- 编辑指令写清了唯一的母版、改动范围,以及要保留的内容。
- 情绪和不常见的镜头术语都配了可观察的线索。
- 首尾图像用的是同一个画面比例,每个关键帧只承担一个角色。
- 延展的边界帧、运动趋势和音频连续性都检查过了。
Seedance 2.5做不到精确的地方
围着它规划镜头之前,这几条值得先知道:
- 时间戳是在给事件分配时间,不是逐帧精确的剪辑点。
- 编辑能提高事件与源片段对齐的概率,但保证不了逐帧完全重合。
- 自然衔接的转场追求的是画面和音频的连续性,不是把两段源片段像素级地完全保留下来。
- 字幕、公式、标牌和产品规格如果必须完全准确,仍然是后期制作的活。先生成镜头,再合成文字。
弱提示词与强提示词
镜头、随时间的运动、每个参考的角色,这三样都要指明,别交给运气。
| 重点 | 弱 | 强 |
|---|---|---|
| 镜头 | 黄昏时的城市天际线 | 低位航拍掠过黄昏的天际线,一个不间断的推进,朝向唯一一座亮灯的塔楼 |
| 随时间的运动 | 山脊上的攀登者 | 攀登者翻上山脊、站起来,转向山谷,镜头同时后拉 |
| 连续性 | 使用这些参考 | @Image 1定义侦探的大衣与面容,不要用它的背景。@Image 2定义广场的布局与光线 |
常见错误
- 描述静止画面。视频模型要的是随时间发生的运动,不是一张用文字写成的照片。
- 镜头写得含糊。“电影感”什么都没告诉模型,请指明景别和一个运动。
- 把一整段序列塞进一条提示词,又不分阶段,事件就会互相撞车,而不是依次展开。
- 参考不加标注,或者一整组统一标注,模型只能猜是哪个在驱动场景。
- 忘了写排除项,参考的背景或路人就跟着主体一起被继承下来。

