Flux 3 完整指南:功能、提示词与带原生音频的视频

Flux 3 完整指南:功能、提示词与带原生音频的视频

Flux 3 完整指南:多模态世界模型、带原生音频的视频、符合物理规律的动态、角色一致、情境内编辑,以及提示词示例。

Flux 3 的功能与特性

Flux 3 是 Black Forest Labs 的多模态基础模型。它不是每种输出各配一个模型,而是一起学习图像、视频和音频,因此一条提示词就能返回一个会动、会响、并像真实世界那样运作的镜头。

Black Forest Labs 于 2026 年 7 月 23 日发布 Flux 3,并通过早期体验逐步开放。下方列出的是他们已经描述的能力;随后的提示词指引是针对带原生音频视频模型的通用做法,具体参数可能会随着 Flux 3 广泛可用而进一步确定。

功能作用适用场景
带原生音频的视频一次生成同时产出画面及其同步声音带声音的场景、对白、特效
真实世界物理运动服从质量与惯性;声音与撞击对应产品影片、动作、科普讲解
角色一致凭一张视觉参考让主体贯穿多个镜头序列、系列、品牌内容
多语言文字与语音准确渲染屏幕文字与口语对白本地化视频、标题、字幕
情境内编辑改动一个元素而无需整体重新渲染修补某条素材、定点修改
多镜头串接把片段连成更长的连续序列短片、广告、揭示镜头

带原生音频的视频

重点在于画面和声音一起到来。Flux 3 在同一次生成中为每个片段配上同步原生音频,因此撞击声、脚步声或一句台词已经与动作绑定,而不是事后叠加。在提示词里写清你想要的声音,场景有对白时设定语言。

真实世界物理

Flux 3 把运动、质量和声音当作一个系统来学习,因此重量、惯性和碰撞遵循真实规则,材质在镜头移动时也保持本来的样子。描述动作如何在整个镜头中演进,物理效果读起来就像实拍,而不会漂移。

角色一致

提供一张清晰的视觉参考,Flux 3 就能在镜头之间保持相同的面孔、服装和外观。在剪辑间复用这张参考,可以让角色贯穿长达数分钟的序列,正是这一点让系列内容保持可辨识,而不会每一场都重置。

多语言文字与情境内编辑

文字渲染相比早期 Flux 显著提升,包括在多种语言中准确呈现屏幕文字,因此一张标题卡无需单独一步就能读得对。编辑是定点的:改动画面中的某一个元素,或把主体从源片段带入新场景,其余部分保持完整。

Flux 3 使用场景

带原生音频的场景

片段返回时声音已经同步,特效或一句台词与动作一同落点,而不是事后再去补救一条无声素材。

产品与品牌影片

镜头移动时反光、重量和材质都保持真实,一次倾倒、一次旋转或一次落下都看起来像实拍而非模拟。

多镜头序列

把片段串接成更长的场景,用一张视觉参考让同一角色贯穿每一次剪辑,让序列保持一致。

同一名红发女子在三个场景中保持一致

本地化视频

多语言对白和准确的屏幕文字让同一场景以多种语言交付,无需单独做标题或配音。

一条广播下方字幕以英语和韩语写着同一句话

图像生成与编辑

跨风格、跨宽高比合成图像,渲染清晰文字,再原地编辑某一个区域,无需整体重做整张图。

一张人像的前后对比,仅背景发生了变化

带真实物理的科普讲解

重力、碰撞和运动都遵循真实规则,原理演示画面既准确又干净。

如何为 Flux 3 写提示词

把提示词写成一份简短的镜头简报,而不是一句配文。按 SPACE 逐项过一遍,并且由于 Flux 3 连同画面一起生成声音,请始终写上一个音频提示。

SPACE应包含示例
主体(Subject)画面里的人或物,具体描述一名穿红色雨衣的快递员
表演(Performance)动作:主体做什么,怎么做她在市集摊位间穿行,呼出的气凝成白雾
氛围(Ambience)场景、时间和光线被雨浸透的夜市,脚下是湿漉漉的石板
镜头(Camera)景别加一个运动低角度跟拍,平稳推进
附加提示(Extra cues)音频、语言、节奏雨声和远处的交谈声,一句日语台词

常见错误

  • 描述了一张静止画面。视频模型需要随时间发生的动作,而不是用文字写出的一张照片。
  • 忘了声音。Flux 3 会生成音频,请写清你想要的特效、环境音或台词。
  • 把一整段序列塞进一条提示词。每条素材保持一个清晰的动作,用串接来延长。
  • 参考图没有标注。说明每张参考图的用途,好让模型知道由哪一张来主导场景。

完整能力清单和技术规格,请见 Flux 3 模型页面

常见问题

怎样写好一条 Flux 3 提示词?
把它写成一份简短的镜头简报,而不是一句配文。写清主体、动作、场景与光线、镜头,以及一个音频提示。由于 Flux 3 会连同画面一起生成声音,请说明镜头应该听起来是什么样,并描述动作如何随时间演进,而不是一个定格画面。
Flux 3 会为视频生成音频吗?
会。每个 Flux 3 片段返回时都带有在同一次生成中产出的原生音频,因此撞击声、脚步声、环境音或一句台词都已与动作同步。在提示词里写清你想要的声音,场景有对白时再加上语言,因为 Flux 3 支持多语言语音。
一段 Flux 3 视频可以多长?
Flux 3 单次生成最长 20 秒。要制作更长的作品,把片段串接成多镜头序列,并复用同一张视觉参考,让角色在可长达数分钟的多个场景间保持一致。
如何在 Flux 3 中保持角色一致?
为主体附上一张清晰的视觉参考,并在每个镜头间复用它。Flux 3 会在剪辑之间保持相同的面孔、服装和外观,正是这一点让序列保持可辨识,而不会一场一场地漂移。
Flux 3 能在不重新生成的情况下编辑图像或片段吗?
能。Flux 3 对图像和视频都支持情境内编辑。改动一个元素而画面其余保持不动,或把主体从源片段带入新场景,这比整体重做更快,也保住了你已经满意的那一条。
我如何使用 Flux 3?
把镜头写成一份简短的简报,写清主体、动作、镜头以及一个音频提示。为需要保持一致的角色、产品或场景附上参考图。运行提示词,然后用情境内编辑打磨满意的那条,或串接另一个片段以获得更长的序列。