Flux 3 的功能与特性
Flux 3 是 Black Forest Labs 的多模态基础模型。它不是每种输出各配一个模型,而是一起学习图像、视频和音频,因此一条提示词就能返回一个会动、会响、并像真实世界那样运作的镜头。
Black Forest Labs 于 2026 年 7 月 23 日发布 Flux 3,并通过早期体验逐步开放。下方列出的是他们已经描述的能力;随后的提示词指引是针对带原生音频视频模型的通用做法,具体参数可能会随着 Flux 3 广泛可用而进一步确定。
| 功能 | 作用 | 适用场景 |
|---|---|---|
| 带原生音频的视频 | 一次生成同时产出画面及其同步声音 | 带声音的场景、对白、特效 |
| 真实世界物理 | 运动服从质量与惯性;声音与撞击对应 | 产品影片、动作、科普讲解 |
| 角色一致 | 凭一张视觉参考让主体贯穿多个镜头 | 序列、系列、品牌内容 |
| 多语言文字与语音 | 准确渲染屏幕文字与口语对白 | 本地化视频、标题、字幕 |
| 情境内编辑 | 改动一个元素而无需整体重新渲染 | 修补某条素材、定点修改 |
| 多镜头串接 | 把片段连成更长的连续序列 | 短片、广告、揭示镜头 |
带原生音频的视频
重点在于画面和声音一起到来。Flux 3 在同一次生成中为每个片段配上同步原生音频,因此撞击声、脚步声或一句台词已经与动作绑定,而不是事后叠加。在提示词里写清你想要的声音,场景有对白时设定语言。
真实世界物理
Flux 3 把运动、质量和声音当作一个系统来学习,因此重量、惯性和碰撞遵循真实规则,材质在镜头移动时也保持本来的样子。描述动作如何在整个镜头中演进,物理效果读起来就像实拍,而不会漂移。
角色一致
提供一张清晰的视觉参考,Flux 3 就能在镜头之间保持相同的面孔、服装和外观。在剪辑间复用这张参考,可以让角色贯穿长达数分钟的序列,正是这一点让系列内容保持可辨识,而不会每一场都重置。
多语言文字与情境内编辑
文字渲染相比早期 Flux 显著提升,包括在多种语言中准确呈现屏幕文字,因此一张标题卡无需单独一步就能读得对。编辑是定点的:改动画面中的某一个元素,或把主体从源片段带入新场景,其余部分保持完整。
Flux 3 使用场景
带原生音频的场景
片段返回时声音已经同步,特效或一句台词与动作一同落点,而不是事后再去补救一条无声素材。
产品与品牌影片
镜头移动时反光、重量和材质都保持真实,一次倾倒、一次旋转或一次落下都看起来像实拍而非模拟。
多镜头序列
把片段串接成更长的场景,用一张视觉参考让同一角色贯穿每一次剪辑,让序列保持一致。

本地化视频
多语言对白和准确的屏幕文字让同一场景以多种语言交付,无需单独做标题或配音。

图像生成与编辑
跨风格、跨宽高比合成图像,渲染清晰文字,再原地编辑某一个区域,无需整体重做整张图。

带真实物理的科普讲解
重力、碰撞和运动都遵循真实规则,原理演示画面既准确又干净。
如何为 Flux 3 写提示词
把提示词写成一份简短的镜头简报,而不是一句配文。按 SPACE 逐项过一遍,并且由于 Flux 3 连同画面一起生成声音,请始终写上一个音频提示。
| SPACE | 应包含 | 示例 |
|---|---|---|
| 主体(Subject) | 画面里的人或物,具体描述 | 一名穿红色雨衣的快递员 |
| 表演(Performance) | 动作:主体做什么,怎么做 | 她在市集摊位间穿行,呼出的气凝成白雾 |
| 氛围(Ambience) | 场景、时间和光线 | 被雨浸透的夜市,脚下是湿漉漉的石板 |
| 镜头(Camera) | 景别加一个运动 | 低角度跟拍,平稳推进 |
| 附加提示(Extra cues) | 音频、语言、节奏 | 雨声和远处的交谈声,一句日语台词 |
常见错误
- 描述了一张静止画面。视频模型需要随时间发生的动作,而不是用文字写出的一张照片。
- 忘了声音。Flux 3 会生成音频,请写清你想要的特效、环境音或台词。
- 把一整段序列塞进一条提示词。每条素材保持一个清晰的动作,用串接来延长。
- 参考图没有标注。说明每张参考图的用途,好让模型知道由哪一张来主导场景。
完整能力清单和技术规格,请见 Flux 3 模型页面。
