Flux 3 的功能与特性
Flux 3 是 Black Forest Labs 推出的多模态基础模型。它不是每种输出单配一个模型,而是把图像、视频和音频放在一起学习,一条提示词就能返回一个既会动、又会响、还符合真实世界规律的镜头。
Black Forest Labs 于 2026 年 7 月 23 日发布 Flux 3,视频生成功能在 8 月 4 日正式全面开放。片段时长 5 到 20 秒,支持 HD 720p 或 Full HD 1080p,宽高比可选 21:9 到 9:16 共七种,默认在生成画面的同时配上音频。以下内容均遵循 Black Forest Labs 官方发布的提示词指南。
| 功能 | 作用 | 适用场景 |
|---|---|---|
| 原生音频视频 | 一次生成同时产出画面和同步声音 | 带声场景、对白、音效 |
| 真实物理 | 运动遵循质量与惯性,声音与撞击对应 | 产品影片、动作戏、科普讲解 |
| 关键帧 | 在最多 10 张固定静帧之间插值出一个镜头 | 可控转场、分镜脚本 |
| 片段续接 | 从已有片段的末尾几帧继续生成 | 更长的场景、救活一条好素材 |
| 多语言对白 | 支持 13 种以上语言的口型同步台词 | 本地化视频、出镜讲解、广告 |
| 多镜头生成 | 在一次生成里安排多个机位 | 短片、广告、揭示镜头 |
| 草稿模式 | 先出快速预览,再按预览渲染正片 | 定方向阶段,先看效果再决定 |
原生音频视频
它的核心是画面和声音同时到来。Flux 3 在同一次生成里为每个片段配上同步的原生音频,撞击声、脚步声或一句台词从一开始就绑定在动作上,而不是事后叠加。在提示词里点名你想要的声音,场景有对白时再注明语言。
真实物理
Flux 3 把运动、质量和声音当成一套系统来学习,重量、惯性和碰撞都遵循真实规则,材质在镜头移动时也不会走样。把动作在整个镜头里如何演进描述清楚,画面读起来就像实拍,而不是漂移失真。
关键帧与片段续接
想掌控运动,有两条路。固定几张静帧作为关键帧,Flux 3 会在它们之间插出一段连续镜头:一张图设定开场,两张锁定起止点,最多十张按时间戳排布就变成一份分镜表,模型必须按顺序命中。或者交给它你已有的素材,续接功能会从末尾几帧接着生成,把运动惯性、镜头语言和背景声都连贯带过接缝处,看不出剪辑。
多语言对白与字幕排版
写出台词、注明语言、描述语气,Flux 3 就能在镜头里说出这句话,口音和唇形都能对上。支持的语言包括英语及其口音、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语和旁遮普语。片中的文字排版会作为场景的一部分渲染,镜头运动时依然保持清晰,标题和招牌文字都能撑得住动态。
Flux 3 使用场景
原生音频场景
片段返回时声音已经同步好了。一段音效或一句台词直接落在动作上,不必再补一条无声素材去后期配音。
产品与品牌影片
反光、重量和材质在镜头移动时都保持真实。一次倾倒、一次旋转或一次跌落,看起来都像实拍而不是模拟出来的。
多镜头序列
在一次生成里安排好几个机位,或者用续接功能把片段延长,让同一个角色在每一次剪切之间保持不变。

本地化视频与出海内容
多语言对白加上精准的屏幕文字,一个场景就能直接产出多语言版本,省下单独做字幕或配音的一轮流程。

先出草稿,再定正片
先便宜快速地预览一个方向,看过之后再用同样的主体、构图和运动,把选定的那条按正片画质渲染出来。

带真实物理的科普讲解
重力、碰撞和运动都遵循真实规则,讲原理的画面既准确又不显得杂乱。
如何为 Flux 3 写提示词
导演一个场景,别去罗列一堆物体。Black Forest Labs 的建议是:写清发生了什么、主体怎么动、镜头怎么运镜、这个镜头听起来是什么样,全部用摄像机真能拍到的具体名词和动词。含糊的形容词只会把结果交给运气。
先选一种提示词写法
Flux 3 支持四种写法,长短不是目的。先用短句探路,只有真正需要控制力时才加长。
| 写法 | 适合的场景 | 示例 |
|---|---|---|
| 短语 | 快速探索、主体单一、乐于接受意外惊喜 | 一只红狐狸跃过新雪,长焦镜头 |
| 自然语言单句 | 单个镜头的日常首选 | 黎明时分,一只狐狸在湿漉漉的松林灌木间飞奔,低角度跟拍 |
| 带标签字段 | 只想调整某一个变量,不动其余部分 | 镜头:广角,低机位。主体:一名骑手渡过河流 |
| 时间戳 | 动作必须精准落在某个节点 | 0.0-1.5 秒锁定港口广角;1.5-3.0 秒开始缓慢推进 |
自然语言单句有一个值得记住的固定结构:[镜头] 拍摄 [主体] 在 [场景] 中 [动作],再补上画面细节和运动细节。时间戳节点要控制在能实现的范围内,一段五秒的片段安排两到三个节点即可,机位一变就标出硬切。
多镜头作品要搭好 CASTLE 六要素
当画面风格和故事线要贯穿好几个镜头时,Black Forest Labs 给出了一套六部分结构。这六个部分的英文首字母拼成 CASTLE,是我们对这套结构的简称,并非官方命名,但它是检查一条长提示词漏了什么最快的办法。
| 要素 | 该写什么 | |
|---|---|---|
| C | Core(主线概要) | 一句话概括整段序列:谁、在哪里、故事怎么走 |
| A | Audio(音频) | 逐镜头写声景,与画面同步渲染 |
| S | Subject(主体) | 每个镜头逐字保持一致,人物身份才不会漂移 |
| T | Timeline(时间线) | 逐镜头、按时间码写清镜头运动和主体动作 |
| L | Look(整体质感) | 全片统一的写实程度、色调基准和颗粒感 |
| E | Environment(环境) | 逐镜头写场景、光质和景深 |
按你顺手的顺序先把内容填进去,再按 Black Forest Labs 文档规定的顺序组装提示词:主线概要、环境、主体、时间线、音频、质感。让主体描述在每个镜头间逐字相同,这是防止角色在剪切之间跑偏最省成本的连贯性技巧。
点名你想要的声音
音频是和画面一起生成的,所以一个暗示了声音的场景比一句抽象描述能给模型更多可发挥的东西。脚步声、撞击声、雨声、引擎声和人群声都能被清楚识别。声音一共分四层,通常用不到全部四层。
| 层次 | 该描述什么 | 示例 |
|---|---|---|
| 台词 | 谁在说话、引号里的原话,以及语气 | 修理工说:“现在试试。”平静、就事论事 |
| 环境音 | 这个地方本身的声音 | 雨点打在窗户上,餐馆里低声交谈 |
| 音效 | 跟画面动作对应的声音 | 一只陶瓷杯轻碰茶碟 |
| 音乐 | 风格、节奏,以及它在混音中的位置 | 一段稀疏的钢琴动机铺在场景之下,混音音量偏低 |
有两个习惯能解决大部分问题。点名一个具体声源,而不是要求安静,因为“安静的房间音”很容易生成一段死寂无声的画面,而“雨点打在窗户上”给了模型明确可渲染的东西。另外,写台词时要说明说话者是否出镜,否则一句加了引号的话可能被当成要放进画面里的文字。
导演声音的语气,而不是笼统的感觉
“专业、温暖、有感染力”这类描述每次都会生成同一种打磨过的播音腔。具体的锚点更管用:需要的话给出年龄和口音、说话的正式程度、录制方式、表演方式,再加一条限定,比如“不要播音腔”。写完先把台词大声读一遍再生成,声音方向救不回一句写得僵硬的台词。
常见错误
- 描述了一张静止画面。视频模型需要的是随时间发生的动作,而不是用文字写出的一张照片。
- 忘了写声音。音频默认会生成,请写清你想要的音效、环境音或台词。
- 堆砌镜头术语。“低角度跟拍”清楚明确,“低空航拍手持环绕推镜”就说不清了。
- 写否定句。Flux 系列模型不支持负面提示词,只能写你想要的东西。
- 五秒片段塞得太满。好几个说话人、一段长台词、多个节拍全挤进五秒,最后一个词大概率会被截断。要么删短台词,要么把时长拉长。
完整能力清单和技术规格,请见 Flux 3 模型页面。
