Flux 3の機能と特長
Flux 3はBlack Forest Labsのマルチモーダル基盤モデルです。出力ごとに別々のモデルを持つのではなく、画像・動画・音声を一緒に学習するので、ひとつのプロンプトで、現実世界のようにふるまう動いて鳴るショットを返せます。
Black Forest LabsはFlux 3を2026年7月23日に発表し、早期アクセスを通じて展開しています。以下の機能は同社が説明しているものです。続くプロンプトガイダンスはネイティブ音声付き動画モデルの一般的な実践であり、正確なレバーはFlux 3が広く利用可能になるにつれて固まっていくかもしれません。
| 機能 | 内容 | 向いている用途 |
|---|---|---|
| ネイティブ音声付き動画 | クリップと同期した音を1回の生成でまとめて作る | 音ありのシーン、セリフ、効果音 |
| 現実の物理 | 動きが質量と勢いに従い、音が衝撃に合う | 商品フィルム、アクション、解説 |
| 一貫したキャラクター | ビジュアル参照から被写体をショットをまたいで保つ | シーケンス、シリーズ、ブランド案件 |
| 多言語のテキストとスピーチ | 正確な画面上テキストと話しことばのセリフを描く | ローカライズ動画、タイトル、字幕 |
| コンテキスト内編集 | 全体を作り直さずに一要素だけを変える | テイクの修正、狙った箇所の手直し |
| マルチショット連結 | クリップをつないで長い連続シーケンスにする | 短編、広告、リビール |
ネイティブ音声付き動画
見出しは、映像と音が一緒に届くことです。Flux 3は各クリップを同じ生成の中で同期したネイティブ音声とともに生成するので、衝撃音、足音、セリフが後から重ねられるのではなく、すでに動きに結び付いています。欲しい音をプロンプトに書き、シーンにセリフがあるときは言語を設定します。
現実の物理
Flux 3は動き、質量、音をひとつのシステムとして学習するので、重さ、勢い、衝突が現実のルールに従い、カメラが動いても素材は見た目を保ちます。ショットを通じて動きがどう展開するかを描写すれば、物理はぶれるのではなく撮影されたように見えます。
一貫したキャラクター
明確なビジュアル参照を渡せば、Flux 3はショットからショットへ同じ顔、服装、見た目を引き継ぎます。その参照をカットをまたいで再利用すれば、数分続くシーケンスを通じてキャラクターを保て、シーンごとにリセットするのではなくシリーズが見分けのつくまま保たれます。
多言語テキストとコンテキスト内編集
テキスト描写は以前のFluxから大きく向上しており、複数言語の正確な画面上テキストも含みます。そのためタイトルカードは別の工程なしできちんと読めます。編集は狙いを絞ったものです。フレームの一要素を変えたり、ソースクリップの被写体を新しいシーンに持ち込んだりでき、残りはそのまま保たれます。
Flux 3の活用例
ネイティブ音声付きシーン
クリップは音がすでに同期した状態で返ってくるので、効果音やセリフが動きにぴたりと合い、あとで直す無音のテイクにはなりません。
商品・ブランドフィルム
カメラが動いても反射、重さ、素材が正確なままなので、注ぎ、回転、落下がシミュレーションではなく撮影されたように見えます。
マルチショットのシーケンス
クリップを連結して長いシーンにし、ビジュアル参照で1人のキャラクターをすべてのカットにまたいで保つので、シーケンスの一貫性が保たれます。

ローカライズ動画
多言語のセリフと正確な画面上テキストにより、1つのシーンをタイトルや音声を別に作らずに複数言語で出せます。

画像の生成と編集
さまざまなスタイルやアスペクト比で合成し、くっきりしたテキストを描き、画像全体を作り直さずに一領域だけをその場で編集します。

リアルな物理の解説動画
重力、衝突、動きが現実のルールに従うので、しくみ解説の映像が正確さを保ちながらクリーンに仕上がります。
Flux 3のプロンプトの書き方
プロンプトはキャプションではなく、短いショットのブリーフとして書きます。SPACEを一通りたどり、Flux 3は映像と一緒に音を作るので、必ず音のキューを1つ含めます。
| SPACE | 入れるべき内容 | 例 |
|---|---|---|
| Subject(被写体) | 画面にいる人や物を具体的に | 赤いレインジャケットを着た配達員 |
| Performance(動き) | 被写体が何をどうするか | 彼女が市場の屋台の間を縫って進み、吐く息が白く曇る |
| Ambience(舞台) | 舞台、時間帯、光 | 雨に濡れた夜の市場、足下の濡れた石畳 |
| Camera(カメラ) | ショットタイプと動き1つ | ローアングルの追従ショット、安定した寄り |
| Extra cues(追加のキュー) | 音声、言語、テンポ | 雨と遠くのざわめき、日本語のセリフ1つ |
よくある間違い
- 静止画を描写する。動画モデルには、ことばで表した写真ではなく、時間にわたる動きが必要です。
- 音を忘れる。Flux 3は音声を生成するので、欲しい効果音、環境音、セリフを挙げましょう。
- 1つのプロンプトにシーケンスを詰め込む。1テイクに明確なアクションを1つ保ち、長さはクリップの連結でまかないます。
- 参照にラベルを付けない。各参照が何のためかを言えば、モデルはどれがシーンを動かすかを理解できます。
機能の全リストと仕様については、Flux 3モデルページをご覧ください。
