Flux 3:完全ガイド、機能、プロンプト、ネイティブ音声付き動画

Flux 3:完全ガイド、機能、プロンプト、ネイティブ音声付き動画

Flux 3完全ガイド。マルチモーダルワールドモデル、ネイティブ音声付き動画、物理法則に従う動き、一貫したキャラクター、コンテキスト内編集、そしてプロンプト例まで。

Flux 3の機能と特長

Flux 3はBlack Forest Labsのマルチモーダル基盤モデルです。出力ごとに別々のモデルを持つのではなく、画像・動画・音声を一緒に学習するので、ひとつのプロンプトで、現実世界のようにふるまう動いて鳴るショットを返せます。

Black Forest LabsはFlux 3を2026年7月23日に発表し、早期アクセスを通じて展開しています。以下の機能は同社が説明しているものです。続くプロンプトガイダンスはネイティブ音声付き動画モデルの一般的な実践であり、正確なレバーはFlux 3が広く利用可能になるにつれて固まっていくかもしれません。

機能内容向いている用途
ネイティブ音声付き動画クリップと同期した音を1回の生成でまとめて作る音ありのシーン、セリフ、効果音
現実の物理動きが質量と勢いに従い、音が衝撃に合う商品フィルム、アクション、解説
一貫したキャラクタービジュアル参照から被写体をショットをまたいで保つシーケンス、シリーズ、ブランド案件
多言語のテキストとスピーチ正確な画面上テキストと話しことばのセリフを描くローカライズ動画、タイトル、字幕
コンテキスト内編集全体を作り直さずに一要素だけを変えるテイクの修正、狙った箇所の手直し
マルチショット連結クリップをつないで長い連続シーケンスにする短編、広告、リビール

ネイティブ音声付き動画

見出しは、映像と音が一緒に届くことです。Flux 3は各クリップを同じ生成の中で同期したネイティブ音声とともに生成するので、衝撃音、足音、セリフが後から重ねられるのではなく、すでに動きに結び付いています。欲しい音をプロンプトに書き、シーンにセリフがあるときは言語を設定します。

現実の物理

Flux 3は動き、質量、音をひとつのシステムとして学習するので、重さ、勢い、衝突が現実のルールに従い、カメラが動いても素材は見た目を保ちます。ショットを通じて動きがどう展開するかを描写すれば、物理はぶれるのではなく撮影されたように見えます。

一貫したキャラクター

明確なビジュアル参照を渡せば、Flux 3はショットからショットへ同じ顔、服装、見た目を引き継ぎます。その参照をカットをまたいで再利用すれば、数分続くシーケンスを通じてキャラクターを保て、シーンごとにリセットするのではなくシリーズが見分けのつくまま保たれます。

多言語テキストとコンテキスト内編集

テキスト描写は以前のFluxから大きく向上しており、複数言語の正確な画面上テキストも含みます。そのためタイトルカードは別の工程なしできちんと読めます。編集は狙いを絞ったものです。フレームの一要素を変えたり、ソースクリップの被写体を新しいシーンに持ち込んだりでき、残りはそのまま保たれます。

Flux 3の活用例

ネイティブ音声付きシーン

クリップは音がすでに同期した状態で返ってくるので、効果音やセリフが動きにぴたりと合い、あとで直す無音のテイクにはなりません。

商品・ブランドフィルム

カメラが動いても反射、重さ、素材が正確なままなので、注ぎ、回転、落下がシミュレーションではなく撮影されたように見えます。

マルチショットのシーケンス

クリップを連結して長いシーンにし、ビジュアル参照で1人のキャラクターをすべてのカットにまたいで保つので、シーケンスの一貫性が保たれます。

3つのシーンをまたいで一貫して保たれた同じ赤毛の女性

ローカライズ動画

多言語のセリフと正確な画面上テキストにより、1つのシーンをタイトルや音声を別に作らずに複数言語で出せます。

同じ一節を英語と韓国語で表示する放送用のローワーサード

画像の生成と編集

さまざまなスタイルやアスペクト比で合成し、くっきりしたテキストを描き、画像全体を作り直さずに一領域だけをその場で編集します。

背景だけを変えたポートレートのビフォーアフター

リアルな物理の解説動画

重力、衝突、動きが現実のルールに従うので、しくみ解説の映像が正確さを保ちながらクリーンに仕上がります。

Flux 3のプロンプトの書き方

プロンプトはキャプションではなく、短いショットのブリーフとして書きます。SPACEを一通りたどり、Flux 3は映像と一緒に音を作るので、必ず音のキューを1つ含めます。

SPACE入れるべき内容
Subject(被写体)画面にいる人や物を具体的に赤いレインジャケットを着た配達員
Performance(動き)被写体が何をどうするか彼女が市場の屋台の間を縫って進み、吐く息が白く曇る
Ambience(舞台)舞台、時間帯、光雨に濡れた夜の市場、足下の濡れた石畳
Camera(カメラ)ショットタイプと動き1つローアングルの追従ショット、安定した寄り
Extra cues(追加のキュー)音声、言語、テンポ雨と遠くのざわめき、日本語のセリフ1つ

よくある間違い

  • 静止画を描写する。動画モデルには、ことばで表した写真ではなく、時間にわたる動きが必要です。
  • 音を忘れる。Flux 3は音声を生成するので、欲しい効果音、環境音、セリフを挙げましょう。
  • 1つのプロンプトにシーケンスを詰め込む。1テイクに明確なアクションを1つ保ち、長さはクリップの連結でまかないます。
  • 参照にラベルを付けない。各参照が何のためかを言えば、モデルはどれがシーンを動かすかを理解できます。

機能の全リストと仕様については、Flux 3モデルページをご覧ください。

よくある質問

良いFlux 3プロンプトの書き方は?
キャプションではなく、短いショットのブリーフとして書きます。被写体、動き、舞台と光、カメラ、そして音のキューを1つ挙げます。Flux 3は映像と一緒に音を生成するので、そのショットがどう鳴るべきかを書き、静止した1フレームではなく動きが時間とともにどう展開するかを描写しましょう。
Flux 3は動画と一緒に音声を生成しますか?
はい。すべてのFlux 3クリップは同じ生成の中で作られたネイティブ音声とともに返ってくるので、衝撃音、足音、環境音、セリフがすでに動きに同期しています。欲しい音をプロンプトに書き、シーンにセリフがあるときは言語を添えます。Flux 3は多言語のスピーチに対応しています。
Flux 3の動画はどのくらいの長さにできますか?
Flux 3は1回の生成で最大20秒を生成します。より長い作品には、クリップを連結してマルチショットのシーケンスにし、同じビジュアル参照を再利用して、数分に及ぶシーンをまたいでキャラクターの一貫性を保ちます。
Flux 3でキャラクターの一貫性を保つには?
被写体の明確なビジュアル参照を添付し、ショットからショットへ再利用します。Flux 3はカットをまたいで同じ顔、服装、見た目を引き継ぐので、シーンごとにぶれるのではなく、シーケンスが見分けのつくまま保たれます。
Flux 3は再生成せずに画像やクリップを編集できますか?
はい。Flux 3は画像でも動画でもコンテキスト内編集を行います。一要素を変えても残りのフレームはそのまま留まり、ソースクリップの被写体を新しいシーンに持ち込むこともできます。全体を作り直すより速く、すでに気に入っているテイクを保てます。
Flux 3の使い方は?
ショットを短いブリーフとして書き、被写体、その動き、カメラ、そして音のキューを1つ挙げます。一貫性を保つ必要があるキャラクター、商品、セットの参照画像を添付します。プロンプトを実行し、残したいテイクをコンテキスト内編集で仕上げるか、別のクリップを連結してより長いシーケンスにします。