マルチモーダル

Flux 3

Black Forest Labs 提供

Black Forest Labsによる画像・動画・音声のワールドモデル。
動きに合った音声まで生成します。

Flux 3

主な機能

技術仕様

画像·動画·音声

ひとつのモデルで一緒に学習。行動予測にも拡張

最大20秒

1回の生成での動画尺。クリップを連結すればより長いシーケンスに

ネイティブ

すべての動画クリップとともに同期音声を生成

Self-Flow

Black Forest Labsによる統合マルチモーダルアーキテクチャ

活用事例

音声付き動画を1回で

プロンプトがクリップと音声を一緒に返すので、効果音やセリフが後付けではなく最初から動きに同期しています。

マルチショットのシーケンス

クリップを連結して長いシーンにし、ビジュアル参照で1人のキャラクターをすべてのカットにまたいで保ちます。短編から長編まで対応。

商品・ブランドフィルム

カメラが動いても素材、重さ、反射が正確なままなので、商品はシミュレーションではなく撮影されたように見えます。

ローカライズ動画

多言語のセリフと正確な画面上テキストにより、1つのシーンをタイトルや音声を別に作り直さずに複数言語で出せます。

画像の生成と編集

さまざまなスタイルやアスペクト比で合成し、くっきりした多言語テキストを描き、全体を作り直さずに一領域だけを編集できます。

リアルな物理の解説動画

重力、衝突、動きが現実のルールに従うので、科学やしくみ解説の映像が正確さを保ちながらクリーンに仕上がります。

プロンプト例

物理に忠実なクリップ

物理に忠実なクリップ

セラミックのマグカップが大理石のカウンターから滑り落ち、床で砕けて破片が散る、鋭い衝撃音が同期する

Edit prompt
マルチショットのシーケンス

マルチショットのシーケンス

赤いジャケットを着た同じ配達員、1カット目は市場を縫うように進み、次のカットは夕暮れの灯りのついた玄関に到着する

Edit prompt
ローカライズしたタイトルカード

ローカライズしたタイトルカード

コーヒーブランドのヒーローショット、淹れたてから立ちのぼる湯気、画面上に「Freshly Roasted」とくっきりした太字で表示

Edit prompt
ビデオカメラ映像からシネマティックへ

ビデオカメラ映像からシネマティックへ

誕生日パーティーの手持ちビデオカメラ映像、続いて同じシーンを部屋の空気音を伴う温かなシネマティックワイドで

Edit prompt
コンテキスト内編集

コンテキスト内編集

参照クリップの被写体を取り出し、夜の雨に濡れた東京の通りを歩かせる、残りはそのまま保つ

Edit prompt
スタジオ商品

スタジオ商品

チタンの台座で回転するアバンギャルドなスニーカー、硬いキーライト、正確な金属の反射、かすかな機械音

Edit prompt

シンプルな料金体系

今すぐ無料で始めて、いつでもアップグレードまたはキャンセルできます。

Basic

$9/
請求額は $0

900 月 クレジット

1 ユーザーのみ

すべてのモデル

ワークフロー

Standard

$24/
請求額は $0

3200 月 クレジット

1 ユーザーのみ

すべてのモデル

ワークフロー

Pro

$45/
請求額は $0

6200 共有 月 クレジット

1 ユーザー

+ 最大 4 名まで追加費用

すべてのモデル

ワークフロー

Pro Max

$170/
請求額は $0

24000 共有 月 クレジット

1 ユーザー

+ 最大 9 名まで追加費用

すべてのモデル

ワークフロー

Enterprise

より高い制限のために

カスタム

料金と請求条件

大容量クレジット
カスタムシート制限
すべてのモデル
ワークフロー
Pricing Gradient

Free

気軽に試したい方に

$0

ずっと無料

最大20クレジット
1ユーザーのみ
一部のモデル
ワークフロー

よくある質問

Flux 3とは何ですか?
Flux 3はBlack Forest Labsのマルチモーダル基盤モデルで、2026年7月23日に発表されました。画像・動画・音声からひとつの統合アーキテクチャで一緒に学習するため、単一のモデルでネイティブ音声付き動画を生成し、画像を合成・編集し、現実世界の見え方・動き方・鳴り方についての一貫した理解を保てます。
Flux 3は画像モデルですか、それとも動画モデルですか?
どちらも兼ねています。Flux 3は別々のツールではなく、ひとつのマルチモーダルモデルです。画像を生成・編集し、同期したネイティブ音声付きの動画を生成します。すべて同じワールドモデルからです。Black Forest LabsはFLUX-mimicパートナーシップを通じてこのバックボーンをロボティクスの行動予測にも拡張し、Audiでの実運用タスクでテストしています。
Flux 3の動画はどのくらいの長さですか?
Flux 3は1回の生成で最大20秒の動画を生成します。より長い作品には、クリップを連結してマルチショットのシーケンスにし、ビジュアル参照を再利用して、数分に及ぶシーンをまたいでキャラクターの一貫性を保ちます。各クリップは動きに合わせた同期ネイティブ音声とともに返ってきます。
Flux 3は音声を生成しますか?
はい。すべてのFlux 3動画は同じ生成の中でネイティブ音声とともに作られるので、効果音、環境音、セリフがすでに画面の出来事に同期しています。音は物理的な出来事に結び付いているため衝撃音は当たりに合い、Flux 3は多言語のセリフに対応し、1つのシーンを複数の言語で話させられます。
Flux 3は画像と動画を編集できますか?
はい。Flux 3は両方でコンテキスト内編集を行います。画像の一要素を変えて残りのフレームをそのまま保ったり、ソース動画の被写体を新しいシーンに持ち込んだりできます。すでにMorphicで画像編集を支えているFlux Kontextの命令編集の系譜を受け継いでいます。
Flux 3はFlux 2とどう違いますか?
Flux 2 Proは画像モデルです。Flux 3はマルチモーダル基盤モデルで、ネイティブ音声付き動画、現実の物理に従う動き、画像・動画・音声にまたがる共有表現を加えています。テキスト描写とプロンプト処理も大きく向上しており、Flux 2が静止画に特化していたのに対し、Flux 3はワールドモデルです。
Flux 3はオープンソースですか?
Black Forest Labsは、画像・動画・音声・行動予測をカバーするオープンウェイトのマルチモーダルバックボーンFlux 3 Devを、より高速なバージョンとともにリリースすると表明しています。オープンウェイト版はAPIおよびプライベートウェイトモデルの早期アクセス展開に続いて公開される予定なので、オープンウェイトはローンチ時に利用可能というより、これから提供されます。
MorphicでFlux 3を使うには?
FluxファミリーはすでにFlux 2 ProとKontext編集を通じて、Nano Banana ProやSeedream 5などのモデルと並んでMorphicの画像制作を支えています。Morphicを開き、作りたいものを記述して、Canvas上で生成し、モデルを並べて比較して、あなたのショットに最も合うレンダーを残しましょう。