Grok Imagine Video 1.5 完全ガイド:プロンプトと機能

Grok Imagine Video 1.5 完全ガイド:プロンプトと機能

Morphic での Grok Imagine Video 1.5 完全ガイド。xAI のネイティブ音声同期動画モデルでできること、例つきのプロンプトガイド、機能と活用例、そして技術仕様まで。

Grok Imagine Video 1.5 の機能と特長

機能内容向いている用途
ネイティブ音声同期セリフ・効果音・環境音・音楽が、動きと同期した状態でまとめて生成されるトーキングヘッド、商品スポット、音楽クリップ
静止画のアニメーション化静止画を、光・色・質感を保ったまま動きに変換する写真、商品ショット、アートワーク
動画の延長最後のフレームから続きを生成し、より長いシーケンスにするストーリー展開、長めの尺
参照画像による生成参照画像でキャラクターやスタイルをクリップ間で保持する一貫したキャラクター、スタイル固定のシリーズ
プロンプト追従とカメラ制御ショットタイプ、カメラの動き、タイミング指示が記述どおりに反映される絵コンテのプレビュー、精密なショット

ネイティブ音声同期

音声は動画と1回の生成でまとめて作られます。リップシンクしたセリフ、効果音、環境音、そして音楽まで。動きと同じプロンプトの中で音を説明するだけなので、別に音声制作の工程を挟む必要はありません。

静止画のアニメーション化

入力した画像が最初のフレームとして使われ、そこから外側に向かって動きが生成されます。元の光・色・ディテールは再生成されず保持されるため、写真や商品ショット、完成したアートワークのアニメーション化に向いています。

Grok Imagine Video 1.5 の起点フレームとして使われた静止画
出発点となる画像。

動画の延長

既存のクリップはその最後のフレームから続きを生成でき、同じ被写体・ライティング・動きを保ったまま長いショットにできます。この手順を繰り返せば、1本の起点クリップからマルチパートのシーケンスを組み立てられます。

延長の起点となる、1本目のクリップの最終フレーム
延長の起点となる最終フレーム。

参照画像による生成

参照画像は、最初のフレームを固定せずにスタイルとキャラクターを導きます。モデルはその見た目を新しいショットに引き継ぐため、複数の生成をまたいでキャラクターやビジュアルスタイルの一貫性を保てます。

Grok Imagine Video 1.5 のキャラクターとスタイルを導く参照画像
キャラクターとスタイルを導く参照画像。

強いプロンプト追従とカメラ制御

モデルはショットタイプ、ドリーやパンといった具体的なカメラの動き、アクションが起きるタイミングまで、詳細な指示に従います。そのため、計画したショットを再現しやすくなります。

Grok Imagine Video 1.5 の技術仕様

仕様Grok Imagine Video 1.5
提供元xAI
モード画像から動画、テキストから動画、参照から動画、動画編集、動画延長
音声ネイティブ音声同期(セリフ・効果音・環境音・音楽)
解像度480p または 720p
長さ1〜15 秒
フレームレート24 fps
アスペクト比16:9、9:16、4:3、3:4、3:2、2:3、1:1

Grok Imagine Video 1.5 を使いこなすコツ

このモデルは、強い最初のフレームと動きに絞った明確なブリーフに応えます。いくつかの実践が品質の大半を左右します。

  • 静止画から始める。まず16:9の画像を生成または用意し、それをアニメーション化します。良い最初のフレームが結果を左右する最大のレバーです。
  • 動きのプロンプトは短く具体的に。アクションとカメラの動きを1つ指定し、構図とスタイルは画像に任せます。
  • 音声は必ず指定する。セリフ、効果音、環境音、音楽を平易な言葉で書き、無音のクリップではなく動きに合わせた音を生成させます。
  • 1クリップに1アクション。数秒に1つのビートだけを詰め込み、長いシーケンスには動画延長を使います。
  • セリフのあるキャラクターには、口元がフレームに入る正面ポートレートを使い、セリフを短く保ってリップシンクをきれいに保ちます。
  • 見た目やキャラクターをクリップ間で保ちたいときは参照画像を使います。

Grok Imagine Video 1.5 のプロンプトガイド

強いプロンプトは、キャプションではなく短いショットのブリーフのように読めます。結果を左右するのは2点、ショットに何が含まれるかの明確なリストと、曖昧な言い回しに代えた具体的な表現です。

プロンプトに入れるもの

要素入れるべき内容
被写体画面にいる人や物を具体的にチャコールグレーのセーターを着たプレゼンター
動き何がどう動くか彼女が微笑み、カメラに視線を送る
カメラショットタイプと動き1つミディアムショット、ゆっくり寄る
音声セリフ、効果音、環境音、音楽「ようこそ」と話す彼女の声、柔らかな部屋の空気音
長さクリップの長さとアスペクト比5秒、16:9

弱いプロンプト vs 強いプロンプト

運に任せず、カメラ、動きとそのタイミング、音声を指定します。

観点弱い強い
カメラ夜の街にいる女性雨に濡れた通りを歩く女性を追う手持ちの追従ショット、ネオンの反射、浅い被写界深度
動きとタイミングドアが開いて誰かが入ってくるドアがゆっくり開き、一拍おいて人影が入り、その後カメラが落ち着く
音声皿に料理を盛るシェフ湯気の立つ皿に料理を盛るシェフのクローズアップ。音声:フライパンの音、柔らかなキッチンの環境音、そして「どうぞ」という声。

知っておきたい設定

設定メモ
長さ1〜15秒。1クリップに1アクションを保つ
解像度480p または 720p
アスペクト比入力画像に従うか、16:9・9:16・1:1を指定
参照画像スタイルやキャラクターをクリップ間で保つために追加
長いシーケンス動画延長で最後のフレームから続きを生成

よくある間違い

  • プロンプトを無音のままにする:必ず1つは音のキューを書きます。
  • 曖昧なカメラ指定:「シネマティック」だけではモデルに何も伝わりません。ショットと動きを指定します。
  • 1クリップに詰め込みすぎる:1クリップ1アクションにし、動画延長でつなぎます。

よくある質問

Grok Imagine Video 1.5 で最良の結果を得るには?

強い16:9の静止画から始め、動きのプロンプトは短く具体的にして、カメラの動きを1つ指定し、必ず音声のキューを含めます。1クリップに1アクションを保ち、長いシーケンスには動画延長を使いましょう。

Grok Imagine Video 1.5 は音声を生成しますか?

はい。音声は動画とネイティブに同時生成され、動きと同期します。1回の生成で、リップシンクしたセリフ、効果音、環境音、音楽までまとめて含められ、別途の音声制作は不要です。

Grok Imagine Video 1.5 はどんな入力に対応していますか?

画像から動画にはテキストプロンプトと画像を、テキストから動画にはテキストプロンプトのみを使用します。参照画像でスタイルやキャラクターを導いたり、動画延長・編集で既存クリップを続けたり手直ししたりすることもできます。

Grok Imagine Video 1.5 のクリップの長さと解像度は?

クリップは1〜15秒、480pまたは720p、24fpsで生成されます。画像から動画では入力画像のアスペクト比が引き継がれ、横長・正方形・縦型のいずれかに設定することもできます。

Grok Imagine Video 1.5 は元の Grok Imagine と何が違いますか?

元の Grok Imagine は、テキストから画像、画像編集、複数の動画パスにまたがる xAI のクロスモーダルモデルです。Grok Imagine Video 1.5 は動画専用のリリースで、ネイティブ音声同期、リップシンクしたセリフ、動画延長に特化した画像から動画向けにチューニングされています。