Grok Imagine Video 1.5 完整指南:提示词与功能

Grok Imagine Video 1.5 完整指南:提示词与功能

Morphic 上的 Grok Imagine Video 1.5 完整指南:这款 xAI 原生同步音频视频模型能做什么、带示例的提示词写法、功能与使用场景,以及技术规格。

Grok Imagine Video 1.5 的功能与特性

功能作用适用场景
原生同步音频对白、音效、环境音和音乐随动作同步生成口播人物、产品广告、音乐片段
让静态图动起来把静态图转为动态画面,同时保留其光线、色彩和质感照片、产品图、画作
视频续接从最后一帧继续生成更长的片段叙事场景、更长节奏
参考图引导生成通过参考图在多个片段间保持角色或风格一致角色一致性、风格统一的系列内容
提示词还原与运镜控制景别、运镜和时间点都能按提示词呈现分镜预览、精确镜头

原生同步音频

音频与视频在同一次生成中一起产出:带口型同步的对白、音效、环境背景音和音乐。你在同一条提示词里描述声音与动作,不需要单独做一步音频。

让静态图动起来

你提供的图片会被用作首帧,模型从这里向外生成动态。原始的光线、色彩和细节会被保留而不是重新生成,适合给照片、产品图或成品画作做动画。

用作 Grok Imagine Video 1.5 起始帧的静态图
起始图片。

视频续接

已有片段可以从它的最后一帧继续生成更长的镜头,保持相同的主体、光线和动态。重复这一步可以从一个起始片段搭出多段序列。

第一个片段的最后一帧,续接从这里开始
续接开始的最后一帧。

参考图引导生成

参考图引导风格与角色,但不固定首帧。模型会把这种风格带入新的镜头,让角色或视觉风格在不同生成之间保持一致。

引导 Grok Imagine Video 1.5 角色与风格的参考图
参考图片。

出色的提示词还原与运镜控制

模型能跟随细致的指令,包括景别、具体的运镜方式(比如推轨或摇镜),以及动作发生的时间点。这让计划好的镜头更容易被稳定复现。

Grok Imagine Video 1.5 技术规格

规格Grok Imagine Video 1.5
提供方xAI
模式图生视频、文生视频、参考图生视频、视频编辑、视频续接
音频原生同步(对白、音效、环境音、音乐)
分辨率480p 或 720p
时长1 到 15 秒
帧率24 fps
宽高比16:9、9:16、4:3、3:4、3:2、2:3、1:1

如何用好 Grok Imagine Video 1.5

模型偏爱强有力的起始帧和清晰、以动态为核心的简报。以下几条习惯能带来大部分品质:

  • 从静态图开始。先生成或上传一张 16:9 的图片,再让它动起来。一张好的首帧是影响结果最大的单一因素。
  • 让动态提示词保持简短具体。只写清动作和一个运镜,构图和风格交给图片来承担。
  • 始终写清音频。用平实的语言说明对白、音效、环境音或音乐,这样模型才会为动作生成配套的声音,而不是一段无声片段。
  • 一个镜头一个动作。把单个节拍压缩进几秒钟,更长的序列用视频续接来实现。
  • 拍摄说话的角色时,用正面人像构图并让嘴部入镜,台词保持简短以获得干净的口型同步。
  • 当外观或角色需要在多个片段间保持稳定时,使用参考图。

Grok Imagine Video 1.5 提示词指南

好的提示词读起来像一份简短的镜头简报,而不是一句配文。决定结果的有两点:清楚列出镜头里包含什么,以及用具体的措辞而非含糊的措辞。

提示词里要写什么

要素应包含示例
主体画面里的人或物,具体描述一名穿着炭灰色毛衣的主持人
动作什么在动,怎么动她微笑并看向镜头
镜头景别加一个运动中景,缓慢推进
音频对白、音效、环境音或音乐她说“欢迎”;柔和的室内环境音
格式片段时长和宽高比5 秒,16:9

弱提示词 vs 强提示词

指定镜头、动作及其节奏,以及音频,而不是交给运气。

侧重
镜头夜里城市中的一名女子手持跟拍镜头跟随一名女子穿过被雨打湿的街道,霓虹反光,浅景深
动作与节奏门打开,有人走进来门缓缓打开,一拍之后一个身影走入,随后镜头落定
音频一名厨师在装盘特写镜头,厨师装盘,蒸汽升起。音频:平底锅的滋滋声,柔和的厨房环境音,以及一句“上菜。”

需要了解的设置

设置说明
时长1 到 15 秒;每个镜头保持一个动作
分辨率480p 或 720p
宽高比跟随你的输入图片,或设置为 16:9、9:16 或 1:1
参考图添加参考图以在多个片段间保持风格或角色一致
更长的序列用视频续接从最后一帧继续生成

常见错误

  • 让提示词保持沉默:请至少写出一个声音提示。
  • 镜头含糊:「电影感」对模型毫无意义,请指定景别和运动。
  • 一个镜头塞太多:每个镜头保持一个动作,再用续接来实现更长的序列。

常见问题

怎样用 Grok Imagine Video 1.5 获得最佳效果?

从一张有力的 16:9 静态图开始,让动态提示词保持简短具体,指定一个运镜方式,并始终包含一个音频提示。每个镜头保持一个动作,更长的序列用视频续接来实现。

Grok Imagine Video 1.5 能生成音频吗?

可以。音频与视频原生同步生成,并与动作保持同步。一次生成就能包含带口型同步的对白、音效、环境音和音乐,不需要单独的音频步骤。

Grok Imagine Video 1.5 支持哪些输入?

图生视频需要一张图片加一条文字提示词,文生视频只需要一条文字提示词。你还可以传入参考图来引导风格和角色,并通过视频续接和编辑功能延续或修改已有片段。

Grok Imagine Video 1.5 的片段时长和分辨率是多少?

片段时长为 1 到 15 秒,分辨率为 480p 或 720p,24 fps。图生视频的宽高比跟随你的输入图片,你也可以自行设置横屏、方形或竖屏的比例。

Grok Imagine Video 1.5 和最初的 Grok Imagine 有什么不同?

最初的 Grok Imagine 是 xAI 的跨模态模型,涵盖文生图、图片编辑和多种视频路径。Grok Imagine Video 1.5 是专门的视频版本,针对图生视频做了调优,具备原生同步音频、口型同步对白和视频续接功能。