Grok Imagine Video 1.5 的功能与特性
| 功能 | 作用 | 适用场景 |
|---|---|---|
| 原生同步音频 | 对白、音效、环境音和音乐随动作同步生成 | 口播人物、产品广告、音乐片段 |
| 让静态图动起来 | 把静态图转为动态画面,同时保留其光线、色彩和质感 | 照片、产品图、画作 |
| 视频续接 | 从最后一帧继续生成更长的片段 | 叙事场景、更长节奏 |
| 参考图引导生成 | 通过参考图在多个片段间保持角色或风格一致 | 角色一致性、风格统一的系列内容 |
| 提示词还原与运镜控制 | 景别、运镜和时间点都能按提示词呈现 | 分镜预览、精确镜头 |
原生同步音频
音频与视频在同一次生成中一起产出:带口型同步的对白、音效、环境背景音和音乐。你在同一条提示词里描述声音与动作,不需要单独做一步音频。
让静态图动起来
你提供的图片会被用作首帧,模型从这里向外生成动态。原始的光线、色彩和细节会被保留而不是重新生成,适合给照片、产品图或成品画作做动画。

视频续接
已有片段可以从它的最后一帧继续生成更长的镜头,保持相同的主体、光线和动态。重复这一步可以从一个起始片段搭出多段序列。

参考图引导生成
参考图引导风格与角色,但不固定首帧。模型会把这种风格带入新的镜头,让角色或视觉风格在不同生成之间保持一致。

出色的提示词还原与运镜控制
模型能跟随细致的指令,包括景别、具体的运镜方式(比如推轨或摇镜),以及动作发生的时间点。这让计划好的镜头更容易被稳定复现。
Grok Imagine Video 1.5 技术规格
| 规格 | Grok Imagine Video 1.5 |
|---|---|
| 提供方 | xAI |
| 模式 | 图生视频、文生视频、参考图生视频、视频编辑、视频续接 |
| 音频 | 原生同步(对白、音效、环境音、音乐) |
| 分辨率 | 480p 或 720p |
| 时长 | 1 到 15 秒 |
| 帧率 | 24 fps |
| 宽高比 | 16:9、9:16、4:3、3:4、3:2、2:3、1:1 |
如何用好 Grok Imagine Video 1.5
模型偏爱强有力的起始帧和清晰、以动态为核心的简报。以下几条习惯能带来大部分品质:
- 从静态图开始。先生成或上传一张 16:9 的图片,再让它动起来。一张好的首帧是影响结果最大的单一因素。
- 让动态提示词保持简短具体。只写清动作和一个运镜,构图和风格交给图片来承担。
- 始终写清音频。用平实的语言说明对白、音效、环境音或音乐,这样模型才会为动作生成配套的声音,而不是一段无声片段。
- 一个镜头一个动作。把单个节拍压缩进几秒钟,更长的序列用视频续接来实现。
- 拍摄说话的角色时,用正面人像构图并让嘴部入镜,台词保持简短以获得干净的口型同步。
- 当外观或角色需要在多个片段间保持稳定时,使用参考图。
Grok Imagine Video 1.5 提示词指南
好的提示词读起来像一份简短的镜头简报,而不是一句配文。决定结果的有两点:清楚列出镜头里包含什么,以及用具体的措辞而非含糊的措辞。
提示词里要写什么
| 要素 | 应包含 | 示例 |
|---|---|---|
| 主体 | 画面里的人或物,具体描述 | 一名穿着炭灰色毛衣的主持人 |
| 动作 | 什么在动,怎么动 | 她微笑并看向镜头 |
| 镜头 | 景别加一个运动 | 中景,缓慢推进 |
| 音频 | 对白、音效、环境音或音乐 | 她说“欢迎”;柔和的室内环境音 |
| 格式 | 片段时长和宽高比 | 5 秒,16:9 |
弱提示词 vs 强提示词
指定镜头、动作及其节奏,以及音频,而不是交给运气。
| 侧重 | 弱 | 强 |
|---|---|---|
| 镜头 | 夜里城市中的一名女子 | 手持跟拍镜头跟随一名女子穿过被雨打湿的街道,霓虹反光,浅景深 |
| 动作与节奏 | 门打开,有人走进来 | 门缓缓打开,一拍之后一个身影走入,随后镜头落定 |
| 音频 | 一名厨师在装盘 | 特写镜头,厨师装盘,蒸汽升起。音频:平底锅的滋滋声,柔和的厨房环境音,以及一句“上菜。” |
需要了解的设置
| 设置 | 说明 |
|---|---|
| 时长 | 1 到 15 秒;每个镜头保持一个动作 |
| 分辨率 | 480p 或 720p |
| 宽高比 | 跟随你的输入图片,或设置为 16:9、9:16 或 1:1 |
| 参考图 | 添加参考图以在多个片段间保持风格或角色一致 |
| 更长的序列 | 用视频续接从最后一帧继续生成 |
常见错误
- 让提示词保持沉默:请至少写出一个声音提示。
- 镜头含糊:「电影感」对模型毫无意义,请指定景别和运动。
- 一个镜头塞太多:每个镜头保持一个动作,再用续接来实现更长的序列。
常见问题
从一张有力的 16:9 静态图开始,让动态提示词保持简短具体,指定一个运镜方式,并始终包含一个音频提示。每个镜头保持一个动作,更长的序列用视频续接来实现。
可以。音频与视频原生同步生成,并与动作保持同步。一次生成就能包含带口型同步的对白、音效、环境音和音乐,不需要单独的音频步骤。
图生视频需要一张图片加一条文字提示词,文生视频只需要一条文字提示词。你还可以传入参考图来引导风格和角色,并通过视频续接和编辑功能延续或修改已有片段。
片段时长为 1 到 15 秒,分辨率为 480p 或 720p,24 fps。图生视频的宽高比跟随你的输入图片,你也可以自行设置横屏、方形或竖屏的比例。
最初的 Grok Imagine 是 xAI 的跨模态模型,涵盖文生图、图片编辑和多种视频路径。Grok Imagine Video 1.5 是专门的视频版本,针对图生视频做了调优,具备原生同步音频、口型同步对白和视频续接功能。
