Gemini Omni Flash 1.1 使用指南:提示词、改片与新功能

Gemini Omni Flash 1.1 使用指南:提示词、改片与新功能

Gemini Omni Flash 1.1 完整指南:五种任务、提示词写法、参考与首尾帧标记、打字就能改片、40 秒续写,还有声音怎么指挥,附示例。

Gemini Omni Flash 1.1 的功能与能力

Google DeepMind 的多模态视频模型,2026 年 8 月更新。它生成 3 到 10 秒、自带声音的片子,然后继续在这条片子上干活:后一条提示词修改同一条成片,续写把它接到 40 秒。

功能作用适用场景
对话式编辑后一条提示词改动这条成片,没提到的地方原样保留只修一处,不用重抽
视频续写一次接十秒,总长最多 40 秒一次生成装不下的场景
参考输入10 张图片和 3 段短片引导同一次生成,各领一个角色反复出现的角色、产品、风格
首帧与尾帧在两张静图之间补出运动;同一张用两次就成循环转场、循环、分镜配对
原生声音台词口型、音效、环境声与配乐随画面一起出有对白的戏、靠声音带的镜头
分辨率阶梯360p 到 4K;1080p 和 4K 是放大低成本试错,成片再要大尺寸
画面文字按你指定的英文文案渲染,连背景招牌都算标题、下方字幕条、字幕

Gemini Omni Flash 1.1 的用法

在同一条片子上连续改

重新布光、换掉外套、改写招牌。每条指令都落在同一个镜头上,画面其余部分稳稳待着。

同一间客厅的分屏画面,左边是正午平光,右边是黄昏暖光

靠续写攒出来的场景

先开一段十秒,再往下长。模型读你末尾那几秒,把动作、人物和配乐一路接到 40 秒。

一只条纹热气球在黎明的高山谷地上空飘过的四格连拍

草图变实拍

交代清楚草图只作参考。模型借走轮廓和运动路径,材质、光线和纵深由它重建。

一张跃起狐狸的铅笔草图,旁边是同一姿态的写实狐狸置身森林

会说话的出镜人

把台词写出来,角色就照着说,口型对得上,声线在后面每一次修改里都还是那一把。

一位市集摊主在午后阳光下,隔着几箱橙子热情地说话

按时间点排的镜头

一段时间码就能把一条提示词排成分镜:产品画面快切,或者每两秒来一个节拍。

同一位戴红围巾的女性走路、回头、起跑的三格画面

严丝合缝的循环

同一张图既当首帧又当尾帧,片子会回到起点,挂在商品页上正好一直转。

一架纸飞机在昏暗工坊里划出一道闭合光轨

第一步:选定任务

模型能做的事都归到五种任务里。意图可能被读错时点名说明;其余情况由提示词和素材推断。

任务作用什么时候用
Text to video从一段文字简报生成片子手上什么都没有
Image to video让静图动起来,或在两帧之间补出运动画面有了,缺的是运动
Reference to video用带标记的图片和短片搭出镜头角色或风格必须延续
Edit改动一条已有的视频镜头是对的,某个元素不对
Extend往后接一段镜头是对的,就是太短

第二步:写提示词

一条提示词就是一份简短的镜头说明,顺序如下。画面比例、分辨率和时长属于设置项,不写进提示词。

要素写什么是否必需
主体与动作画面里是谁,在做什么必需
场景地点、时段、天气、背景可选
镜头与光线景别、运动、镜头焦段、光源可选
声音台词、环境声、音效、配乐,或者安静强烈建议写
镜头结构一镜到底,还是要切,以及切在哪可选

示例都用英文给出,因为 Google 只对英文提示词做了完整评估,直接复制就能跑。

Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.

提示词的五个开关

开关这样写为什么要紧
镜头结构Single continuous shot, no scene cuts. Or: every 2s cut to a new location不交代的话,模型会分成几个镜头讲故事
声音No music, just room tone. Or a spoken line: she says, third one today安静得开口要,否则会自动配乐
时间点After 3 seconds, a woman enters. Or a timecode block时间段是预算,不是帧级的剪辑点
画面文字A street sign that says MARKET LANE不指定的文字会被编出来。英文能渲染,其他文字不行
触发条件When the person touches the mirror, it ripples like liquid由事件驱动的指令,比抽象的时间描述落得更准
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running

不想要的东西写进提示词本身即可,比如 no dialogue 或 do not add captions。这里没有独立的反向提示词输入框。

第三步:加参考素材与首尾帧

每次生成可用 10 张参考图片和 3 段参考视频。标记负责给每份文件派角色,序号从 0 开始,按上传顺序排。

标记角色示例
FIRST_FRAME起始帧<FIRST_FRAME> a woman is walking
LAST_FRAME结束帧,与起始帧成对使用<FIRST_FRAME> <LAST_FRAME> a woman is walking
IMAGE_REF_0参考:主体、产品或风格in the style of <IMAGE_REF_0>, a woman is walking
VIDEO_REF_0角色或物体参考the person in <VIDEO_REF_0> is playing the violin
  • 素材一开始就挂齐。 对话进行到一半才加参考,本来稳住的场景会被打乱。
  • 一份参考只派一件活。 风格取第一张、主体取第二张,比让它自己猜强。
  • 参考视频要短。 每段 3 秒,用来固定长相最见效,里面的声音会被忽略。
  • 同一张图既当首帧又当尾帧,回来就是一条接得上的循环。

第四步:修改与续写

生成出来的片子会留在这段对话里,10 秒以内的上传素材也能加进来。你描述到的每一样东西,模型都可能重新渲染一遍,所以只描述那处改动。下面两栏直接给英文原句,照着这个结构写就行。

别这样写改成这样
In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its headAdd a cat that jumps onto his lap, he begins to pet it. Keep everything else the same.
Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadowsChange the lighting to be more dramatic. Keep everything else the same.
规则细节
一轮只改一处把几件事合成一条指令,破坏一致性的概率大约翻倍
一条链子改四轮再往后就开始跑偏。用这句重新锚定:保持角色的全部细节不变,只改 X
续写只往后接一次十秒,总长 40 秒。不能往前加,也不能把中间抻长
续写的时钟重新计时所谓“2 秒后”,指的是新素材开始后的第 2 秒
参考素材可以跟着进来续写的场景里,新角色可以从你挂上去的图片走进来
Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.

Gemini Omni Flash 1.1 的限制

限制会发生什么怎么绕开
非拉丁文字中文和日文字形会被画成像模像样的错字画面文字留英文,或者逐帧核对
人多的画面同时追四个以上主体会粘连或跑偏控制在三个以内
声音不能单独改不支持上传音频参考,也不能单独修声音用文字指挥声线;一致性会替你留住它
政策边界真实品牌和可辨认的真人会被拦,各地区规则不同带品牌的元素改成泛化处理

简单定价

今天就免费开始,随时可以升级或取消。

Basic

$9/
账单金额为 $0 每年

1100 每月 信用

1 个用户

所有模型

工作流

Standard

$24/
账单金额为 $0 每年

3625 每月 信用

1 个用户

所有模型

工作流

Pro

$45/
账单金额为 $0 每年

6350 共享 每月 信用

1 用户

+ 最多 4 人额外付费可增加

所有模型

工作流

Pro Max

$170/
账单金额为 $0 每年

24650 共享 每月 信用

1 用户

+ 最多 9 人额外付费可增加

所有模型

工作流

Enterprise

更高的限制

自定义

定价和账单条款

大容量信用
自定义席位限制
所有模型
工作流
Pricing Gradient

Free

供随意体验

$0

永久免费

最多 20 积分
仅1个用户
部分模型
工作流

常见问题

Gemini Omni Flash 1.1 的提示词该怎么写?
当成一份简短的镜头说明来写:主体和动作、场景、镜头、光线,还有你想要的声音,用平实的句子交代清楚。Omni Flash 默认会拍成一段有几个镜头的小故事,所以想要一镜到底时,加一句“single continuous shot, no scene cuts”。声音一定要写,因为提示词里对声音只字不提时,模型会自己配一条。
写提示词该用中文还是英文?
用英文写。Google 只对英文提示词做了完整评估,本页所有示例因此都是英文,直接复制过去就能用。中文提示词不在官方公布的评估范围内,效果没有保证。中文创作者的常见做法是:思路先用中文理清,再把镜头、声音和时间点翻成一段英文简报交给模型。画面里要出现的字同理,留英文最稳。
Gemini Omni Flash 1.1 的修改指令怎么写?
短,而且只指一处:“make the phone invisible, keep everything else the same”。修改指令写得太详细反而会引发计划外的变化,因为你描述到的每一样东西,模型都可能重新渲染一遍。点名那一处改动,末尾补上“保持其余不变”,一轮只改一件事,别把三件事塞进一句话。
Gemini Omni Flash 1.1 怎么把视频续长?
直接要求它接着往下拍:“extend this video”就能生效,“the scene continues: the camera pans across the mountains”则给了方向。每次续写最多加十秒,总长到 40 秒为止;模型把最后十秒素材当上下文,并把末尾几帧调匀,接口看起来像一镜到底。续写只能往片尾接,不能往前面加,也不能把中间抻长。
Gemini Omni Flash 1.1 提示词里的标记是什么意思?
标记负责把你上传的素材和角色对应起来。尖括号里的 FIRST_FRAME 和 LAST_FRAME 指定起始帧与结束帧,IMAGE_REF_0 和 VIDEO_REF_0 标出参考素材,序号从 0 开始,按上传顺序排。同一张图既当首帧又当尾帧,出来的片子会自然循环。不加标记时模型会从提示词里猜每份文件的角色,两三份以内还行,再多就容易错位。
Gemini Omni Flash 1.1 的声音和台词怎么指挥?
把想要的声音和画面写进同一条提示词:“no music, just room tone”、“a high energy techno beat”,或者把角色要说的那句话原样写出来。台词回来时口型是对的,声线在后续修改和续写里也不变。安静同样得开口要,因为没交代声音的提示词通常会返回一段通用背景音乐。
Gemini Omni Flash 1.1 能把文字渲染进画面吗?
能,而且英文是它比较拿手的一项:招牌、下方字幕条、逐字出现的文字动画,只要把每一处该显示什么写清楚,回来都能读。连背景里的字也要交代,否则模型会自己编。非拉丁文字是它的弱项,需要中文或日文时,请逐帧核对。
怎样让角色在连续修改中保持一致?
一轮只改一处,剩下的交给模型的场景记忆:面孔、服装和声线会在后续对话里自动延续。链条拉长之后,在要改的那句前面先加一句“keep all character details and motion exactly as they are, only change the lighting”重新锚定。大约四轮修改之内都还稳,再往后就该重新生成一次,把参考素材重新挂上去。