Gemini Omni Flash 1.1 的功能与能力
Google DeepMind 的多模态视频模型,2026 年 8 月更新。它生成 3 到 10 秒、自带声音的片子,然后继续在这条片子上干活:后一条提示词修改同一条成片,续写把它接到 40 秒。
| 功能 | 作用 | 适用场景 |
|---|---|---|
| 对话式编辑 | 后一条提示词改动这条成片,没提到的地方原样保留 | 只修一处,不用重抽 |
| 视频续写 | 一次接十秒,总长最多 40 秒 | 一次生成装不下的场景 |
| 参考输入 | 10 张图片和 3 段短片引导同一次生成,各领一个角色 | 反复出现的角色、产品、风格 |
| 首帧与尾帧 | 在两张静图之间补出运动;同一张用两次就成循环 | 转场、循环、分镜配对 |
| 原生声音 | 台词口型、音效、环境声与配乐随画面一起出 | 有对白的戏、靠声音带的镜头 |
| 分辨率阶梯 | 360p 到 4K;1080p 和 4K 是放大 | 低成本试错,成片再要大尺寸 |
| 画面文字 | 按你指定的英文文案渲染,连背景招牌都算 | 标题、下方字幕条、字幕 |
Gemini Omni Flash 1.1 的用法
在同一条片子上连续改
重新布光、换掉外套、改写招牌。每条指令都落在同一个镜头上,画面其余部分稳稳待着。

靠续写攒出来的场景
先开一段十秒,再往下长。模型读你末尾那几秒,把动作、人物和配乐一路接到 40 秒。

草图变实拍
交代清楚草图只作参考。模型借走轮廓和运动路径,材质、光线和纵深由它重建。

会说话的出镜人
把台词写出来,角色就照着说,口型对得上,声线在后面每一次修改里都还是那一把。

按时间点排的镜头
一段时间码就能把一条提示词排成分镜:产品画面快切,或者每两秒来一个节拍。

严丝合缝的循环
同一张图既当首帧又当尾帧,片子会回到起点,挂在商品页上正好一直转。

第一步:选定任务
模型能做的事都归到五种任务里。意图可能被读错时点名说明;其余情况由提示词和素材推断。
| 任务 | 作用 | 什么时候用 |
|---|---|---|
| Text to video | 从一段文字简报生成片子 | 手上什么都没有 |
| Image to video | 让静图动起来,或在两帧之间补出运动 | 画面有了,缺的是运动 |
| Reference to video | 用带标记的图片和短片搭出镜头 | 角色或风格必须延续 |
| Edit | 改动一条已有的视频 | 镜头是对的,某个元素不对 |
| Extend | 往后接一段 | 镜头是对的,就是太短 |
第二步:写提示词
一条提示词就是一份简短的镜头说明,顺序如下。画面比例、分辨率和时长属于设置项,不写进提示词。
| 要素 | 写什么 | 是否必需 |
|---|---|---|
| 主体与动作 | 画面里是谁,在做什么 | 必需 |
| 场景 | 地点、时段、天气、背景 | 可选 |
| 镜头与光线 | 景别、运动、镜头焦段、光源 | 可选 |
| 声音 | 台词、环境声、音效、配乐,或者安静 | 强烈建议写 |
| 镜头结构 | 一镜到底,还是要切,以及切在哪 | 可选 |
示例都用英文给出,因为 Google 只对英文提示词做了完整评估,直接复制就能跑。
Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.
提示词的五个开关
| 开关 | 这样写 | 为什么要紧 |
|---|---|---|
| 镜头结构 | Single continuous shot, no scene cuts. Or: every 2s cut to a new location | 不交代的话,模型会分成几个镜头讲故事 |
| 声音 | No music, just room tone. Or a spoken line: she says, third one today | 安静得开口要,否则会自动配乐 |
| 时间点 | After 3 seconds, a woman enters. Or a timecode block | 时间段是预算,不是帧级的剪辑点 |
| 画面文字 | A street sign that says MARKET LANE | 不指定的文字会被编出来。英文能渲染,其他文字不行 |
| 触发条件 | When the person touches the mirror, it ripples like liquid | 由事件驱动的指令,比抽象的时间描述落得更准 |
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
不想要的东西写进提示词本身即可,比如 no dialogue 或 do not add captions。这里没有独立的反向提示词输入框。
第三步:加参考素材与首尾帧
每次生成可用 10 张参考图片和 3 段参考视频。标记负责给每份文件派角色,序号从 0 开始,按上传顺序排。
| 标记 | 角色 | 示例 |
|---|---|---|
| FIRST_FRAME | 起始帧 | <FIRST_FRAME> a woman is walking |
| LAST_FRAME | 结束帧,与起始帧成对使用 | <FIRST_FRAME> <LAST_FRAME> a woman is walking |
| IMAGE_REF_0 | 参考:主体、产品或风格 | in the style of <IMAGE_REF_0>, a woman is walking |
| VIDEO_REF_0 | 角色或物体参考 | the person in <VIDEO_REF_0> is playing the violin |
- 素材一开始就挂齐。 对话进行到一半才加参考,本来稳住的场景会被打乱。
- 一份参考只派一件活。 风格取第一张、主体取第二张,比让它自己猜强。
- 参考视频要短。 每段 3 秒,用来固定长相最见效,里面的声音会被忽略。
- 同一张图既当首帧又当尾帧,回来就是一条接得上的循环。
第四步:修改与续写
生成出来的片子会留在这段对话里,10 秒以内的上传素材也能加进来。你描述到的每一样东西,模型都可能重新渲染一遍,所以只描述那处改动。下面两栏直接给英文原句,照着这个结构写就行。
| 别这样写 | 改成这样 |
|---|---|
| In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its head | Add a cat that jumps onto his lap, he begins to pet it. Keep everything else the same. |
| Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadows | Change the lighting to be more dramatic. Keep everything else the same. |
| 规则 | 细节 |
|---|---|
| 一轮只改一处 | 把几件事合成一条指令,破坏一致性的概率大约翻倍 |
| 一条链子改四轮 | 再往后就开始跑偏。用这句重新锚定:保持角色的全部细节不变,只改 X |
| 续写只往后接 | 一次十秒,总长 40 秒。不能往前加,也不能把中间抻长 |
| 续写的时钟重新计时 | 所谓“2 秒后”,指的是新素材开始后的第 2 秒 |
| 参考素材可以跟着进来 | 续写的场景里,新角色可以从你挂上去的图片走进来 |
Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.
Gemini Omni Flash 1.1 的限制
| 限制 | 会发生什么 | 怎么绕开 |
|---|---|---|
| 非拉丁文字 | 中文和日文字形会被画成像模像样的错字 | 画面文字留英文,或者逐帧核对 |
| 人多的画面 | 同时追四个以上主体会粘连或跑偏 | 控制在三个以内 |
| 声音不能单独改 | 不支持上传音频参考,也不能单独修声音 | 用文字指挥声线;一致性会替你留住它 |
| 政策边界 | 真实品牌和可辨认的真人会被拦,各地区规则不同 | 带品牌的元素改成泛化处理 |

