多模态

Gemini Omni Flash 1.1

由 Google DeepMind 提供

Google 的视频模型,说一句就改一处。
现在支持 4K 输出,单场景 40 秒。

Gemini Omni Flash 1.1

核心功能

技术规格

Gemini Omni

Google Omni 家族的第二款 Omni Flash

5 种任务

文生视频、图生视频、参考生成、编辑、续写

3 到 10 秒

指单次生成;续写后总长可达 40 秒

最高 4K

360p 与 720p 原生,1080p 和 4K 为放大输出

10 + 3

10 张图片,外加 3 段各不超过 3 秒的短片

原生

台词、音效与配乐在同一次生成中完成

16:9、9:16

横版与竖版在每个分辨率下都能选

SynthID

每条成片都带一道不可见的来源标记

应用场景

同一处街边咖啡馆的分屏画面,左侧是写实摄影,右侧是动画风格

打字就能改画面

把片子交给它,再说要改什么:换天气、转成动画风、改写招牌。画面其余部分原样不动。

一位女性在柔和窗光里对着镜头说话,正说到一半

会说话的角色

台词写进提示词,角色就照着说,口型对得上;声线在此后每一次剪辑和修改里都不变。

一瓶香水、一位模特和一处场地的参考卡片,钉在成片广告画面旁边

参考素材说了算

一张产品图、一张出镜人物照,加上 3 秒的动作参考,合成一条产品还原准确的广告。

同一位骑行者穿过面包店街道、港口、灯塔与海岸公路的四格连拍

场景长到 40 秒

先生成开场那一段,再一次加十秒,接成 40 秒场景,人物、场景和配乐始终是同一套。

一件动态雕塑,多米诺骨牌推着钢珠滚上弧形木轨

讲物理的科普片

重力、流体和碰撞都按真实规律走,Gemini 在科学与历史上的底子让细节站得住。

一位渔民在雾气笼罩的港口接受采访,下方字幕条写着 THE COAST ROAD

画面里的字能读

从下方字幕条到店铺招牌,屏幕上的字回来时是能读的,后续一句话还能改写内容。

提示词示例

夜市

雨后的夜市,摊贩吆喝,炒锅滋滋作响

Edit prompt

按秒切镜

每两秒切到一处新的天台,正值黄昏

Edit prompt

画面文字

餐馆招牌逐个字母亮起:OPEN ALL NIGHT

Edit prompt

一镜到底

阳光工坊里的滚珠轨道,一镜到底不切换

Edit prompt

一句台词

登山者迎着风,轻声说出登顶那句话

Edit prompt

声音特写

手冲咖啡特写,每一滴、每一声嘶响都清晰

Edit prompt

概览

Gemini Omni Flash 1.1 是 Google DeepMind 多模态视频模型的第二代,也是第一代能把一条镜头养长的版本。单次生成仍然是 3 到 10 秒、自带声音,但 1.1 补上了初代缺的那几个控制项:从 360p 草稿到 4K 交付的分辨率阶梯、真正能引导画面的参考视频、可以指定末帧让两张静图之间自己补出运动,以及把片子续到 40 秒而人物与配乐都不换的能力。

1.1 到底改了什么

初代 Omni Flash 每条片子都出 720p,十秒封顶。1.1 留住了那套快速、可对话的内核,把周围的天花板一层层拆掉。分辨率变成每次生成都能选,360p 用来低成本试错,1080p 或 4K 放大留给要交付的那一条。参考输入扩到 10 张图片加 3 段短片,每一份在提示词里各领一个角色。成片也不再是终点:续写会读取末尾那段素材接着往下走,一次十秒,最长到初始长度的四倍。

能对话地改,而不是重新抽卡

多数视频模型把提示词当成一次拉杆。Omni Flash 把它当成一段对话里的第一句。模型在多轮之间记着这个场景,所以“外套换成红色”“镜头跟着她转身继续往下走”“招牌改成 CLOSED”这几句会依次落在同一条片子上,面孔、服装和声线都还在。指令短、一次只改一处最见效;没被提到的部分,就是不会动的部分。

Gemini Omni Flash 1.1 与 Morphic

在 Morphic 上,Gemini Omni 和 Veo 3.1、Seedance 2.5、Kling 一起排在视频模型选单里。把镜头连同声音写成一份简报,需要保持一致的元素配上参考图,然后生成;成片落到 Canvas 上,同一份简报还能换个模型再跑一次,两条结果并排看。中文创作者挑视频模型,习惯先把各家版本横着比一遍再决定;在同一块 Canvas 上一站式地比,比来回切工具省事得多。定下来之后继续在后续对话里改,一次一处,场景的上下文会一直跟着走。

简单定价

今天就免费开始,随时可以升级或取消。

Basic

$9/
账单金额为 $0 每年

1100 每月 信用

1 个用户

所有模型

工作流

Standard

$24/
账单金额为 $0 每年

3625 每月 信用

1 个用户

所有模型

工作流

Pro

$45/
账单金额为 $0 每年

6350 共享 每月 信用

1 用户

+ 最多 4 人额外付费可增加

所有模型

工作流

Pro Max

$170/
账单金额为 $0 每年

24650 共享 每月 信用

1 用户

+ 最多 9 人额外付费可增加

所有模型

工作流

Enterprise

更高的限制

自定义

定价和账单条款

大容量信用
自定义席位限制
所有模型
工作流
Pricing Gradient

Free

供随意体验

$0

永久免费

最多 20 积分
仅1个用户
部分模型
工作流

常见问题

Gemini Omni Flash 1.1 是什么?
Google 多模态视频模型的第二代,2026 年 8 月下旬上线。它能从文字、图片和参考视频生成带原生同步声音的视频,也能用大白话指令修改和续写已有素材。1.1 这一代补上了四样东西:最高到 4K 的分辨率阶梯、真正能起作用的参考视频、首帧到末帧的插值,以及把一条片子续到 40 秒的续写。
Gemini Omni Flash 1.1 相比初代改了哪些?
四处。分辨率从固定 720p 变成 360p 到 4K 之间随选。续写正式可用,一次十秒往上加,最长 40 秒;初代只能生成一条十秒的片子就到头。参考视频这次真的会影响画面,最多 3 段、每段 3 秒。图生视频还能指定末帧,让模型在您给的两张静图之间自己补出运动。
Gemini Omni Flash 1.1 能出多高的分辨率?
四档:360p、720p、1080p 和 4K,横版 16:9 或竖版 9:16 都支持。模型原生渲染 360p 和 720p,1080p 和 4K 是在这次生成结果上放大得到的。实际用法是先在 360p 便宜地试,720p 把镜头定下来,等画面对了再要交付分辨率。
Gemini Omni Flash 1.1 一条视频能有多长?
单次生成 3 到 10 秒,默认 8 秒。之后用续写一次加十秒,总长最多 40 秒,人物、动作和声音在每个接口处都连着。续写只能接在片尾,不能往前面加,也不能把中间抻长。
Gemini Omni Flash 1.1 的视频续写怎么用?
用大白话要求它接着往下拍,比如“把这条视频续下去”,或者“场景继续,镜头横摇扫过群山”。模型会把片子最后十秒当作上下文,生成下一段,并对末尾几帧做轻微调整,让接口看不出来。模型自己生成的片子可以续,您上传的素材也可以,前提是上传的片子不超过十秒。
Gemini Omni Flash 1.1 支持哪些参考素材?
除了文字提示词,最多可放 10 张参考图片和 3 段参考视频,每段视频 3 秒以内。图片可以钉住角色、产品、场景或风格,提示词里的标记负责给每张图派活。参考视频带的是长相或动作,里面的声音会被忽略;一次让模型通读好几条完整视频再做判断,这种用法并不支持。
Gemini Omni Flash 1.1 的对话式编辑怎么用?
后续每一条提示词改的都是上一次的结果,而不是从头再生成一遍,场景状态在多轮之间保留着。指令越短越准:“把手机隐去,其余保持不变”比整段描述画面管用得多。因为每一轮都踩在上一轮上,一轮只改一处,角色和动作在一连串修改里才稳得住。
Gemini Omni Flash 1.1 会生成声音和台词吗?
会,声音和画面在同一次生成里出来:带口型的台词、音效、环境声,还有跟着动作走的配乐。想要什么声音就写进提示词,因为提示词里只字不提声音时,模型会自己编一条配乐;要一句台词,把角色说的话直接写出来就行。
Gemini Omni Flash 1.1 能把中文写进画面吗?
画面文字这一项,英文能稳定还原,中文、日文这类非拉丁文字会被画成看着像、实际不对的字形。所以要在画面里放中文,只有两条路:屏幕文字留成英文,或者逐帧核对再用。提示词本身也建议用英文写,Google 只对英文提示词做了完整评估,中文提示词的效果不在官方公布的范围内。
在 Morphic 上能用 Gemini Omni Flash 1.1 吗?
能。在视频模型选单里挑中 Gemini Omni,把镜头连同想要的声音一起写出来,生成即可;成片落在 Canvas 上,紧挨着 Veo、Seedance 和 Kling 的结果,横着比一遍很方便。后续提示词继续改同一个场景,参考图也能跟着这份简报一起递进去。
Gemini Omni Flash 1.1 和 Veo 3.1 有什么不同?
Veo 3.1 调的是单镜头的电影质感;Omni Flash 1.1 调的是反复打磨的效率。Omni 是那种可以指挥的模型:一轮轮改自己的输出、图片与视频参考混着收、把一条片子续到 40 秒,过程中角色和声线不掉。要一条一次成型的主视觉镜头,Veo 的成片质感仍然更好;要一个需要反复修改、还要变长的场景,Omni Flash 才是那条流程。