멀티모달

Gemini Omni Flash 1.1

Google DeepMind 제공

문장으로 고치는 Google의 영상 모델.
출력은 4K, 장면은 40초까지.

Gemini Omni Flash 1.1

주요 기능

기술 사양

Gemini Omni

Google Omni 제품군의 두 번째 Omni Flash입니다.

5가지

텍스트, 이미지, 레퍼런스, 편집, 연장.

3~10초

1회 생성 기준. 연장하면 합계 40초까지.

최대 4K

360p·720p는 네이티브, 1080p·4K는 업스케일.

10+3

이미지 10장과 3초 이내 영상 클립 3개.

네이티브

대사, 효과음, 음악을 같은 패스에서 생성.

16:9, 9:16

16:9와 9:16. 모든 해상도에서 가로와 세로.

SynthID

생성된 모든 클립에 들어가는 비가시 출처 표식.

활용 사례

같은 길거리 카페 장면을 좌우로 나눈 화면. 왼쪽은 실사, 오른쪽은 애니메이션 톤

문장으로 하는 편집

클립을 건네고 바꿀 곳만 말하면 됩니다. 날씨, 애니메이션 톤, 간판 문구. 나머지는 촬영한 그대로 남습니다.

부드러운 창가 빛 속에서 카메라를 보며 말하는 여성

말하는 캐릭터

대사를 적으면 캐릭터가 입 모양까지 맞춰 말합니다. 그 목소리는 컷이 바뀌어도 편집을 거듭해도 그대로입니다.

완성된 향수 광고 프레임 옆에 붙은 제품 병, 모델, 장소 레퍼런스 카드

레퍼런스 그대로

제품 컷 한 장, 모델 사진 한 장, 원하는 움직임 3초. 이 셋이 한 편의 광고가 되고 제품은 그대로 남습니다.

같은 자전거 주행자가 빵집 거리, 항구, 등대, 해안 도로를 지나는 네 컷 필름스트립

40초까지 크는 장면

첫 장면을 만들고 10초씩 이어 붙입니다. 등장인물도 장소도 음악도 같은 채로 40초 장면이 됩니다.

도미노가 강철 구슬을 밀어 곡면 나무 트랙으로 보내는 키네틱 조형물

물리가 맞는 설명 영상

중력도 유체도 충돌도 실제 법칙대로 움직입니다. 과학과 역사에 기반한 Gemini의 지식이 세부를 잡아 줍니다.

안개 낀 항구에서 어부를 인터뷰하는 화면. 하단에 THE COAST ROAD 자막

화면 안의 자막

하단 자막부터 가게 간판까지, 영어로 지정한 문구는 읽히게 나옵니다. 이어지는 편집으로 바꿀 수도 있습니다.

프롬프트 예시

야시장

비 갠 밤 시장, 상인들의 호객 소리, 웍이 지글거리는 소리

Edit prompt

타이밍 컷

2초마다 다른 옥상으로 컷, 노을 빛으로

Edit prompt

화면 속 글자

식당 간판이 한 글자씩 켜진다: OPEN ALL NIGHT

Edit prompt

원 컷

햇살 드는 공방을 굴러가는 구슬, 컷 없이 한 번에

Edit prompt

대사 한 줄

등반가가 정상에서 한마디를 바람에 속삭인다

Edit prompt

소리 중심 클로즈업

핸드드립 커피 클로즈업, 물방울과 김 소리까지

Edit prompt

개요

Gemini Omni Flash 1.1은 Google DeepMind의 멀티모달 영상 모델, 그 두 번째 버전입니다. 한 컷을 키울 수 있게 된 것은 이번이 처음입니다. 한 번의 생성이 3~10초, 오디오가 함께 나온다는 뼈대는 그대로입니다. 달라진 것은 첫 버전에 없던 손잡이 쪽입니다. 360p 시안부터 4K 납품까지 고르는 해상도 단계, 결과를 실제로 이끄는 영상 레퍼런스, 정지 이미지 두 장을 하나의 움직임으로 바꾸는 끝 프레임, 그리고 등장인물과 음악을 지킨 채 40초까지 늘리는 연장. 이 네 가지가 더해졌습니다.

Gemini Omni Flash 1.1에서 달라진 점

첫 Omni Flash는 모든 클립을 720p로 뽑았고 10초에서 멈췄습니다. 1.1은 빠르고 대화적인 속을 그대로 두고, 둘레에 있던 상한만 걷어 냈습니다. 해상도는 생성마다 고르는 값이 되었습니다. 싸게 돌릴 때는 360p, 내보낼 때가 되면 1080p나 4K 업스케일입니다. 레퍼런스 입력은 이미지 10장과 짧은 클립 3개까지 넓어졌고, 각각에 프롬프트 안에서 역할을 줍니다. 그리고 완성된 클립은 더 이상 종점이 아닙니다. 연장은 직전 구간을 읽어 장면을 잇고, 10초씩, 원래 길이의 네 배까지 갑니다.

다시 뽑는 대신 대화로 고치는 영상 편집

많은 영상 모델은 프롬프트를 슬롯머신 레버처럼 다룹니다. Omni Flash가 다루는 방식은 한 세션의 첫 음에 가깝습니다. 장면 상태가 턴을 넘어 유지되기 때문에 “재킷을 빨간색으로”, “그가 돌아서는 데서 이어서 연장”, “간판을 CLOSED로” 가 모두 같은 테이크에 얹힙니다. 얼굴도 의상도 목소리도 그대로입니다. 짧게, 한 번에 한 가지만 바꾸는 지시가 가장 잘 통합니다. 그리고 한 번도 언급하지 않은 부분은 한 번도 움직이지 않습니다.

Morphic에서 쓰는 Gemini Omni Flash 1.1

Morphic에서는 Gemini Omni가 영상 모델 목록에 Veo 3.1, Seedance 2.5, Kling과 나란히 놓여 있습니다. 오디오까지 포함한 브리프로 장면을 적고, 끝까지 지켜야 할 것이 있으면 레퍼런스 이미지를 붙여 생성하세요. 결과는 Canvas에 놓입니다. 같은 브리프를 다른 모델에도 통과시키면 나란히 놓고 읽을 수 있습니다. 이어지는 프롬프트로 한 번에 한 가지씩 다듬어 가면, 장면의 맥락은 턴을 넘어도 남습니다.

간단한 가격

오늘 무료로 시작하고 언제든지 업그레이드하거나 취소할 수 있습니다.

Basic

$9/
청구 금액 $0

1100 월간 크레딧

1 명 전용

모든 모델

워크플로

Standard

$24/
청구 금액 $0

3625 월간 크레딧

1 명 전용

모든 모델

워크플로

Pro

$45/
청구 금액 $0

6350 공유 월간 크레딧

1 사용자

+ 최대 4 명 추가 비용으로 추가 가능

모든 모델

워크플로

Pro Max

$170/
청구 금액 $0

24650 공유 월간 크레딧

1 사용자

+ 최대 9 명 추가 비용으로 추가 가능

모든 모델

워크플로

Enterprise

더 높은 제한

사용자 정의

가격 및 청구 조건

대용량 크레딧
맞춤형 시트 제한
모든 모델
워크플로
Pricing Gradient

Free

가볍게 사용해보기

$0

영구 무료

최대 20 크레딧
1명 전용
일부 모델
워크플로

자주 묻는 질문

Gemini Omni Flash 1.1은 무엇인가요?
Google의 멀티모달 영상 모델, 그 두 번째 버전입니다. 2026년 8월 말에 공개되었습니다. 텍스트와 이미지, 영상 레퍼런스를 받아 화면과 동기화된 오디오까지 함께 생성합니다. 만들어진 영상은 평범한 문장 지시만으로 편집하고 연장할 수 있습니다. 1.1에서 더해진 것은 4K까지 올라가는 해상도 단계, 실제로 작동하는 영상 레퍼런스, 첫 프레임과 끝 프레임 사이의 보간, 그리고 40초까지 늘어나는 연장입니다.
첫 버전과 비교해 1.1은 무엇이 달라졌나요?
네 가지입니다. 해상도는 360p부터 4K까지 고를 수 있습니다. 첫 버전은 720p 고정이었습니다. 영상 연장이 열렸습니다. 10초씩 더해 합계 40초까지 갑니다. 첫 버전은 10초 한 번으로 끝이었습니다. 영상 레퍼런스는 이제 결과를 실제로 이끕니다. 3초짜리 클립을 3개까지 받습니다. 그리고 이미지에서 영상을 만들 때 끝 프레임을 지정할 수 있어, 건넨 정지 이미지 두 장 사이를 모델이 보간합니다.
Gemini Omni Flash 1.1의 해상도는 어디까지 나오나요?
360p, 720p, 1080p, 4K의 네 가지입니다. 비율은 16:9와 9:16을 지원합니다. 네이티브로 그리는 것은 360p와 720p까지이고, 1080p와 4K는 그 생성물을 업스케일한 결과입니다. 그래서 실무 순서는 정해져 있습니다. 360p로 싸게 돌리고, 720p에서 테이크를 확정하고, 컷이 정해진 다음에 납품 해상도를 요청합니다.
Gemini Omni Flash 1.1 영상은 얼마나 길게 만들 수 있나요?
한 번의 생성은 3~10초이고 기본값은 8초입니다. 여기서 연장을 거듭하면 10초씩 늘어 합계 40초까지 갑니다. 이어지는 구간에서도 인물과 움직임, 소리가 끊기지 않습니다. 다만 연장은 클립의 끝에만 붙습니다. 앞에 덧붙이거나 중간을 늘리는 것은 되지 않습니다.
Gemini Omni Flash 1.1의 영상 연장은 어떻게 작동하나요?
평범한 문장으로 다음 장면을 요청하면 됩니다. “extend this video”도 통하고, “장면이 이어진다: 카메라가 산맥을 가로질러 팬한다”처럼 방향을 적으면 그대로 갑니다. 모델은 클립의 마지막 10초를 맥락으로 읽고 다음 한 박자를 생성합니다. 마지막 프레임은 살짝 조정되어 이어 붙은 자리가 눈에 띄지 않습니다. 모델이 만든 클립에도, 직접 올린 영상에도 쓸 수 있습니다. 올리는 영상은 10초 이내여야 합니다.
Gemini Omni Flash 1.1은 어떤 레퍼런스를 받나요?
텍스트 프롬프트와 함께 참조 이미지는 10장까지, 참조 영상은 3초 이내로 3개까지 받습니다. 이미지는 인물이나 제품, 장소, 스타일을 고정하고, 프롬프트 속 태그가 각각의 역할을 지정합니다. 영상 레퍼런스는 생김새나 움직임을 옮겨 오며 안에 든 소리는 무시됩니다. 긴 영상 여러 편을 한꺼번에 놓고 내용을 추론시키는 사용은 지원하지 않습니다.
Gemini Omni Flash 1.1의 대화형 편집은 어떻게 진행되나요?
다음에 보내는 프롬프트는 처음부터 다시 만들지 않고 직전 결과를 편집합니다. 장면의 상태는 턴을 넘어 유지됩니다. 잘 통하는 것은 짧은 지시입니다. “휴대폰만 지우고 나머지는 그대로”가 화면 전체를 묘사한 한 문단보다 낫습니다. 매 턴이 앞 턴 위에 쌓이는 구조라, 한 번에 한 가지만 바꾸면 편집을 이어 가도 인물과 움직임이 흔들리지 않습니다.
Gemini Omni Flash 1.1은 오디오와 대사도 생성하나요?
생성합니다. 소리는 화면과 같은 패스에서 만들어집니다. 입 모양이 맞는 대사, 효과음, 공간음, 동작에 맞춘 음악까지 포함합니다. 원하는 소리는 프롬프트에 적으세요. 소리에 대해 아무것도 쓰지 않으면 모델이 알아서 트랙을 붙입니다. 대사는 인물이 할 말을 그대로 적기만 하면 됩니다.
화면 안에 한국어 텍스트를 넣을 수 있나요?
화면 속 글자에서 이 모델이 잘하는 언어는 영어입니다. 간판이든 하단 자막이든, 영어로 지정한 문구는 읽히는 형태로 나옵니다. 한국어처럼 라틴 문자가 아닌 글자는 아직 약한 부분입니다. 그럴듯해 보이지만 실제로는 성립하지 않는 자형이 돌아올 수 있습니다. 한글이 꼭 들어가야 하는 작업이라면 내보내기 전에 전 프레임을 눈으로 확인하세요. 화면 속 문구를 영어로 두는 편이 지금으로서는 가장 확실합니다.
Morphic에서 Gemini Omni Flash 1.1을 쓸 수 있나요?
쓸 수 있습니다. 영상 모델 선택에서 Gemini Omni를 고르고, 원하는 소리까지 담아 장면을 적은 뒤 생성하세요. 결과는 Canvas에 놓이고 Veo, Seedance, Kling의 결과와 나란히 놓고 비교할 수 있습니다. 이어지는 프롬프트는 같은 장면을 편집하고, 브리프에 레퍼런스 이미지를 함께 붙일 수 있습니다.
Gemini Omni Flash 1.1은 Veo 3.1과 무엇이 다른가요?
Veo 3.1은 한 컷의 완성도에 맞춰진 모델이고, Omni Flash 1.1은 다듬어 나가는 작업에 맞춰져 있습니다. 지시해서 움직이는 쪽은 Omni입니다. 자기 결과물을 턴마다 편집하고, 이미지와 영상 레퍼런스를 섞어 받고, 테이크를 40초까지 늘리고, 그 사이 인물과 목소리를 지킵니다. 한 방에 끝내는 히어로 컷이라면 마무리의 윤기는 여전히 Veo가 앞섭니다. 다듬으며 키워 가는 작업이라면 Omni Flash가 작업 흐름에 맞습니다. 참고로 Veo 4라는 이름의 모델은 공개된 적이 없습니다. Google의 시네마틱 계열이 Veo 3.1, 멀티모달 계열이 Gemini Omni입니다.