Gemini Omni Flash: 완전 가이드, 프롬프트, 기능

Gemini Omni Flash: 완전 가이드, 프롬프트, 기능

Morphic의 Gemini Omni Flash 완전 가이드. Google의 any-to-any 모델이 하는 일, 네이티브 오디오, 대화형 편집, 캐릭터·물리 일관성, 현실 지식, SynthID 워터마킹, 예시와 함께 보는 프롬프트 작성법.

Gemini Omni 기능과 역량

Gemini Omni는 2026년 5월 19일 Google I/O 2026에서 공개된 Google 최초의 any-to-any 모델입니다. 첫 릴리스인 Gemini Omni Flash는 텍스트·이미지·영상을 입력으로 받아 동기화된 오디오와 함께 영상을 생성하며, Gemini의 현실 지식에 기반합니다. 클립은 16:9 또는 9:16, 720p에서 최대 10초까지 이어지고, 다시 생성하는 대신 대화로 다듬어 나갑니다.

기능하는 일적합한 용도
any-to-any 입력텍스트·이미지·영상을 한 프롬프트에 결합하고, 이어 붙이는 대신 그 전체를 함께 추론해 하나의 샷으로 만듭니다멀티 참조 브리프, 스토리보드
네이티브 오디오별도의 오디오 단계 없이, 한 번의 처리에서 모든 클립과 함께 동기화된 오디오를 생성합니다대사 장면, 앰비언스, 음악
대화형 편집일상 언어의 후속 지시로 클립을 다듬습니다. 같은 장면에서 오브젝트 교체, 재조명, 동작 변경까지다시 생성하지 않고 샷 반복 수정
캐릭터·물리 일관성편집을 거쳐도 캐릭터·오브젝트·스타일을 유지하며, 중력·운동 에너지·유체 거동이 현실에 기반합니다반복 등장 캐릭터, 사실적 움직임
현실 지식역사·과학·문화에 대한 Gemini의 기반 지식을 활용해 장면 디테일을 정확하게 유지합니다설명 영상, 정확한 디테일
SynthID 워터마킹재인코딩과 리사이즈에도 유지되는 비가시 출처 워터마크를 모든 클립에 적용합니다추적 가능하고 식별되는 AI 콘텐츠

any-to-any 입력

하나의 Gemini Omni 프롬프트는 텍스트·이미지·영상을 동시에 받습니다. 입력을 순서대로 이어 붙이는 대신, 모델은 그 전체를 하나의 브리프로 함께 추론합니다. 그래서 초상 참조, 로케이션 사진, 글로 쓴 비트가 모두 같은 샷을 만들어냅니다. 여러 참조 이미지를 넣어 특정 피사체를 장면 안으로 가져올 수도 있습니다. 별도의 오디오 참조 업로드는 순차 출시 중이며 아직 모든 곳에서 제공되지는 않습니다. Google의 Gemini 앱에서는 Avatars를 통해 자신의 목소리로 영상에 등장할 수 있습니다.

네이티브 오디오

모든 클립은 한 번의 처리에서 자체 동기화 오디오와 함께 생성됩니다. 그래서 대사, 효과음, 앰비언스, 음악이 무음 렌더가 아니라 움직임과 함께 돌아옵니다. 원하는 소리를 샷과 같은 프롬프트에 묘사하면, 오디오가 나중에 덧붙는 것이 아니라 동작에 맞춰 타이밍이 맞습니다.

대화형 편집

편집이 곧 프롬프트입니다. 일상 언어의 후속 지시로 클립을 다듬습니다. "조각을 거품으로 만들어줘", 장면 재조명, 동작 변경, 요소 추가까지 하면 모델은 샷의 나머지를 그대로 유지합니다. 턴을 거쳐도 맥락을 유지하므로 여러 차례의 편집이 처음부터 다시 시작하지 않고 같은 장면 위에 쌓입니다.

캐릭터·물리 일관성

캐릭터·오브젝트·스타일은 대화형 편집을 거쳐도 유지되며, 중력·운동 에너지·유체 거동 같은 힘에 대한 향상된 이해가 뒷받침합니다. 일관성은 같은 장면을 다듬을 때 가장 강합니다. 장면을 바꾸거나 큰 카메라 팬을 요청하면 어긋날 수 있으니, 큰 변경은 별도 생성으로 두세요.

현실 지식

Gemini Omni는 역사·과학·문화에 대한 Gemini의 지식에 장면을 기반하므로, 시대 디테일, 물리적 거동, 문화적 특수성이 일반적인 AI 질감으로 미끄러지지 않고 정확하게 유지됩니다. 이 기반 지식이야말로 설명 영상과 디테일이 정확해야 하는 모든 샷에 유용한 이유입니다.

SynthID 워터마킹

모든 클립에는 AI 출처 표시를 위한 Google의 감지되지 않는 SynthID 워터마크가 담깁니다. 기본값으로 켜져 있고, 시청자에게는 보이지 않으며, 재인코딩과 리사이즈 같은 일반적인 변형을 거쳐도 유지됩니다. 그래서 생성 결과물이 제작 과정 내내 식별 가능하게 남습니다.

Gemini Omni 프롬프트 예시

비에 젖은 도쿄 골목에서 나트륨등 아래 선 형사, 틸·앰버 느와르

시네마틱 느와르

비에 젖은 도쿄 골목의 형사, 나트륨등 반사, 틸·앰버 느와르

Edit prompt
강한 키 라이트 아래 티타늄 받침 위에 공중 정지한 아방가르드 스니커즈

제품 런칭

티타늄 받침 위에 떠오른 아방가르드 스니커즈, 강한 키 라이트, 런칭 무드

Edit prompt
이슬 맺힌 잎에 크리스털 왕관처럼 멈춘 물방울, 일출 역광 매크로

자연 설명

이슬 잎에 크리스털 왕관처럼 멈춘 물방울, 일출 역광 매크로

Edit prompt
따뜻한 3점 조명과 85mm 보케 속에서 렌즈를 응시하는 차분한 진행자

아바타 진행자

렌즈를 응시하는 차분한 진행자, 따뜻한 3점 조명, 85mm 보케

Edit prompt
브루탈리즘 콘크리트 빌라를 비추는 골든아워 빛, 긴 그림자와 떠도는 먼지

건축 워크스루

브루탈리즘 건축을 비추는 골든아워 빛, 긴 그림자, 떠도는 먼지

Edit prompt
비가 흩뿌리는 창가에서 편지를 읽는 여인, 걱정에서 안도로

스토리 비트

비 내리는 창가에서 편지를 읽는 여인, 걱정에서 안도로

Edit prompt

Gemini Omni를 최대한 활용하는 법

Gemini Omni는 각 참조를 하나의 장면의 일부로 다루고, 오디오를 명시하고, 다시 생성하는 대신 대화로 편집하는 브리프에 잘 반응합니다. 몇 가지 습관이 품질의 대부분을 좌우합니다.

  • 모든 참조를 한 번에 넣으세요. 텍스트·이미지·영상은 같은 프롬프트에 함께 들어갈 수 있습니다. 모델이 이들을 차례로 이어 붙이는 대신 함께 추론하기 때문입니다. 참조 이미지를 추가해 특정 피사체를 장면 안으로 가져오세요.
  • 항상 오디오를 명시하세요. 대사, 효과음, 앰비언스, 음악을 일상 언어로 적으면, 클립이 무음이 아니라 동작에 맞춰 타이밍이 맞은 소리와 함께 돌아옵니다.
  • 대화로 편집하세요. 샷이 거의 완성됐을 때는 처음부터 다시 하지 말고 다음 메시지에서 원하는 하나의 변경만 묘사하세요. 장면은 캐릭터·조명·연속성을 유지합니다.
  • 비트를 10초 안에 맞추세요. 영상 연장이나 보간이 없으니, 나중에 늘리는 데 기대지 말고 클립 안에서 마무리되는 하나의 동작을 설계하세요.
  • 장면 전환은 별도 생성으로 두세요. 일관성은 같은 장면을 다듬을 때 가장 강합니다. 급격한 장면 교체나 큰 팬은 새 샷으로 두는 편이 낫습니다.
  • 중요한 물리를 직접 지시하세요. 무게, 충돌, 유체가 어떻게 움직여야 하는지 짚어 주세요. 현실에 기반한 물리는 방향을 잡아줄 만한 강점입니다.

Gemini Omni 프롬프트 가이드

좋은 프롬프트는 캡션이 아니라 짧은 샷 브리프처럼 읽힙니다. 결과를 좌우하는 것은 두 가지입니다. 샷에 무엇이 담기는지에 대한 명확한 목록, 그리고 모호한 표현 대신 구체적인 표현입니다.

프롬프트에 들어갈 것

요소포함할 내용예시
피사체프레임에 누가 또는 무엇이 있는지, 구체적으로유리 책상 앞 차콜 블레이저 차림의 스튜디오 진행자
움직임무엇이, 어떻게 움직이는지그녀가 렌즈로 돌아서며 손짓한다
카메라샷 유형에 움직임 하나미디엄 샷, 느린 푸시인
오디오대사, 효과음, 앰비언스, 음악그녀가 '다시 오셨네요'라고 말한다. 부드러운 스튜디오 룸 톤
포맷길이와 화면비10초, 16:9

대화로 편집하기

편집이 곧 프롬프트입니다. 장면은 유지하고, 변경할 것만 명시하고, 나머지는 이전 턴에서 그대로 이어지게 하세요.

같은 장면에 대한 후속 편집

같은 진행자와 책상, 같은 조명. 그녀의 블레이저를 딥 그린으로 바꾸고 마지막 2초에 걸쳐 느린 푸시인을 추가해줘. 앞선 룸 톤은 그대로 유지해.

약한 프롬프트 대 강한 프롬프트

카메라, 움직임과 그 타이밍, 오디오를 운에 맡기지 말고 명시하세요.

초점약함강함
카메라밤 도시의 여인비에 젖은 거리를 걷는 여인을 따라가는 핸드헬드 트래킹 샷, 상점 불빛이 노면에 반사되고, 얕은 피사계 심도
움직임과 타이밍문이 열리고 누군가 들어온다문이 천천히 활짝 열리고, 잠시 뒤 한 인물이 걸어 들어오며, 그다음 카메라가 미디엄 샷으로 자리 잡는다
오디오요리를 담는 셰프요리를 담는 셰프의 클로즈업, 김이 오른다. 오디오: 팬에서 지글거리는 소리, 부드러운 주방 앰비언스, 그리고 '서비스'

흔한 실수

  • 프롬프트를 무음으로 두기: 모델은 오디오를 영상과 함께 생성하므로 항상 최소 하나의 사운드 큐를 적으세요.
  • 편집 대신 다시 생성하기: 샷이 거의 완성됐을 때는 대화로 하나의 변경만 요청해 캐릭터와 연속성을 유지하세요.
  • 연장에 기대기: 영상 연장이 없으니 하나의 동작을 10초 클립 안에 두세요.
  • 화면에 빽빽한 텍스트: 텍스트 렌더링과 매우 복잡한 움직임은 여전히 약점이니, 캡션은 짧게 두거나 후반 작업에서 추가하세요.

간단한 가격

오늘 무료로 시작하고 언제든지 업그레이드하거나 취소할 수 있습니다.

Basic

$9/
청구 금액 $0

900 월간 크레딧

1 명 전용

모든 모델

워크플로

Standard

$24/
청구 금액 $0

3200 월간 크레딧

1 명 전용

모든 모델

워크플로

Pro

$45/
청구 금액 $0

6200 공유 월간 크레딧

1 사용자

+ 최대 4 명 추가 비용으로 추가 가능

모든 모델

워크플로

Pro Max

$170/
청구 금액 $0

24000 공유 월간 크레딧

1 사용자

+ 최대 9 명 추가 비용으로 추가 가능

모든 모델

워크플로

Enterprise

더 높은 제한

사용자 정의

가격 및 청구 조건

대용량 크레딧
맞춤형 시트 제한
모든 모델
워크플로
Pricing Gradient

Free

가볍게 사용해보기

$0

영구 무료

최대 20 크레딧
1명 전용
일부 모델
워크플로

자주 묻는 질문

Gemini Omni란 무엇인가요?
Gemini Omni는 2026년 5월 19일 Google I/O 2026에서 공개된 Google 최초의 any-to-any 모델입니다. 첫 릴리스인 Gemini Omni Flash는 텍스트·이미지·영상을 입력으로 받아 동기화된 오디오와 함께 영상을 생성하며, Gemini의 현실 지식에 기반하고, 대화형 편집과 모든 클립의 SynthID 워터마킹을 제공합니다.
Gemini Omni는 어떤 입력을 받나요?
Gemini Omni는 한 프롬프트에 텍스트·이미지·영상을 받아 이어 붙이는 대신 하나의 브리프로 함께 추론합니다. 여러 참조 이미지를 넣어 특정 피사체를 장면 안으로 가져올 수 있습니다. 별도의 오디오 참조 업로드는 순차 출시 중이며 아직 모든 곳에서 제공되지는 않고, 이미지·오디오 출력은 로드맵에 포함되어 있습니다.
Gemini Omni는 오디오를 생성하나요?
네. 모든 Gemini Omni 클립은 한 번의 처리에서 자체 동기화 오디오와 함께 생성되므로, 대사, 효과음, 앰비언스, 음악이 나중에 덧붙는 것이 아니라 동작에 맞춰 타이밍이 맞습니다. 원하는 소리를 샷과 같은 프롬프트에 묘사하세요.
Gemini Omni의 대화형 편집은 어떻게 작동하나요?
첫 프롬프트 이후의 모든 프롬프트는 새 생성을 시작하는 대신 같은 장면을 편집합니다. 새 오브젝트, 재조명된 배경, 다른 동작처럼 원하는 하나의 변경을 묘사하면, 샷은 캐릭터·조명·연속성을 유지합니다. 일관성은 장면을 바꾸거나 큰 카메라 팬을 요청할 때보다 같은 장면을 다듬을 때 가장 강합니다.
Gemini Omni 클립의 길이와 해상도는 어떻게 되나요?
Gemini Omni Flash는 16:9 또는 9:16, 720p에서 최대 10초까지 클립을 생성합니다. 영상 연장이나 보간이 없으니 클립 안에서 마무리되는 하나의 동작을 설계하세요. 모든 클립에는 기본값으로 Google의 감지되지 않는 SynthID 워터마크가 담깁니다.
Morphic에서 Gemini Omni를 어떻게 사용하나요?
Morphic을 열어 프롬프트바를 Video 모드로 전환하고, 모델 선택기에서 Gemini Omni를 선택하세요. 텍스트·이미지·영상 또는 이들의 조합을 첨부하고, 샷과 그 오디오를 묘사한 다음 프롬프트를 실행하세요. 결과를 수정하려면 다음 메시지에서 요청하면 되며, 장면은 이전 맥락을 유지합니다.