Gemini Omni 기능과 역량
Gemini Omni는 2026년 5월 19일 Google I/O 2026에서 공개된 Google 최초의 any-to-any 모델입니다. 첫 릴리스인 Gemini Omni Flash는 텍스트·이미지·영상을 입력으로 받아 동기화된 오디오와 함께 영상을 생성하며, Gemini의 현실 지식에 기반합니다. 클립은 16:9 또는 9:16, 720p에서 최대 10초까지 이어지고, 다시 생성하는 대신 대화로 다듬어 나갑니다.
| 기능 | 하는 일 | 적합한 용도 |
|---|---|---|
| any-to-any 입력 | 텍스트·이미지·영상을 한 프롬프트에 결합하고, 이어 붙이는 대신 그 전체를 함께 추론해 하나의 샷으로 만듭니다 | 멀티 참조 브리프, 스토리보드 |
| 네이티브 오디오 | 별도의 오디오 단계 없이, 한 번의 처리에서 모든 클립과 함께 동기화된 오디오를 생성합니다 | 대사 장면, 앰비언스, 음악 |
| 대화형 편집 | 일상 언어의 후속 지시로 클립을 다듬습니다. 같은 장면에서 오브젝트 교체, 재조명, 동작 변경까지 | 다시 생성하지 않고 샷 반복 수정 |
| 캐릭터·물리 일관성 | 편집을 거쳐도 캐릭터·오브젝트·스타일을 유지하며, 중력·운동 에너지·유체 거동이 현실에 기반합니다 | 반복 등장 캐릭터, 사실적 움직임 |
| 현실 지식 | 역사·과학·문화에 대한 Gemini의 기반 지식을 활용해 장면 디테일을 정확하게 유지합니다 | 설명 영상, 정확한 디테일 |
| SynthID 워터마킹 | 재인코딩과 리사이즈에도 유지되는 비가시 출처 워터마크를 모든 클립에 적용합니다 | 추적 가능하고 식별되는 AI 콘텐츠 |
any-to-any 입력
하나의 Gemini Omni 프롬프트는 텍스트·이미지·영상을 동시에 받습니다. 입력을 순서대로 이어 붙이는 대신, 모델은 그 전체를 하나의 브리프로 함께 추론합니다. 그래서 초상 참조, 로케이션 사진, 글로 쓴 비트가 모두 같은 샷을 만들어냅니다. 여러 참조 이미지를 넣어 특정 피사체를 장면 안으로 가져올 수도 있습니다. 별도의 오디오 참조 업로드는 순차 출시 중이며 아직 모든 곳에서 제공되지는 않습니다. Google의 Gemini 앱에서는 Avatars를 통해 자신의 목소리로 영상에 등장할 수 있습니다.
네이티브 오디오
모든 클립은 한 번의 처리에서 자체 동기화 오디오와 함께 생성됩니다. 그래서 대사, 효과음, 앰비언스, 음악이 무음 렌더가 아니라 움직임과 함께 돌아옵니다. 원하는 소리를 샷과 같은 프롬프트에 묘사하면, 오디오가 나중에 덧붙는 것이 아니라 동작에 맞춰 타이밍이 맞습니다.
대화형 편집
편집이 곧 프롬프트입니다. 일상 언어의 후속 지시로 클립을 다듬습니다. "조각을 거품으로 만들어줘", 장면 재조명, 동작 변경, 요소 추가까지 하면 모델은 샷의 나머지를 그대로 유지합니다. 턴을 거쳐도 맥락을 유지하므로 여러 차례의 편집이 처음부터 다시 시작하지 않고 같은 장면 위에 쌓입니다.
캐릭터·물리 일관성
캐릭터·오브젝트·스타일은 대화형 편집을 거쳐도 유지되며, 중력·운동 에너지·유체 거동 같은 힘에 대한 향상된 이해가 뒷받침합니다. 일관성은 같은 장면을 다듬을 때 가장 강합니다. 장면을 바꾸거나 큰 카메라 팬을 요청하면 어긋날 수 있으니, 큰 변경은 별도 생성으로 두세요.
현실 지식
Gemini Omni는 역사·과학·문화에 대한 Gemini의 지식에 장면을 기반하므로, 시대 디테일, 물리적 거동, 문화적 특수성이 일반적인 AI 질감으로 미끄러지지 않고 정확하게 유지됩니다. 이 기반 지식이야말로 설명 영상과 디테일이 정확해야 하는 모든 샷에 유용한 이유입니다.
SynthID 워터마킹
모든 클립에는 AI 출처 표시를 위한 Google의 감지되지 않는 SynthID 워터마크가 담깁니다. 기본값으로 켜져 있고, 시청자에게는 보이지 않으며, 재인코딩과 리사이즈 같은 일반적인 변형을 거쳐도 유지됩니다. 그래서 생성 결과물이 제작 과정 내내 식별 가능하게 남습니다.
Gemini Omni 프롬프트 예시






Gemini Omni를 최대한 활용하는 법
Gemini Omni는 각 참조를 하나의 장면의 일부로 다루고, 오디오를 명시하고, 다시 생성하는 대신 대화로 편집하는 브리프에 잘 반응합니다. 몇 가지 습관이 품질의 대부분을 좌우합니다.
- 모든 참조를 한 번에 넣으세요. 텍스트·이미지·영상은 같은 프롬프트에 함께 들어갈 수 있습니다. 모델이 이들을 차례로 이어 붙이는 대신 함께 추론하기 때문입니다. 참조 이미지를 추가해 특정 피사체를 장면 안으로 가져오세요.
- 항상 오디오를 명시하세요. 대사, 효과음, 앰비언스, 음악을 일상 언어로 적으면, 클립이 무음이 아니라 동작에 맞춰 타이밍이 맞은 소리와 함께 돌아옵니다.
- 대화로 편집하세요. 샷이 거의 완성됐을 때는 처음부터 다시 하지 말고 다음 메시지에서 원하는 하나의 변경만 묘사하세요. 장면은 캐릭터·조명·연속성을 유지합니다.
- 비트를 10초 안에 맞추세요. 영상 연장이나 보간이 없으니, 나중에 늘리는 데 기대지 말고 클립 안에서 마무리되는 하나의 동작을 설계하세요.
- 장면 전환은 별도 생성으로 두세요. 일관성은 같은 장면을 다듬을 때 가장 강합니다. 급격한 장면 교체나 큰 팬은 새 샷으로 두는 편이 낫습니다.
- 중요한 물리를 직접 지시하세요. 무게, 충돌, 유체가 어떻게 움직여야 하는지 짚어 주세요. 현실에 기반한 물리는 방향을 잡아줄 만한 강점입니다.
Gemini Omni 프롬프트 가이드
좋은 프롬프트는 캡션이 아니라 짧은 샷 브리프처럼 읽힙니다. 결과를 좌우하는 것은 두 가지입니다. 샷에 무엇이 담기는지에 대한 명확한 목록, 그리고 모호한 표현 대신 구체적인 표현입니다.
프롬프트에 들어갈 것
| 요소 | 포함할 내용 | 예시 |
|---|---|---|
| 피사체 | 프레임에 누가 또는 무엇이 있는지, 구체적으로 | 유리 책상 앞 차콜 블레이저 차림의 스튜디오 진행자 |
| 움직임 | 무엇이, 어떻게 움직이는지 | 그녀가 렌즈로 돌아서며 손짓한다 |
| 카메라 | 샷 유형에 움직임 하나 | 미디엄 샷, 느린 푸시인 |
| 오디오 | 대사, 효과음, 앰비언스, 음악 | 그녀가 '다시 오셨네요'라고 말한다. 부드러운 스튜디오 룸 톤 |
| 포맷 | 길이와 화면비 | 10초, 16:9 |
대화로 편집하기
편집이 곧 프롬프트입니다. 장면은 유지하고, 변경할 것만 명시하고, 나머지는 이전 턴에서 그대로 이어지게 하세요.
같은 진행자와 책상, 같은 조명. 그녀의 블레이저를 딥 그린으로 바꾸고 마지막 2초에 걸쳐 느린 푸시인을 추가해줘. 앞선 룸 톤은 그대로 유지해.
약한 프롬프트 대 강한 프롬프트
카메라, 움직임과 그 타이밍, 오디오를 운에 맡기지 말고 명시하세요.
| 초점 | 약함 | 강함 |
|---|---|---|
| 카메라 | 밤 도시의 여인 | 비에 젖은 거리를 걷는 여인을 따라가는 핸드헬드 트래킹 샷, 상점 불빛이 노면에 반사되고, 얕은 피사계 심도 |
| 움직임과 타이밍 | 문이 열리고 누군가 들어온다 | 문이 천천히 활짝 열리고, 잠시 뒤 한 인물이 걸어 들어오며, 그다음 카메라가 미디엄 샷으로 자리 잡는다 |
| 오디오 | 요리를 담는 셰프 | 요리를 담는 셰프의 클로즈업, 김이 오른다. 오디오: 팬에서 지글거리는 소리, 부드러운 주방 앰비언스, 그리고 '서비스' |
흔한 실수
- 프롬프트를 무음으로 두기: 모델은 오디오를 영상과 함께 생성하므로 항상 최소 하나의 사운드 큐를 적으세요.
- 편집 대신 다시 생성하기: 샷이 거의 완성됐을 때는 대화로 하나의 변경만 요청해 캐릭터와 연속성을 유지하세요.
- 연장에 기대기: 영상 연장이 없으니 하나의 동작을 10초 클립 안에 두세요.
- 화면에 빽빽한 텍스트: 텍스트 렌더링과 매우 복잡한 움직임은 여전히 약점이니, 캡션은 짧게 두거나 후반 작업에서 추가하세요.

