Grok Imagine Video 1.5 완벽 가이드: 프롬프트와 기능

Grok Imagine Video 1.5 완벽 가이드: 프롬프트와 기능

Morphic의 Grok Imagine Video 1.5 완벽 가이드. 베스트 프랙티스, 예시가 포함된 프롬프트 가이드, 기능과 활용 사례, 기술 사양까지 정리했습니다.

Grok Imagine Video 1.5의 기능과 역량

기능역할적합한 용도
네이티브 동기화 오디오대사, 효과음, 배경음, 음악이 움직임과 동시에 생성되어 싱크가 맞습니다토킹헤드, 제품 영상, 음악 클립
정지 이미지 애니메이션정지 이미지를 원본의 빛, 색감, 질감을 유지한 채 움직임으로 전환합니다사진, 제품 사진, 아트워크
비디오 확장마지막 프레임에서 이어서 더 긴 시퀀스로 확장합니다스토리 시퀀스, 긴 호흡의 장면
레퍼런스 기반 생성레퍼런스 이미지로 캐릭터나 스타일을 여러 클립에 걸쳐 유지합니다일관된 캐릭터, 스타일 고정 시리즈
프롬프트 준수와 카메라 제어샷 유형, 카메라 움직임, 타이밍 지시가 작성한 대로 반영됩니다스토리보드 프리뷰, 정밀한 샷

네이티브 동기화 오디오

오디오는 비디오와 한 번의 생성으로 함께 만들어집니다. 립싱크가 적용된 대사, 효과음, 배경음, 음악까지 포함됩니다. 움직임과 같은 프롬프트 안에 소리를 설명하면 되므로 별도의 오디오 작업 단계가 필요 없습니다.

정지 이미지 애니메이션

제공한 이미지가 첫 프레임으로 쓰이고, 모델이 그 지점에서부터 바깥으로 움직임을 만듭니다. 원본의 조명, 색감, 디테일을 다시 생성하지 않고 그대로 유지하므로 사진, 제품 사진, 완성된 아트워크를 애니메이션화하는 데 적합합니다.

Grok Imagine Video 1.5의 시작 프레임으로 쓰인 정지 이미지
시작 이미지.

비디오 확장

기존 클립의 마지막 프레임에서 이어서 더 긴 샷을 만들 수 있으며, 같은 피사체, 조명, 움직임이 유지됩니다. 이 단계를 반복하면 하나의 시작 클립에서 여러 파트로 이어지는 시퀀스를 만들 수 있습니다.

확장이 이어지는 지점인 첫 클립의 마지막 프레임
확장이 이어지는 마지막 프레임.

레퍼런스 기반 생성

레퍼런스 이미지는 첫 프레임을 고정하지 않으면서 스타일과 캐릭터를 안내합니다. 모델이 그 모습을 새로운 샷으로 가져오므로, 서로 다른 생성 결과 전반에서 캐릭터나 비주얼 스타일을 일관되게 유지할 수 있습니다.

Grok Imagine Video 1.5의 캐릭터와 스타일을 이끄는 레퍼런스 이미지
레퍼런스 이미지.

강력한 프롬프트 준수와 카메라 제어

모델은 샷 유형, 달리나 팬 같은 구체적인 카메라 움직임, 그리고 특정 동작이 일어나는 타이밍까지 상세한 지시를 따릅니다. 그래서 계획한 샷을 훨씬 예측 가능하게 재현할 수 있습니다.

Grok Imagine Video 1.5 기술 사양

사양Grok Imagine Video 1.5
제공처xAI
모드이미지-투-비디오, 텍스트-투-비디오, 레퍼런스-투-비디오, 비디오 편집, 비디오 확장
오디오네이티브, 동기화 (대사, 효과음, 배경음, 음악)
해상도480p 또는 720p
길이1~15초
프레임 레이트24 fps
화면비16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 1:1

Grok Imagine Video 1.5를 잘 쓰는 법

이 모델은 강력한 시작 프레임과 움직임 중심의 명확한 브리프에 보답합니다. 몇 가지 습관이 품질의 대부분을 좌우합니다.

  • 정지 이미지에서 시작하세요. 16:9 이미지를 먼저 생성하거나 첨부한 뒤 애니메이션화하세요. 좋은 첫 프레임이 결과를 좌우하는 가장 큰 요인입니다.
  • 움직임 프롬프트는 짧고 구체적으로 유지하세요. 동작과 카메라 움직임 하나만 지정하고, 구도와 스타일은 이미지가 담당하게 두세요.
  • 오디오는 항상 지정하세요. 대사, 효과음, 배경음, 음악을 평이한 말로 적어야 모델이 무음 클립 대신 움직임과 함께 소리를 생성합니다.
  • 클립당 한 동작. 몇 초 안에 하나의 비트만 담고, 더 긴 시퀀스에는 비디오 확장을 쓰세요.
  • 대사가 있는 캐릭터에는 입이 화면에 들어오는 정면 인물 샷을 쓰고, 깔끔한 립싱크를 위해 대사를 짧게 유지하세요.
  • 모습이나 캐릭터를 여러 클립에 걸쳐 유지해야 할 때는 레퍼런스 이미지를 활용하세요.

Grok Imagine Video 1.5 프롬프트 가이드

좋은 프롬프트는 캡션이 아니라 짧은 샷 브리프처럼 읽힙니다. 결과를 좌우하는 두 가지는, 샷에 무엇이 들어가는지에 대한 명확한 목록과, 모호한 표현 대신 구체적인 표현입니다.

프롬프트에 들어가는 것

요소포함할 내용
피사체화면에 있는 사람이나 사물을 구체적으로차콜색 스웨터를 입은 진행자
동작무엇이 어떻게 움직이는지그녀가 미소 지으며 카메라를 바라본다
카메라샷 유형과 움직임 하나미디엄 샷, 느린 푸시인
오디오대사, 효과음, 배경음, 음악그녀가 ‘어서 오세요’라고 말한다; 부드러운 실내 톤
포맷길이와 화면비5초, 16:9

약한 프롬프트 vs 강한 프롬프트

운에 맡기지 말고 카메라, 움직임과 타이밍, 오디오를 지정하세요.

초점약함강함
카메라밤에 도시에 있는 여성비에 젖은 거리를 걷는 여성을 따라가는 핸드헬드 트래킹 샷, 네온 반사, 얕은 피사계 심도
움직임과 타이밍문이 열리고 누군가 들어온다문이 천천히 열리고 한 박자 뒤 인물이 들어오며, 이어서 카메라가 자리를 잡는다
오디오요리사가 접시에 음식을 담는다요리사가 접시에 음식을 담는 클로즈업, 김이 피어오른다. 오디오: 프라이팬 지글거리는 소리, 부드러운 주방 배경음, ‘주문 들어갑니다’.

알아둘 설정

설정참고
길이1~15초; 클립당 한 동작만 유지
해상도480p 또는 720p
화면비입력 이미지를 따르거나 16:9, 9:16, 1:1 중 설정
레퍼런스 이미지여러 클립에 걸쳐 스타일이나 캐릭터를 유지하려면 추가
더 긴 시퀀스마지막 프레임에서 이어가려면 비디오 확장을 사용

흔한 실수

  • 프롬프트를 무음으로 남기기: 최소 하나의 사운드 큐는 항상 적어야 합니다.
  • 모호한 카메라: “시네마틱”은 모델에 아무것도 알려주지 않습니다. 샷과 움직임을 지정하세요.
  • 한 클립에 너무 많이 담기: 클립당 한 동작만 담고 그다음 확장하세요.

자주 묻는 질문

Grok Imagine Video 1.5에서 최상의 결과를 얻으려면?

강력한 16:9 정지 이미지에서 시작하고, 움직임 프롬프트는 짧고 구체적으로 유지하며, 카메라 움직임 하나를 지정하고, 오디오 큐를 항상 포함하세요. 클립당 한 동작을 유지하고 더 긴 시퀀스에는 비디오 확장을 쓰세요.

Grok Imagine Video 1.5는 오디오도 생성하나요?

네. 오디오는 비디오와 함께 네이티브로 생성되며 움직임과 싱크가 유지됩니다. 한 번의 생성에 립싱크된 대사, 효과음, 배경음, 음악까지 별도의 오디오 작업 없이 포함됩니다.

Grok Imagine Video 1.5는 어떤 입력을 받나요?

이미지-투-비디오는 이미지와 텍스트 프롬프트를, 텍스트-투-비디오는 텍스트 프롬프트만 받습니다. 레퍼런스 이미지를 넘겨 스타일과 캐릭터를 안내할 수도 있고, 비디오 확장과 편집으로 기존 클립을 이어가거나 수정할 수도 있습니다.

Grok Imagine Video 1.5 클립의 길이와 해상도는 어떻게 되나요?

클립은 480p 또는 720p, 24 fps로 1~15초까지 생성됩니다. 이미지-투-비디오에서는 화면비가 입력 이미지를 따르며, 가로형·정사각형·세로형 납품에 맞춰 비율을 직접 설정할 수도 있습니다.

Grok Imagine Video 1.5는 기존 Grok Imagine과 무엇이 다른가요?

기존 Grok Imagine은 텍스트-투-이미지, 이미지 편집, 여러 비디오 경로를 아우르는 xAI의 크로스모달 모델입니다. Grok Imagine Video 1.5는 이미지-투-비디오에 맞춰 네이티브 동기화 오디오, 립싱크 대사, 비디오 확장을 갖춘 전용 비디오 릴리스입니다.