Grok Imagine Video 1.5의 기능과 역량
| 기능 | 역할 | 적합한 용도 |
|---|---|---|
| 네이티브 동기화 오디오 | 대사, 효과음, 배경음, 음악이 움직임과 동시에 생성되어 싱크가 맞습니다 | 토킹헤드, 제품 영상, 음악 클립 |
| 정지 이미지 애니메이션 | 정지 이미지를 원본의 빛, 색감, 질감을 유지한 채 움직임으로 전환합니다 | 사진, 제품 사진, 아트워크 |
| 비디오 확장 | 마지막 프레임에서 이어서 더 긴 시퀀스로 확장합니다 | 스토리 시퀀스, 긴 호흡의 장면 |
| 레퍼런스 기반 생성 | 레퍼런스 이미지로 캐릭터나 스타일을 여러 클립에 걸쳐 유지합니다 | 일관된 캐릭터, 스타일 고정 시리즈 |
| 프롬프트 준수와 카메라 제어 | 샷 유형, 카메라 움직임, 타이밍 지시가 작성한 대로 반영됩니다 | 스토리보드 프리뷰, 정밀한 샷 |
네이티브 동기화 오디오
오디오는 비디오와 한 번의 생성으로 함께 만들어집니다. 립싱크가 적용된 대사, 효과음, 배경음, 음악까지 포함됩니다. 움직임과 같은 프롬프트 안에 소리를 설명하면 되므로 별도의 오디오 작업 단계가 필요 없습니다.
정지 이미지 애니메이션
제공한 이미지가 첫 프레임으로 쓰이고, 모델이 그 지점에서부터 바깥으로 움직임을 만듭니다. 원본의 조명, 색감, 디테일을 다시 생성하지 않고 그대로 유지하므로 사진, 제품 사진, 완성된 아트워크를 애니메이션화하는 데 적합합니다.

비디오 확장
기존 클립의 마지막 프레임에서 이어서 더 긴 샷을 만들 수 있으며, 같은 피사체, 조명, 움직임이 유지됩니다. 이 단계를 반복하면 하나의 시작 클립에서 여러 파트로 이어지는 시퀀스를 만들 수 있습니다.

레퍼런스 기반 생성
레퍼런스 이미지는 첫 프레임을 고정하지 않으면서 스타일과 캐릭터를 안내합니다. 모델이 그 모습을 새로운 샷으로 가져오므로, 서로 다른 생성 결과 전반에서 캐릭터나 비주얼 스타일을 일관되게 유지할 수 있습니다.

강력한 프롬프트 준수와 카메라 제어
모델은 샷 유형, 달리나 팬 같은 구체적인 카메라 움직임, 그리고 특정 동작이 일어나는 타이밍까지 상세한 지시를 따릅니다. 그래서 계획한 샷을 훨씬 예측 가능하게 재현할 수 있습니다.
Grok Imagine Video 1.5 기술 사양
| 사양 | Grok Imagine Video 1.5 |
|---|---|
| 제공처 | xAI |
| 모드 | 이미지-투-비디오, 텍스트-투-비디오, 레퍼런스-투-비디오, 비디오 편집, 비디오 확장 |
| 오디오 | 네이티브, 동기화 (대사, 효과음, 배경음, 음악) |
| 해상도 | 480p 또는 720p |
| 길이 | 1~15초 |
| 프레임 레이트 | 24 fps |
| 화면비 | 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 1:1 |
Grok Imagine Video 1.5를 잘 쓰는 법
이 모델은 강력한 시작 프레임과 움직임 중심의 명확한 브리프에 보답합니다. 몇 가지 습관이 품질의 대부분을 좌우합니다.
- 정지 이미지에서 시작하세요. 16:9 이미지를 먼저 생성하거나 첨부한 뒤 애니메이션화하세요. 좋은 첫 프레임이 결과를 좌우하는 가장 큰 요인입니다.
- 움직임 프롬프트는 짧고 구체적으로 유지하세요. 동작과 카메라 움직임 하나만 지정하고, 구도와 스타일은 이미지가 담당하게 두세요.
- 오디오는 항상 지정하세요. 대사, 효과음, 배경음, 음악을 평이한 말로 적어야 모델이 무음 클립 대신 움직임과 함께 소리를 생성합니다.
- 클립당 한 동작. 몇 초 안에 하나의 비트만 담고, 더 긴 시퀀스에는 비디오 확장을 쓰세요.
- 대사가 있는 캐릭터에는 입이 화면에 들어오는 정면 인물 샷을 쓰고, 깔끔한 립싱크를 위해 대사를 짧게 유지하세요.
- 모습이나 캐릭터를 여러 클립에 걸쳐 유지해야 할 때는 레퍼런스 이미지를 활용하세요.
Grok Imagine Video 1.5 프롬프트 가이드
좋은 프롬프트는 캡션이 아니라 짧은 샷 브리프처럼 읽힙니다. 결과를 좌우하는 두 가지는, 샷에 무엇이 들어가는지에 대한 명확한 목록과, 모호한 표현 대신 구체적인 표현입니다.
프롬프트에 들어가는 것
| 요소 | 포함할 내용 | 예 |
|---|---|---|
| 피사체 | 화면에 있는 사람이나 사물을 구체적으로 | 차콜색 스웨터를 입은 진행자 |
| 동작 | 무엇이 어떻게 움직이는지 | 그녀가 미소 지으며 카메라를 바라본다 |
| 카메라 | 샷 유형과 움직임 하나 | 미디엄 샷, 느린 푸시인 |
| 오디오 | 대사, 효과음, 배경음, 음악 | 그녀가 ‘어서 오세요’라고 말한다; 부드러운 실내 톤 |
| 포맷 | 길이와 화면비 | 5초, 16:9 |
약한 프롬프트 vs 강한 프롬프트
운에 맡기지 말고 카메라, 움직임과 타이밍, 오디오를 지정하세요.
| 초점 | 약함 | 강함 |
|---|---|---|
| 카메라 | 밤에 도시에 있는 여성 | 비에 젖은 거리를 걷는 여성을 따라가는 핸드헬드 트래킹 샷, 네온 반사, 얕은 피사계 심도 |
| 움직임과 타이밍 | 문이 열리고 누군가 들어온다 | 문이 천천히 열리고 한 박자 뒤 인물이 들어오며, 이어서 카메라가 자리를 잡는다 |
| 오디오 | 요리사가 접시에 음식을 담는다 | 요리사가 접시에 음식을 담는 클로즈업, 김이 피어오른다. 오디오: 프라이팬 지글거리는 소리, 부드러운 주방 배경음, ‘주문 들어갑니다’. |
알아둘 설정
| 설정 | 참고 |
|---|---|
| 길이 | 1~15초; 클립당 한 동작만 유지 |
| 해상도 | 480p 또는 720p |
| 화면비 | 입력 이미지를 따르거나 16:9, 9:16, 1:1 중 설정 |
| 레퍼런스 이미지 | 여러 클립에 걸쳐 스타일이나 캐릭터를 유지하려면 추가 |
| 더 긴 시퀀스 | 마지막 프레임에서 이어가려면 비디오 확장을 사용 |
흔한 실수
- 프롬프트를 무음으로 남기기: 최소 하나의 사운드 큐는 항상 적어야 합니다.
- 모호한 카메라: “시네마틱”은 모델에 아무것도 알려주지 않습니다. 샷과 움직임을 지정하세요.
- 한 클립에 너무 많이 담기: 클립당 한 동작만 담고 그다음 확장하세요.
자주 묻는 질문
강력한 16:9 정지 이미지에서 시작하고, 움직임 프롬프트는 짧고 구체적으로 유지하며, 카메라 움직임 하나를 지정하고, 오디오 큐를 항상 포함하세요. 클립당 한 동작을 유지하고 더 긴 시퀀스에는 비디오 확장을 쓰세요.
네. 오디오는 비디오와 함께 네이티브로 생성되며 움직임과 싱크가 유지됩니다. 한 번의 생성에 립싱크된 대사, 효과음, 배경음, 음악까지 별도의 오디오 작업 없이 포함됩니다.
이미지-투-비디오는 이미지와 텍스트 프롬프트를, 텍스트-투-비디오는 텍스트 프롬프트만 받습니다. 레퍼런스 이미지를 넘겨 스타일과 캐릭터를 안내할 수도 있고, 비디오 확장과 편집으로 기존 클립을 이어가거나 수정할 수도 있습니다.
클립은 480p 또는 720p, 24 fps로 1~15초까지 생성됩니다. 이미지-투-비디오에서는 화면비가 입력 이미지를 따르며, 가로형·정사각형·세로형 납품에 맞춰 비율을 직접 설정할 수도 있습니다.
기존 Grok Imagine은 텍스트-투-이미지, 이미지 편집, 여러 비디오 경로를 아우르는 xAI의 크로스모달 모델입니다. Grok Imagine Video 1.5는 이미지-투-비디오에 맞춰 네이티브 동기화 오디오, 립싱크 대사, 비디오 확장을 갖춘 전용 비디오 릴리스입니다.
