Flux 3 완벽 가이드: 기능, 프롬프트, 네이티브 오디오 비디오

Flux 3 완벽 가이드: 기능, 프롬프트, 네이티브 오디오 비디오

Flux 3 완벽 가이드: 멀티모달 월드 모델, 네이티브 오디오 비디오, 물리를 따르는 움직임, 일관된 캐릭터, 인컨텍스트 편집, 그리고 프롬프트 예시까지.

Flux 3의 기능과 역량

Flux 3는 Black Forest Labs의 멀티모달 파운데이션 모델입니다. 출력마다 별도의 모델을 두는 대신 이미지, 비디오, 오디오를 함께 학습하므로, 단일 프롬프트가 현실 세계처럼 움직이고 소리 나는 샷을 돌려줄 수 있습니다.

Black Forest Labs는 2026년 7월 23일에 Flux 3를 공개했고 얼리 액세스로 배포하고 있습니다. 아래 역량은 이들이 설명한 내용이며, 뒤이어 나오는 프롬프트 지침은 네이티브 오디오 비디오 모델을 위한 일반적인 관행입니다. 정확한 조절 요소는 Flux 3가 널리 제공되면서 구체화될 수 있습니다.

기능역할적합한 용도
네이티브 오디오 비디오클립과 동기화된 소리를 한 번의 생성으로 함께 만듭니다사운드 온 장면, 대사, 효과음
현실 물리움직임이 질량과 관성을 따르고 소리가 충돌과 맞물립니다제품 필름, 액션, 설명 영상
일관된 캐릭터비주얼 레퍼런스로 샷 전반에 걸쳐 피사체를 유지합니다시퀀스, 시리즈, 브랜드 작업
다국어 텍스트와 음성정확한 화면 텍스트와 음성 대사를 렌더링합니다현지화 비디오, 타이틀, 자막
인컨텍스트 편집전체를 다시 렌더링하지 않고 한 요소만 바꿉니다테이크 수정, 부분 수정
멀티샷 체이닝클립을 이어 더 긴 연속 시퀀스로 연결합니다단편, 광고, 리빌

네이티브 오디오 비디오

핵심은 그림과 소리가 함께 도착한다는 것입니다. Flux 3는 각 클립을 동기화된 네이티브 오디오와 함께 같은 생성 과정에서 만들므로, 충돌음, 발소리, 대사가 나중에 덧입혀지는 대신 이미 동작과 연결되어 있습니다. 원하는 소리를 프롬프트에 적고, 장면에 대사가 있으면 언어를 설정하세요.

현실 물리

Flux 3는 움직임, 질량, 소리를 하나의 시스템으로 학습하므로 무게, 관성, 충돌이 실제 규칙을 따르고 카메라가 움직여도 재질이 본연의 룩을 유지합니다. 움직임이 샷 전반에 걸쳐 어떻게 전개되는지 설명하면 물리가 흐트러지지 않고 촬영한 것처럼 읽힙니다.

일관된 캐릭터

명확한 비주얼 레퍼런스를 제공하면 Flux 3는 샷마다 같은 얼굴, 의상, 모습을 이어갑니다. 그 레퍼런스를 컷 전반에 재사용해 몇 분에 이르는 시퀀스 내내 캐릭터를 유지하세요. 이것이 시리즈가 장면마다 초기화되지 않고 알아볼 수 있게 유지되는 비결입니다.

다국어 텍스트와 인컨텍스트 편집

텍스트 렌더링이 이전 Flux보다 크게 향상되어 여러 언어의 정확한 화면 텍스트를 포함하므로, 타이틀 카드가 별도의 작업 없이 제대로 읽힙니다. 편집은 부분적입니다. 프레임의 한 요소를 바꾸거나 소스 클립의 피사체를 새 장면으로 가져오고, 나머지는 그대로 유지됩니다.

Flux 3 활용 사례

네이티브 오디오 장면

클립이 이미 싱크된 소리와 함께 돌아오므로, 나중에 고칠 무음 테이크가 아니라 효과음이나 대사가 동작과 딱 맞물립니다.

제품과 브랜드 필름

카메라가 움직여도 반사, 무게, 재질이 사실적으로 유지되어, 따르기나 회전, 낙하가 시뮬레이션이 아니라 촬영한 것처럼 읽힙니다.

멀티샷 시퀀스

클립을 이어 더 긴 장면을 만들고, 비주얼 레퍼런스로 컷마다 한 캐릭터를 유지해 시퀀스가 일관되게 이어지게 합니다.

세 장면에 걸쳐 일관되게 유지된 같은 빨간 머리 여성

현지화 비디오

다국어 대사와 정확한 화면 텍스트 덕분에 한 장면을 별도의 자막·더빙 작업 없이 여러 언어로 납품할 수 있습니다.

영어와 한국어로 같은 문구가 적힌 방송용 하단 자막

이미지 생성과 편집

여러 스타일과 화면비를 넘나들며 합성하고, 선명한 텍스트를 렌더링한 뒤, 이미지 전체를 다시 만들지 않고 한 영역만 그 자리에서 편집하세요.

배경만 바뀐 인물 사진의 전후 비교

실제 물리를 갖춘 설명 영상

중력, 충돌, 움직임이 실제 규칙을 따르므로 원리 설명 영상이 깔끔하면서도 정확하게 유지됩니다.

Flux 3 프롬프트 작성법

프롬프트를 캡션이 아니라 짧은 샷 브리프처럼 쓰세요. SPACE를 따라 정리하고, Flux 3는 그림과 함께 소리를 만들므로 항상 오디오 큐 하나를 포함하세요.

SPACE포함할 내용
Subject(피사체)화면에 있는 사람이나 사물을 구체적으로빨간 우비를 입은 배달원
Performance(동작)움직임: 피사체가 무엇을 어떻게 하는지그녀가 시장 가판대 사이를 헤치고, 입김이 서린다
Ambience(배경)배경, 시간대, 빛비에 젖은 밤 시장, 발밑의 젖은 돌바닥
Camera(카메라)샷 유형과 움직임 하나로우 트래킹 샷, 안정적인 푸시인
Extra cues(추가 큐)오디오, 언어, 페이싱빗소리와 멀리서 들리는 웅성거림, 일본어 대사 한 마디

흔한 실수

  • 정지 장면 묘사하기. 비디오 모델에는 시간에 따른 움직임이 필요하지, 말로 옮긴 사진 한 장이 아닙니다.
  • 소리 잊기. Flux 3는 오디오를 생성하므로 원하는 효과음, 배경음, 대사를 지정하세요.
  • 시퀀스를 프롬프트 하나에 몰아넣기. 테이크당 명확한 동작 하나를 유지하고, 길이는 클립을 이어 채우세요.
  • 레퍼런스에 라벨 붙이지 않기. 각 레퍼런스가 무엇을 위한 것인지 적어야 모델이 어느 것이 장면을 이끄는지 압니다.

전체 역량 목록과 사양은 Flux 3 모델 페이지를 참고하세요.

자주 묻는 질문

좋은 Flux 3 프롬프트는 어떻게 쓰나요?
캡션이 아니라 짧은 샷 브리프처럼 쓰세요. 피사체, 움직임, 배경과 빛, 카메라, 그리고 오디오 큐 하나를 지정하세요. Flux 3는 그림과 함께 소리를 생성하므로 샷이 어떻게 들려야 하는지 적고, 정지된 한 프레임이 아니라 움직임이 시간에 따라 어떻게 전개되는지 설명하세요.
Flux 3는 비디오와 함께 오디오도 생성하나요?
네. 모든 Flux 3 클립은 같은 생성 과정에서 만들어진 네이티브 오디오와 함께 돌아오므로, 충돌음, 발소리, 배경음, 대사가 이미 동작과 싱크되어 있습니다. 원하는 소리를 프롬프트에 적고, 대사가 있는 장면에는 언어를 추가하세요. Flux 3는 다국어 음성을 처리합니다.
Flux 3 비디오는 얼마나 길 수 있나요?
Flux 3는 한 번의 생성으로 최대 20초를 만듭니다. 더 긴 작품에는 클립을 이어 멀티샷 시퀀스를 구성하고 같은 비주얼 레퍼런스를 재사용해, 몇 분에 이르는 장면에서도 캐릭터를 일관되게 유지하세요.
Flux 3에서 캐릭터를 일관되게 유지하려면?
피사체에 대한 명확한 비주얼 레퍼런스를 첨부하고 샷마다 재사용하세요. Flux 3는 컷을 넘나들며 같은 얼굴, 의상, 모습을 유지하며, 이것이 시퀀스가 장면마다 흐트러지지 않고 알아볼 수 있게 유지되는 비결입니다.
Flux 3는 이미지나 클립을 다시 만들지 않고 편집할 수 있나요?
네. Flux 3는 이미지와 비디오 모두에 인컨텍스트 편집을 지원합니다. 한 요소만 바꾸면 프레임의 나머지는 그대로 있고, 소스 클립의 피사체를 새 장면으로 가져올 수도 있습니다. 전체를 다시 만드는 것보다 빠르고, 이미 마음에 드는 테이크를 그대로 살립니다.
Flux 3는 어떻게 사용하나요?
샷을 짧은 브리프로 쓰되 피사체, 움직임, 카메라, 오디오 큐 하나를 지정하세요. 일관되게 유지해야 하는 캐릭터, 제품, 세트가 있으면 레퍼런스 이미지를 첨부하세요. 프롬프트를 실행한 뒤, 남길 결과를 인컨텍스트 편집으로 다듬거나 클립을 이어 더 긴 시퀀스로 만드세요.