Flux 3의 기능과 역량
Flux 3는 Black Forest Labs의 멀티모달 파운데이션 모델입니다. 출력마다 별도의 모델을 두는 대신 이미지, 비디오, 오디오를 함께 학습하므로, 단일 프롬프트가 현실 세계처럼 움직이고 소리 나는 샷을 돌려줄 수 있습니다.
Black Forest Labs는 2026년 7월 23일에 Flux 3를 공개했고 얼리 액세스로 배포하고 있습니다. 아래 역량은 이들이 설명한 내용이며, 뒤이어 나오는 프롬프트 지침은 네이티브 오디오 비디오 모델을 위한 일반적인 관행입니다. 정확한 조절 요소는 Flux 3가 널리 제공되면서 구체화될 수 있습니다.
| 기능 | 역할 | 적합한 용도 |
|---|---|---|
| 네이티브 오디오 비디오 | 클립과 동기화된 소리를 한 번의 생성으로 함께 만듭니다 | 사운드 온 장면, 대사, 효과음 |
| 현실 물리 | 움직임이 질량과 관성을 따르고 소리가 충돌과 맞물립니다 | 제품 필름, 액션, 설명 영상 |
| 일관된 캐릭터 | 비주얼 레퍼런스로 샷 전반에 걸쳐 피사체를 유지합니다 | 시퀀스, 시리즈, 브랜드 작업 |
| 다국어 텍스트와 음성 | 정확한 화면 텍스트와 음성 대사를 렌더링합니다 | 현지화 비디오, 타이틀, 자막 |
| 인컨텍스트 편집 | 전체를 다시 렌더링하지 않고 한 요소만 바꿉니다 | 테이크 수정, 부분 수정 |
| 멀티샷 체이닝 | 클립을 이어 더 긴 연속 시퀀스로 연결합니다 | 단편, 광고, 리빌 |
네이티브 오디오 비디오
핵심은 그림과 소리가 함께 도착한다는 것입니다. Flux 3는 각 클립을 동기화된 네이티브 오디오와 함께 같은 생성 과정에서 만들므로, 충돌음, 발소리, 대사가 나중에 덧입혀지는 대신 이미 동작과 연결되어 있습니다. 원하는 소리를 프롬프트에 적고, 장면에 대사가 있으면 언어를 설정하세요.
현실 물리
Flux 3는 움직임, 질량, 소리를 하나의 시스템으로 학습하므로 무게, 관성, 충돌이 실제 규칙을 따르고 카메라가 움직여도 재질이 본연의 룩을 유지합니다. 움직임이 샷 전반에 걸쳐 어떻게 전개되는지 설명하면 물리가 흐트러지지 않고 촬영한 것처럼 읽힙니다.
일관된 캐릭터
명확한 비주얼 레퍼런스를 제공하면 Flux 3는 샷마다 같은 얼굴, 의상, 모습을 이어갑니다. 그 레퍼런스를 컷 전반에 재사용해 몇 분에 이르는 시퀀스 내내 캐릭터를 유지하세요. 이것이 시리즈가 장면마다 초기화되지 않고 알아볼 수 있게 유지되는 비결입니다.
다국어 텍스트와 인컨텍스트 편집
텍스트 렌더링이 이전 Flux보다 크게 향상되어 여러 언어의 정확한 화면 텍스트를 포함하므로, 타이틀 카드가 별도의 작업 없이 제대로 읽힙니다. 편집은 부분적입니다. 프레임의 한 요소를 바꾸거나 소스 클립의 피사체를 새 장면으로 가져오고, 나머지는 그대로 유지됩니다.
Flux 3 활용 사례
네이티브 오디오 장면
클립이 이미 싱크된 소리와 함께 돌아오므로, 나중에 고칠 무음 테이크가 아니라 효과음이나 대사가 동작과 딱 맞물립니다.
제품과 브랜드 필름
카메라가 움직여도 반사, 무게, 재질이 사실적으로 유지되어, 따르기나 회전, 낙하가 시뮬레이션이 아니라 촬영한 것처럼 읽힙니다.
멀티샷 시퀀스
클립을 이어 더 긴 장면을 만들고, 비주얼 레퍼런스로 컷마다 한 캐릭터를 유지해 시퀀스가 일관되게 이어지게 합니다.

현지화 비디오
다국어 대사와 정확한 화면 텍스트 덕분에 한 장면을 별도의 자막·더빙 작업 없이 여러 언어로 납품할 수 있습니다.

이미지 생성과 편집
여러 스타일과 화면비를 넘나들며 합성하고, 선명한 텍스트를 렌더링한 뒤, 이미지 전체를 다시 만들지 않고 한 영역만 그 자리에서 편집하세요.

실제 물리를 갖춘 설명 영상
중력, 충돌, 움직임이 실제 규칙을 따르므로 원리 설명 영상이 깔끔하면서도 정확하게 유지됩니다.
Flux 3 프롬프트 작성법
프롬프트를 캡션이 아니라 짧은 샷 브리프처럼 쓰세요. SPACE를 따라 정리하고, Flux 3는 그림과 함께 소리를 만들므로 항상 오디오 큐 하나를 포함하세요.
| SPACE | 포함할 내용 | 예 |
|---|---|---|
| Subject(피사체) | 화면에 있는 사람이나 사물을 구체적으로 | 빨간 우비를 입은 배달원 |
| Performance(동작) | 움직임: 피사체가 무엇을 어떻게 하는지 | 그녀가 시장 가판대 사이를 헤치고, 입김이 서린다 |
| Ambience(배경) | 배경, 시간대, 빛 | 비에 젖은 밤 시장, 발밑의 젖은 돌바닥 |
| Camera(카메라) | 샷 유형과 움직임 하나 | 로우 트래킹 샷, 안정적인 푸시인 |
| Extra cues(추가 큐) | 오디오, 언어, 페이싱 | 빗소리와 멀리서 들리는 웅성거림, 일본어 대사 한 마디 |
흔한 실수
- 정지 장면 묘사하기. 비디오 모델에는 시간에 따른 움직임이 필요하지, 말로 옮긴 사진 한 장이 아닙니다.
- 소리 잊기. Flux 3는 오디오를 생성하므로 원하는 효과음, 배경음, 대사를 지정하세요.
- 시퀀스를 프롬프트 하나에 몰아넣기. 테이크당 명확한 동작 하나를 유지하고, 길이는 클립을 이어 채우세요.
- 레퍼런스에 라벨 붙이지 않기. 각 레퍼런스가 무엇을 위한 것인지 적어야 모델이 어느 것이 장면을 이끄는지 압니다.
전체 역량 목록과 사양은 Flux 3 모델 페이지를 참고하세요.
