AI 개발 기업인 Black Forest Labs가, 자체 개발한 AI 모델 ‘FLUX 3’를 발표. FLUX 3는 ‘이미지’, ‘동영상’, ‘음성’ 생성이 가능한 멀티모달 모델이며, 기사 작성 시점에서는 동영상 생성 기능이 얼리 액세스 버전으로 출시되어 있다.

Black Forest Labs가 지금까지 출시한 FLUX.1 시리즈와 FLUX.2 시리즈는, 이미지 생성 및 이미지 편집을 목적으로 한 모델이었는데, 이번에 발표된 FLUX 3는 이미지뿐만 아니라, 음성 및 동영상 입출력도 지원하는 기반 모델로 개발되었으며, 로봇의 행동 예측에도 확장할 수 있다고 한다. 또한 기존 모델과 명명 규칙이 달라 점이 빠져 있는 점도 특징이다.
학습 방식으로는 Black Forest Labs가 개발한 자기 지도 플로우 매칭 프레임워크 ‘Self-Flow’를 채택했으며, 이미지·동영상·음성을 통합 아키텍처 내에서 공동 학습함으로써 ‘물체 간 상호작용’·‘물체의 움직임과 소리의 관계’와 같은 사항을 학습하고 고정밀 출력을 구현한다는 내용.
FLUX 3의 기능 중 동영상 생성 기능이 얼리 액세스 버전으로 출시되었고, 음성을 포함한 최대 20초 길이의 영상을 생성할 수 있으며, ‘텍스트로 영상 생성’, ‘시작 프레임 지정 영상 생성’, ‘참고 이미지로 피사체 지정 영상 생성’, ‘참고 영상의 캐릭터를 삽입해 영상 생성’, ‘영상과 음성을 입력해 이어지는 영상 생성’, ‘키프레임 입력 영상 생성’, ‘여러 영상을 연결’ 등 다양한 워크플로우를 지원한다.
‘720p에 음성 포함 10초짜리 동영상’을 생성해 사람에게 평가하게 한 결과는 다음과 같다. FLUX 3은 Grok Imagine Video에 대해 승률 69%, Seedance 2.0에 대해, 승률 52%, Gemini Omni Flash에 대해 승률 52%라는 성적을 보였으며, FLUX 3 하네스에는 개선 여지가 있어, 추가적인 성능 향상이 기대된다.
Black Forest Labs는 FLUX 3으로 만든 이미지 예시도 올리고 있는데, FLUX 3는 다양한 스타일·비율·해상도로 이미지를 생성하거나 편집할 수 있다. 학습 단계에서 실시된 예비 평가에서는 기존 FLUX 시리즈에 비해 큰 개선을 보였다고 하고, 구체적으로는 복잡한 프롬프트 처리 능력과 다중 언어 텍스트 렌더링 성능이 향상된 것으로 알려졌다. 이미지 생성 기능은 몇 주 안에 얼리 액세스 버전이 출시될 예정이다.

또한, Black Forest Labs는 Mimic Robotics와 협력해 FLUX 3을 로봇 행동 예측 모델로 활용하는 연구도 진행하고 있다.
Black Forest Labs는 앞으로 몇 주에서 몇 달에 걸쳐 다음과 같은 전개를 진행할 예정이며, 또한 이미 차세대 모델 개발도 시작했다고 한다.
- FLUX 3 Video: API 및 프라이빗 웨이트 접근을 통한 동영상·음성
- FLUX-mimic 및 FLUX 3 Action: 엄선된 연구기관 및 상업 파트너와의 협업을 통한 로봇 행동 예측
- FLUX 3 Image: API 및 프라이빗 웨이트 접근을 통한 이미지 생성·편집
- FLUX 3 Dev: 동영상·음성·이미지·행동 예측을 위한 멀티모달 모델 백본에 대한 오픈 액세스



