FLUX 3 모델 공개

11 hours ago 4

이미지·비디오·오디오를 하나의 아키텍처에서 함께 학습해 생성·이해·행동 예측을 통합하려는 멀티모달 기반 모델이며, FLUX 3 Video부터 Early Access로 제공됨 이미지의 공간 구조, 비디오의 시간·물리 역학, 오디오의 사건·소리 관계를 상호 제약으로 학습하며, Self-Flow를 기반으로 데이터와 연산 자원을 확장함 네이티브 오디오가 포함된 비디오를 한 번에 최대 20초까지 생성하며, 초기 평가에서 Grok Imagine Video보다 최대 69%, Runway Gen-4.5보다 77%, Luma Ray 3.2보다 93%의 비교에서 선호됨 이미지 합성·편집과 다국어 텍스트 렌더링을 지원하고, 사전 학습된 비디오 백본을 제한된 작업별 데이터로 미세조정해 로봇 행동 모델로 활용할 수 있음 Video·Image·Action과 오픈 가중치 기반 FLUX 3 Dev를 순차 출시하며, 장기적으로 지각·행동·언어 예측을 하나의 모델로 통합하는 것이 목표임 현실을 함께 학습하는 멀티모달 모델 FLUX 3는 이미지·비디오·오디오를 분리된 요소가 아니라, 동일한 현실을 서로 다른 센서로 관측한 결과로 취급함 이미지는 특정 시점의 공간 구조와 관계를 포착함 비디오는 시간 차원을 복원해 움직임, 시간적 역학, 물리 법칙을 드러냄 오디오는 시각만으로 감지하기 어려운 기계적 현상과 음향의 인과관계를 보여줌 언어는 이러한 지각을 목표·추상화·지시와 연결함 여러 양식을 함께 학습하면 소리는 충돌과 일치하고, 움직임은 질량을 따르며, 미래는 과거에서 이어져야 한다는 상호 제약을 활용할 수 있음 FLUX 3는 이러한 원칙만으로 구축한 첫 모델로, 물리·디지털 환경에서 지각하고 예측하며 행동하는 현실 세계의 시각 지능을 지향함 콘텐츠 제작과 물리 AI에서 얻은 초기 결과는 이 접근법의 가능성을 보여줌 Self-Flow 기반 통합 아키텍처 Self-Flow는 하나의 기반 아키텍처에서 멀티모달 생성과 이해를 효율적으로 정렬하는 접근법임 FLUX 3는 Self-Flow를 바탕으로 연산량과 데이터 자원을 크게 확장해 비디오·이미지·오디오를 동시에 학습함 공개 비교에는 양식별 생성 오류를 Flow Matching 기준 100으로 정규화한 Fréchet distance와, 미세조정 후 4개 작업군의 조작 성공률이 사용됨 비디오와 네이티브 오디오 생성 FLUX 3는 한 번의 생성으로 최대 20초 길이의 다양한 비디오와 오디오를 만들 수 있음 지...

Read Entire Article