Black Forest Labs, 이미지 및 오디오를 ... 노트

Black Forest Labs, 이미지 및 오디오를 포함한 20초 분량의 비디오 생성이 가능한 FLUX 3 출시 — 초기에는 제한적 출시

Black Forest Labs는 단일 프롬프트에서 최대 20초 길이의 이미지, 오디오 및 비디오 클립을 생성할 수 있는 멀티모달 AI 모델인 FLUX 3를 출시했습니다. 이 새로운 모델은 로봇 비전 및 동작으로 아키텍처를 확장하여 "시각 지능" 하에 창의적 생성, 시뮬레이션 및 로보틱스를 통합하는 것을 목표로 합니다. FLUX 3는 Video, Image, Action 및 오픈 소스 Dev 버전의 네 가지 제품 라인을 통해 제공될 예정입니다. FLUX 3 Video 및 Action에 대한 조기 액세스가 현재 가능하며, FLUX 3 Image는 곧 출시될 예정입니다.이 회사는 FLUX 3가 여러 모달리티에 걸쳐 공동으로 훈련되었으며, 이는 별도의 구성 요소에서 조립된 모델과 차별화된다고 강조합니다. BFL은 FLUX 3가 예비 비디오 생성 테스트에서 경쟁사보다 우수하다고 주장하지만, 구체적인 가격, 서비스 약정 및 포괄적인 벤치마크는 아직 공개되지 않았습니다. 다운로드 가능한 가중치와 오픈 소스 라이선스는 올해 말 FLUX 3 Dev 릴리스와 함께 제공될 예정입니다.FLUX 3 Video는 텍스트-투-비디오, 이미지-투-비디오 및 비디오-투-비디오 생성을 네이티브 오디오와 함께 지원합니다. 주요 주장된 기능은 클립의 에이전트 체이닝을 통해 몇 분 길이의 시퀀스를 생성하여 비디오 연속성 문제를 해결하는 것입니다. 이 모델은 또한 인간의 표정과 다국어 출력에 뛰어나다고 보고되었습니다. BFL은 또한 로봇 동작 예측을 위해 FLUX 3를 기반으로 하는 비디오-동작 모델인 FLUX-mimic을 개발하고 있습니다. 통합 아키텍처는 사전 훈련된 모션 및 동작 이해를 활용하여 로보틱스의 데이터 효율성을 개선하는 것을 목표로 합니다.
CdXz5zHNQW_96iaEIVZl6.png