Black Forest Labs запускает FL... Заметка
VentureBeat на русском

Black Forest Labs запускает FLUX 3, способный генерировать изображения и 20-секундные видео со звуком, но пока в ограниченном доступе.

Black Forest Labs выпустила FLUX 3, мультимодальную модель ИИ, способную генерировать изображения, аудио и видеоклипы продолжительностью до 20 секунд по одному запросу. Эта новая модель расширяет свою архитектуру на роботизированное зрение и действия, стремясь объединить творческую генерацию, симуляцию и робототехнику под "визуальным интеллектом". FLUX 3 будет предлагаться через четыре продуктовые линейки: Video, Image, Action и версию с открытым исходным кодом Dev. Ранний доступ к FLUX 3 Video и Action уже открыт, а FLUX 3 Image будет выпущен в ближайшее время.Компания подчеркивает совместное обучение FLUX 3 по всем модальностям, что отличает его от моделей, собранных из отдельных компонентов. Хотя BFL утверждает, что FLUX 3 превосходит конкурентов в предварительных тестах генерации видео, конкретные цены, обязательства по обслуживанию и полные эталонные показатели пока не разглашаются. Загружаемые веса и лицензия с открытым исходным кодом будут доступны позднее в этом году с выпуском FLUX 3 Dev.FLUX 3 Video поддерживает генерацию видео из текста, изображений и видео с нативным аудио. Ключевой заявленной возможностью является агентная цепочка клипов для создания последовательностей продолжительностью в несколько минут, что решает проблемы непрерывности видео. Модель также, как сообщается, преуспевает в передаче человеческих мимики и многоязычном выводе. BFL также разрабатывает FLUX-mimic, модель видео-действий на основе FLUX 3, для прогнозирования действий роботов. Единая архитектура призвана повысить эффективность данных для робототехники за счет использования предварительно обученного понимания движения и поведения.
CdXz5zHNQW_96iaEIVZl6.png