Black Forest Labs 推出 FLUX 3,可生... 笔记

Black Forest Labs 推出 FLUX 3,可生成图像及带音频的 20 秒视频,但初期仅有限发布。

Black Forest Labs 已推出 FLUX 3,这是一款多模态人工智能模型,能够根据单一提示生成图像、音频及长达 20 秒的视频片段。该新模型将其架构扩展至机器人视觉与动作领域,旨在将创意生成、仿真与机器人技术统一于“视觉智能”之下。FLUX 3 将通过四条产品线提供:视频、图像、动作以及开源开发版。FLUX 3 视频与动作的早期访问现已开放,图像版本即将推出。该公司强调 FLUX 3 在多模态上的联合训练,使其区别于由独立组件组装而成的模型。尽管 BFL 声称 FLUX 3 在初步视频生成测试中优于竞争对手,但具体定价、服务承诺及全面基准测试尚未公开。可下载的权重及开源许可证将于今年晚些时候随 FLUX 3 开发版一同发布。FLUX 3 视频支持文本生成视频、图像生成视频及视频生成视频,并原生支持音频。其一项关键宣称能力是通过代理式片段链式生成,产出持续数分钟的视频序列,从而解决视频连贯性挑战。该模型据称在人类面部表情及多语言输出方面表现卓越。BFL 还在开发基于 FLUX 3 的 FLUX-mimic,一款视频 - 动作模型,用于机器人动作预测。该统一架构旨在通过利用预训练的运动与行为理解,提升机器人的数据效率。
CdXz5zHNQW_96iaEIVZl6.png