VentureBeat 日本語
フォロー
Black Forest Labs、画像と20秒の動画(音声付き)を生成可能なFLUX 3をローンチ — ただし、当初は限定リリース
Black Forest Labsは、単一のプロンプトから最大20秒の画像、音声、ビデオクリップを生成できるマルチモーダルAIモデルであるFLUX 3をリリースしました。この新しいモデルは、アーキテクチャをロボットビジョンとアクションに拡張し、クリエイティブ生成、シミュレーション、ロボティクスを「ビジュアルインテリジェンス」の下で統合することを目指しています。FLUX 3は、Video、Image、Action、およびオープンソースのDevバージョンの4つの製品ラインを通じて提供されます。FLUX 3 VideoとActionの早期アクセスが利用可能になり、FLUX 3 Imageはまもなく展開されます。同社は、FLUX 3のモダリティを横断する共同トレーニングを強調しており、これは個別のコンポーネントから組み立てられたモデルとは一線を画しています。BFLは、FLUX 3が予備的なビデオ生成テストで競合他社を上回ると主張していますが、具体的な価格設定、サービスコミットメント、および包括的なベンチマークはまだ公開されていません。ダウンロード可能なウェイトとオープンソースライセンスは、FLUX 3 Devリリースとともに今年後半に利用可能になります。FLUX 3 Videoは、ネイティブオーディオを備えたテキストからビデオ、画像からビデオ、ビデオからビデオの生成をサポートしています。主な主張される機能は、クリップのエージェンティブな連鎖により数分続くシーケンスを生成し、ビデオの連続性の課題に対処することです。このモデルは、人間の表情や多言語出力にも優れていると報告されています。BFLはまた、ロボットのアクション予測のために、FLUX 3に基づいたビデオアクションモデルであるFLUX-mimicを開発しています。統一されたアーキテクチャは、事前トレーニングされたモーションと行動の理解を活用することで、ロボティクスにおけるデータ効率を向上させることを目指しています。