Black Forest LabsがFlux 3を発表:ビデオとオーディオにおけるマルチモーダルな飛躍

Black Forest Labs (BFL) は、デジタル生成と物理的知能の間の溝を埋めるために設計されたマルチモーダル基盤モデル「Flux 3」のリリースにより、「ワールドモデル」の最前線に正式に参入しました。画像、ビデオ、オーディオを同時に学習させることで、Flux 3は従来のシングルモーダルモデルでは再現が困難であったレベルの感覚的な一貫性を実現しています。

マルチモーダル学習とネイティブオーディオの力

音声を同期させるために別個のプロセスを必要とすることが多かった従来のビデオモデルとは異なり、Flux 3は最大20秒間のビデオクリップに対してネイティブなオーディオ生成を導入しています。この開発は、「単一のモダリティでは現実を完全には捉えられない」というBFLの哲学に基づいています。画像が空間的な構造を提供し、ビデオが時間的な変化を提供する一方で、オーディオは機械的な事象とその音の間の因果関係を明らかにします。

BFL独自の「Self-Flow」アプローチに基づいたマルチモーダル・トランスフォーマーを活用することで、このモデルは画像、ビデオ、オーディオ、さらにはアクション(動作)までもが共有された内部表現へと変換されます。この統合された学習により、モデルは情報のギャップを埋めることが可能になります。例えば、オーディオの手がかりを使用して、視覚的な動きの物理法則をより深く理解するといったことが可能です。Flux 3は、text-to-video、image-to-video、キーフレームベースのトランジション、さらには多言語対話など、幅広い高度な機能をサポートしています。

業界の巨人たちとのFlux 3ベンチマーク比較

720p解像度の10秒間のクリップを使用した予備評価において、Flux 3は顕著な競争優位性を示しました。ユーザーの好みを直接比較するテストにおいて、BFLは、Flux 3がLuma Ray 3.2に対して93%、Runway Gen-4.5に対して77%の割合で選好されたと報告しています。

エリート競合他社との差は縮まっているものの、Flux 3は依然としてGrok Imagine Video (69%) や Kling v3 Pro (60%) をリードしています。また、52%の選好率で Seedance 2.0 や Gemini Omni Flash も上回りました。これらの結果は、Flux 3が生成ビデオモデルの最上位層に位置しており、すでにハリウッドのプロフェッショナルなワークフローに統合され始めているシステムとも競合できる能力を持っていることを示唆しています。

コンテンツ制作を超えて:ロボティクスへの展開

Flux 3の最も野心的な側面は、「現実世界の視覚的知能」への移行かもしれません。BFLは単なるクリエイティブツールを構築しているのではなく、知覚し、予測し、行動できるモデルを構築しています。トランスフォーマー・アーキテクチャ内の専用のアクション・コンポーネントを通じて、このモデルはビデオ・アクション・モデルである「Flux-mimic」の開発に使用されています。

極めて重要な実世界のアプリケーションとして、BFLは Mimic Robotics と提携し、Audi の製造タスクにおいてこの技術のテストを行っています。これは、Flux 3 の基盤となるアーキテクチャが、高精細なビデオを生成することと同じくらい世界の物理法則を理解することが重要となるロボティクスの基盤として機能することを意図していることを示しています。

デプロイメントと「Flux 3 Dev」のオープンウェイトの約束

BFLは、安全性を確保しユーザーのフィードバックを収集するために、段階的なロールアウト戦略を採用しています。現在 Flux 3 Video が利用可能であり、Flux 3 Image は数週間以内にアーリーアクセスが開始される予定です。さらに先を見据えて、BFLはマルチモーダルなバックボーンを「Flux 3 Dev」という名称でオープンウェイトとして公開することを約束しており、この動きは世界中の開発者や研究者が同社のアーキテクチャを活用して新たな構築を行うことを可能にするでしょう。

主なポイント

  • ネイティブなマルチモダリティ: Flux 3 は画像、ビデオ、オーディオの学習を単一の「Self-Flow」トランスフォーマーに統合し、同期されたネイティブオーディオを備えた20秒間のビデオを可能にします。
  • トップティアのパフォーマンス: 初期のテストにおいて、Flux 3 は Luma Ray 3.2 (選好率93%) や Runway Gen-4.5 (選好率77%) を含む主要なライバルを上回りました。
  • ロボティクスへの統合: このモデルにはアクション予測コンポーネントが含まれており、現在は Mimic Robotics を通じて Audi の製造ロボティクス・タスク向けにテストされています。