Black Forest Labs prezentuje Flux 3: Multimodalny skok w dziedzinie wideo i audio
Black Forest Labs (BFL) oficjalnie wkroczyło na front „modeli świata” (world models) wraz z wydaniem Flux 3 – multimodalnego modelu bazowego, zaprojektowanego, aby zasypać przepaść między generowaniem cyfrowym a inteligencją fizyczną. Dzięki jednoczesnemu trenowaniu na obrazach, wideo i dźwięku, Flux 3 osiąga poziom spójności sensorycznej, którego tradycyjne modele jednomodalne nie są w stanie powtórzyć.
Potęga trenowania multimodalnego i natywnego audio
W przeciwieństwie do poprzednich generacji modeli wideo, które często wymagają oddzielnych procesów synchronizacji dźwięku, Flux 3 wprowadza natywną generację audio dla klipów wideo o długości do 20 sekund. Rozwój ten wynika z filozofii BFL, według której żadna pojedyncza modalność nie jest w stanie w pełni oddać rzeczywistości. Podczas gdy obrazy zapewniają strukturę przestrzenną, a wideo zmiany czasowe, audio ujawnia związki przyczynowo-skutkowe między zdarzeniami mechanicznymi a ich dźwiękiem.
Wykorzystując multimodalny transformer oparty na zastrzeżonym podejściu „Self-Flow” firmy BFL, model przekształca obrazy, wideo, audio, a nawet działania w wspólną reprezentację wewnętrzną. To ujednolicone trenowanie pozwala modelowi wypełniać luki informacyjne – na przykład, wykorzystując wskazówki dźwiękowe do lepszego zrozumienia fizyki ruchu wizualnego. Flux 3 obsługuje szeroki wachlarz zaawansowanych funkcji, w tym text-to-video, image-to-video, przejścia oparte na klatkach kluczowych (keyframe-based transitions), a nawet wielojęzyczne dialogi.
Porównanie Flux 3 z gigantami branży
W wstępnych ocenach z wykorzystaniem 10-sekundowych klipów w rozdzielczości 720p, Flux 3 wykazał znaczące przewagi konkurencyjne. W bezpośrednich testach preferencji użytkowników, BFL poinformowało, że Flux 3 był wybierany zamiast Luma Ray 3.2 w 93% porównań oraz zamiast Runway Gen-4.5 w 77% przypadków.
Choć różnice względem elitarnych konkurentów się zmniejszają, Flux 3 wciąż utrzymuje przewagę nad Grok Imagine Video (69%) i Kling v3 Pro (60%). Model ten pokonał również Seedance 2.0 oraz Gemini Omni Flash, osiągając 52% wskaźnik preferencji. Wyniki te sugerują, że Flux 3 pozycjonuje się w ścisłej czołówce modeli generatywnego wideo, zdolnych do rywalizacji z systemami, które są już integrowane z profesjonalnymi procesami pracy w Hollywood.
Poza tworzenie treści: Kierunek robotyka
Być może najbardziej ambitnym aspektem Flux 3 jest jego dążenie do „wizualnej inteligencji świata rzeczywistego”. BFL nie buduje jedynie narzędzia kreatywnego; tworzą model, który potrafi postrzegać, przewidywać i działać. Dzięki dedykowanemu komponentowi akcji wewnątrz architektury transformera, model jest wykorzystywany do rozwoju „Flux-mimic” – modelu wideo-akcji.
W ramach wymagającego zastosowania w świecie rzeczywistym, BFL nawiązało współpracę z Mimic Robotics, aby przetestować tę technologię w zadaniach produkcyjnych w Audi. Wskazuje to, że podstawowa architektura Flux 3 ma służyć jako fundament dla robotyki, gdzie zrozumienie praw fizyki świata jest równie ważne, co generowanie wysokiej jakości wideo.
Wdrożenie i obietnica otwartych wag „Flux 3 Dev”
BFL przyjmuje strategię etapowego wdrażania, aby zapewnić bezpieczeństwo i zbierać opinie użytkowników. Flux 3 Video jest obecnie dostępne, a premiera Flux 3 Image w wersji wczesnego dostępu (early access) spodziewana jest w ciągu najbliższych kilku tygodni. Patrząc dalej w przyszłość, BFL zobowiązało się do udostępnienia dostępu do multimodalnego szkieletu (backbone) w modelu o otwartych wagach pod nazwą „Flux 3 Dev” – ruch ten prawdopodobnie umożliwi programistom i badaczom na całym świecie budowanie rozwiązań w oparciu o ich architekturę.
Kluczowe wnioski
- Natywna multimodalność: Flux 3 integruje trenowanie obrazu, wideo i audio w ramach jednego transformera „Self-Flow”, umożliwiając tworzenie 20-sekundowych filmów z zsynchronizowanym natywnym dźwiękiem.
- Wydajność na najwyższym poziomie: W wczesnych testach Flux 3 przewyższył głównych rywali, w tym Luma Ray 3.2 (93% preferencji) i Runway Gen-4.5 (77% preferencji).
- Integracja z robotyką: Model zawiera komponent przewidywania akcji, który jest obecnie testowany do zadań produkcyjnej robotyki w Audi za pośrednictwem Mimic Robotics.
