Black Forest Labs Meluncurkan Flux 3: Lompatan Multimodal dalam Video dan Audio

Black Forest Labs (BFL) telah resmi memasuki garis depan "world models" dengan perilisan Flux 3, sebuah model fondasi multimodal yang dirancang untuk menjembatani kesenjangan antara generasi digital dan kecerdasan fisik. Dengan melatih gambar, video, dan audio secara bersamaan, Flux 3 mencapai tingkat kohesi sensorik yang sulit ditiru oleh model modalitas tunggal tradisional.

Kekuatan Pelatihan Multimodal dan Audio Native

Berbeda dengan generasi model video sebelumnya yang sering kali memerlukan proses terpisah untuk menyinkronkan suara, Flux 3 memperkenalkan pembuatan audio native untuk klip video berdurasi hingga 20 detik. Perkembangan ini berakar pada filosofi BFL bahwa tidak ada satu modalitas pun yang dapat menangkap realitas secara utuh. Jika gambar menyediakan struktur spasial dan video menyediakan perubahan temporal, audio mengungkapkan hubungan kausal antara peristiwa mekanis dan suaranya.

Dengan memanfaatkan transformer multimodal berdasarkan pendekatan "Self-Flow" milik BFL, model ini mengubah gambar, video, audio, dan bahkan tindakan menjadi representasi internal bersama. Pelatihan terpadu ini memungkinkan model untuk mengisi celah informasi—misalnya, menggunakan isyarat audio untuk lebih memahami fisika dari sebuah gerakan visual. Flux 3 mendukung berbagai fitur canggih, termasuk text-to-video, image-to-video, transisi berbasis keyframe, dan bahkan dialog multibahasa.

Benchmarking Flux 3 Terhadap Raksasa Industri

Dalam evaluasi pendahuluan menggunakan klip 10 detik dengan resolusi 720p, Flux 3 menunjukkan keunggulan kompetitif yang signifikan. Dalam uji preferensi pengguna secara langsung (head-to-head), BFL melaporkan bahwa Flux 3 lebih disukai dibandingkan Luma Ray 3.2 dalam 93% perbandingan dan dibandingkan Runway Gen-4.5 dalam 77% kasus.

Meskipun marginnya menyempit terhadap kompetitor elit, Flux 3 tetap mempertahankan keunggulan atas Grok Imagine Video (69%) dan Kling v3 Pro (60%). Model ini juga mengungguli Seedance 2.0 dan Gemini Omni Flash dengan tingkat preferensi 52%. Hasil ini menunjukkan bahwa Flux 3 memposisikan dirinya di tingkat teratas model video generatif, yang mampu bersaing dengan sistem yang sudah terintegrasi dalam alur kerja profesional Hollywood.

Melampaui Pembuatan Konten: Menuju Robotika

Mungkin aspek yang paling ambisius dari Flux 3 adalah langkahnya menuju "kecerdasan visual dunia nyata." BFL tidak hanya membangun alat kreatif; mereka membangun model yang dapat mempersepsikan, memprediksi, dan bertindak. Melalui komponen aksi khusus dalam arsitektur transformernya, model ini sedang digunakan untuk mengembangkan "Flux-mimic," sebuah model video-aksi.

Dalam aplikasi dunia nyata yang berisiko tinggi, BFL telah bermitra dengan Mimic Robotics untuk menguji teknologi ini pada tugas-tugas produksi di Audi. Hal ini menunjukkan bahwa arsitektur dasar Flux 3 dimaksudkan untuk berfungsi sebagai fondasi bagi robotika, di mana memahami hukum fisika dunia sama pentingnya dengan menghasilkan video dengan fidelitas tinggi.

Deployment dan Janji Open-Weight "Flux 3 Dev"

BFL mengadopsi strategi peluncuran bertahap untuk memastikan keamanan dan mengumpulkan umpan balik pengguna. Flux 3 Video saat ini sudah tersedia, dengan Flux 3 Image yang diharapkan akan diluncurkan dalam akses awal dalam beberapa minggu ke depan. Melihat lebih jauh ke depan, BFL telah berkomitmen untuk merilis akses open-weight untuk tulang punggung (backbone) multimodal dengan nama "Flux 3 Dev," sebuah langkah yang kemungkinan besar akan memberdayakan pengembang dan peneliti secara global untuk membangun di atas arsitektur mereka.

Poin-Poin Penting

  • Multimodalitas Native: Flux 3 mengintegrasikan pelatihan gambar, video, dan audio ke dalam satu transformer "Self-Flow", memungkinkan pembuatan video 20 detik dengan audio native yang tersinkronisasi.
  • Performa Tingkat Atas: Dalam pengujian awal, Flux 3 mengungguli rival utamanya termasuk Luma Ray 3.2 (preferensi 93%) dan Runway Gen-4.5 (preferensi 77%).
  • Integrasi Robotika: Model ini menyertakan komponen prediksi-aksi yang saat ini sedang diuji untuk tugas-tugas robotika produksi di Audi melalui Mimic Robotics.