Black Forest Labs Yafunua Flux 3: Hatua Kubwa ya Multimodal katika Video na Sauti
Black Forest Labs (BFL) imeingia rasmi katika upeo wa "world models" kwa kutoa Flux 3, modeli ya msingi ya multimodal iliyoundwa kuziba pengo kati ya uundaji wa kidijitali na akili ya kimwili. Kwa kufundishwa kwa picha, video, na sauti kwa wakati mmoja, Flux 3 inafikia kiwango cha ushirikiano wa hisia ambacho modeli za kawaida za modality moja zinapata shida kuzigaanisha.
Nguvu ya Mafunzo ya Multimodal na Sauti ya Asili
Tofauti na vizazi vilivyopita vya modeli za video ambavyo mara nyingi vinahitaji michakato tofauti ili kuoanisha sauti, Flux 3 inaleta uundaji wa sauti ya asili (native audio) kwa vipande vya video vya hadi sekunde 20. Maendeleo haya yanatokana na falsafa ya BFL kwamba hakuna modality moja inayoweza kunasa uhalisia kwa ukamilifu. Wakati picha zinatoa muundo wa nafasi (spatial structure) na video inatoa mabadiliko ya muda (temporal changes), sauti hufichua uhusiano wa kisababishi kati ya matukio ya kimitambo na sauti zake.
Kwa kutumia multimodal transformer inayozingatia mbinu ya kipekee ya BFL ya "Self-Flow", modeli hii inageuza picha, video, sauti, na hata vitendo kuwa uwakilishi wa ndani wa pamoja. Mafunzo haya yaliyounganishwa yanaruhusu modeli kujaza mapengo ya habari—kwa mfano, kwa kutumia ishara za sauti kuelewa vizuri fizikia ya mwendo wa kuona. Flux 3 inasaidia seti kubwa ya vipengele vya hali ya juu, ikiwa ni pamoja na text-to-video, image-to-video, mabadiliko yanayozingatia keyframe, na hata mazungumzo ya lugha nyingi.
Kulinganisha Flux 3 na Majitu ya Sekta
Katika tathmini za awali kwa kutumia vipande vya sekunde 10 katika azimio la 720p, Flux 3 ilionyesha faida kubwa za ushindani. Katika majaribio ya moja kwa moja ya upendeleo wa watumiaji, BFL iliripoti kuwa Flux 3 ilipendelewa zaidi ya Luma Ray 3.2 katika 93% ya ulinganisho na zaidi ya Runway Gen-4.5 katika 77% ya matukio.
Ingawa tofauti inazidi kuwa ndogo dhidi ya washindani wakubwa, Flux 3 bado imedumisha uongozi dhidi ya Grok Imagine Video (69%) na Kling v3 Pro (60%). Pia ilifanya vizuri zaidi kuliko Seedance 2.0 na Gemini Omni Flash ikiwa na kiwango cha upendeleo cha 52%. Matokeo haya yanaonyesha kuwa Flux 3 inajiweka katika ngazi ya juu kabisa ya modeli za video za uundaji (generative video models), ikiwa na uwezo wa kushindana na mifumo ambayo tayari inatumika katika michakato ya kitaalamu ya Hollywood.
Zaidi ya Uundaji wa Maudhui: Kuelekea kwenye Roboti
Labda kipengele chenye matarajio makubwa zaidi ya Flux 3 ni hatua yake kuelekea "akili ya kuona ya ulimwengu halisi" (real-world visual intelligence). BFL haijengi tu chombo cha ubunifu; wanajenga modeli inayoweza kutambua, kutabiri, na kutenda. Kupitia kipengele maalum cha kitendo (action component) ndani ya usanifu wake wa transformer, modeli hii inatumiwa kuendeleza "Flux-mimic," modeli ya video-action.
Katika matumizi ya ulimwengu halisi yenye umuhimu mkubwa, BFL imeshirikiana na Mimic Robotics ili kujaribu teknolojia hii kwenye kazi za uzalishaji katika Audi. Hii inaonyesha kuwa usanifu wa msingi wa Flux 3 unakusudiwa kutumika kama msingi wa roboti (robotics), ambapo kuelewa sheria za kifizikia za ulimwengu ni muhimu kama vile kuunda video yenye ubora wa juu (high-fidelity video).
Utekelezaji na Ahadi ya "Flux 3 Dev" ya Open-Weight
BFL inachukua mkakati wa utoaji wa hatua kwa hatua ili kuhakikisha usalama na kukusanya maoni ya watumiaji. Flux 3 Video inapatikana sasa, huku Flux 3 Image ikitarajiwa kuzinduliwa kwa ufikiaji wa mapema ndani ya wiki chache zijazo. Kwa kuangalia mbali zaidi, BFL imejitolea kutoa ufikiaji wa open-weight kwa mfumo mkuu wa multimodal chini ya jina la "Flux 3 Dev," hatua ambayo huenda itawawezesha watengenezaji na watafiti duniani kote kujenga juu ya usanifu wao.
Mambo Muhimu ya Kuzingatia
- Multimodality ya Asili: Flux 3 inaunganisha mafunzo ya picha, video, na sauti katika transformer moja ya "Self-Flow", ikiruhusu video za sekunde 20 zenye sauti ya asili iliyosawazishwa.
- Utendaji wa Ngazi ya Juu: Katika majaribio ya awali, Flux 3 ilifanya vizuri zaidi kuliko washindani wakuu wakiwemo Luma Ray 3.2 (upendeleo wa 93%) na Runway Gen-4.5 (upendeleo wa 77%).
- Ujumuishaji wa Roboti: Modeli inajumuisha kipengele cha utabiri wa kitendo kinachojaribiwa sasa kwa kazi za uzalishaji za roboti katika Audi kupitia Mimic Robotics.
