Black Forest Labs ਨੇ Flux 3 ਨੂੰ ਪੇਸ਼ ਕੀਤਾ: ਵੀਡੀਓ ਅਤੇ ਆਡੀਓ ਵਿੱਚ ਇੱਕ ਮਲਟੀਮੋਡਲ ਕਦਮ
Black Forest Labs (BFL) ਨੇ Flux 3 ਦੀ ਰਿਲੀਜ਼ ਨਾਲ ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ "world models" ਦੇ ਖੇਤਰ ਵਿੱਚ ਪ੍ਰਵੇਸ਼ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਮਲਟੀਮੋਡਲ ਫਾਊਂਡੇਸ਼ਨ ਮਾਡਲ ਹੈ। ਇਸ ਨੂੰ ਡਿਜੀਟਲ ਜਨਰੇਸ਼ਨ ਅਤੇ ਭੌਤਿਕ ਬੁੱਧੀ (physical intelligence) ਵਿਚਕਾਰਲੇ ਪਾੜੇ ਨੂੰ ਪੂਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ। ਤਸਵੀਰਾਂ, ਵੀਡੀਓ ਅਤੇ ਆਡੀਓ 'ਤੇ ਇੱਕੋ ਸਮੇਂ ਟ੍ਰੇਨਿੰਗ ਦੇ ਕੇ, Flux 3 ਸੰਵੇਦੀ ਇਕਜੁੱਟਤਾ (sensory cohesion) ਦਾ ਇੱਕ ਅਜਿਹਾ ਪੱਧਰ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ ਜਿਸਦੀ ਨਕਲ ਕਰਨਾ ਰਵਾਇਤੀ ਸਿੰਗਲ-ਮੋਡੈਲਿਟੀ ਮਾਡਲਾਂ ਲਈ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ।
ਮਲਟੀਮੋਡਲ ਟ੍ਰੇਨਿੰਗ ਅਤੇ ਨੇਟਿਵ ਆਡੀਓ ਦੀ ਸ਼ਕਤੀ
ਵੀਡੀਓ ਮਾਡਲਾਂ ਦੀਆਂ ਪਿਛਲੀਆਂ ਪੀੜ੍ਹੀਆਂ ਦੇ ਉਲਟ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਅਕਸਰ ਆਵਾਜ਼ ਨੂੰ ਸਿੰਕ ਕਰਨ ਲਈ ਵੱਖ-ਵੱਖ ਪ੍ਰਕਿਰਿਆਵਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, Flux 3 20 ਸੈਕਿੰਡ ਤੱਕ ਦੇ ਵੀਡੀਓ ਕਲਿੱਪਾਂ ਲਈ ਨੇਟਿਵ ਆਡੀਓ ਜਨਰੇਸ਼ਨ ਪੇਸ਼ ਕਰਦਾ ਹੈ। ਇਹ ਵਿਕਾਸ BFL ਦੇ ਇਸ ਫਲਸਫੇ 'ਤੇ ਅਧਾਰਤ ਹੈ ਕਿ ਕੋਈ ਵੀ ਸਿੰਗਲ ਮੋਡੈਲਿਟੀ ਅਸਲੀਅਤ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਕੈਪਚਰ ਨਹੀਂ ਕਰ ਸਕਦੀ। ਜਿੱਥੇ ਤਸਵੀਰਾਂ ਸਪੇਸ਼ੀਅਲ (spatial) ਢਾਂਚਾ ਪ੍ਰਦਾਨ ਕਰਦੀਆਂ ਹਨ ਅਤੇ ਵੀਡੀਓ ਸਮੇਂ ਦੇ ਅਨੁਸਾਰ ਬਦਲਾਅ (temporal changes) ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ, ਉੱਥੇ ਆਡੀਓ ਮਕੈਨੀਕਲ ਘਟਨਾਵਾਂ ਅਤੇ ਉਹਨਾਂ ਦੀਆਂ ਆਵਾਜ਼ਾਂ ਵਿਚਕਾਰ ਕਾਰਨ-ਪ੍ਰਭਾਵ ਦੇ ਸਬੰਧਾਂ ਨੂੰ ਪ੍ਰਗਟ ਕਰਦੀ ਹੈ।
BFL ਦੇ ਆਪਣੀ ਮਲਕੀਅਤ ਵਾਲੇ "Self-Flow" ਪਹੁੰਚ 'ਤੇ ਅਧਾਰਤ ਮਲਟੀਮੋਡਲ ਟ੍ਰਾਂਸਫਾਰਮਰ ਦੀ ਵਰਤੋਂ ਕਰਕੇ, ਇਹ ਮਾਡਲ ਤਸਵੀਰਾਂ, ਵੀਡੀਓ, ਆਡੀਓ ਅਤੇ ਇੱਥੋਂ ਤੱਕ ਕਿ ਐਕਸ਼ਨਾਂ ਨੂੰ ਇੱਕ ਸਾਂਝੇ ਅੰਦਰੂਨੀ ਰੂਪ (internal representation) ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਇਹ ਇਕਜੁੱਟ ਟ੍ਰੇਨਿੰਗ ਮਾਡਲ ਨੂੰ ਜਾਣਕਾਰੀ ਦੀਆਂ ਕਮੀਆਂ ਨੂੰ ਪੂਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ—ਉਦਾਹਰਨ ਲਈ, ਕਿਸੇ ਵਿਜ਼ੂਅਲ ਹਰਕਤ ਦੇ ਭੌਤਿਕ ਵਿਗਿਆਨ (physics) ਨੂੰ ਬਿਹਤਰ ਤਰੀਕੇ ਨਾਲ ਸਮਝਣ ਲਈ ਆਡੀਓ ਸੰਕੇਤਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨਾ। Flux 3 ਕਈ ਉੱਨਤ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ text-to-video, image-to-video, keyframe-ਅਧਾਰਤ ਟ੍ਰਾਂਜ਼ੀਸ਼ਨਾਂ, ਅਤੇ ਬਹੁ-ਭਾਸ਼ਾਈ ਸੰਵਾਦ ਵੀ ਸ਼ਾਮਲ ਹਨ।
ਉਦਯੋਗ ਦੇ ਦਿੱਗਜਾਂ ਦੇ ਵਿਰੁੱਧ Flux 3 ਦੀ ਤੁਲਨਾ
720p ਰੈਜ਼ੋਲਿਊਸ਼ਨ 'ਤੇ 10-ਸੈਕਿੰਡ ਦੇ ਕਲਿੱਪਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਸ਼ੁਰੂਆਤੀ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ, Flux 3 ਨੇ ਮਹੱਤਵਪੂਰਨ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦੇ ਫਾਇਦੇ ਦਿਖਾਏ। ਸਿੱਧੇ ਮੁਕਾਬਲੇ ਵਾਲੇ ਯੂਜ਼ਰ ਪ੍ਰੇਫਰੈਂਸ ਟੈਸਟਾਂ ਵਿੱਚ, BFL ਨੇ ਰਿਪੋਰਟ ਦਿੱਤੀ ਕਿ 93% ਤੁਲਨਾਵਾਂ ਵਿੱਚ Luma Ray 3.2 ਦੇ ਉੱਤੇ ਅਤੇ 77% ਮਾਮਲਿਆਂ ਵਿੱਚ Runway Gen-4.5 ਦੇ ਉੱਤੇ Flux 3 ਨੂੰ ਪਸੰਦ ਕੀਤਾ ਗਿਆ।
ਹਾਲਾਂਕਿ ਉੱਤਮ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਦੇ ਵਿਰੁੱਧ ਫਰਕ ਘੱਟ ਗਿਆ ਹੈ, ਫਿਰ ਵੀ Flux 3 ਨੇ Grok Imagine Video (69%) ਅਤੇ Kling v3 Pro (60%) ਦੇ ਉੱਪਰ ਆਪਣੀ ਲੀਡ ਬਣਾਈ ਰੱਖੀ। ਇਸ ਨੇ 52% ਪ੍ਰੇਫਰੈਂਸ ਰੇਟ ਦੇ ਨਾਲ Seedance 2.0 ਅਤੇ Gemini Omni Flash ਨੂੰ ਵੀ ਪਛਾੜ ਦਿੱਤਾ। ਇਹ ਨਤੀਜੇ ਸੁਝਾਉਂਦੇ ਹਨ ਕਿ Flux 3 ਆਪਣੇ ਆਪ ਨੂੰ ਜਨਰੇਟਿਵ ਵੀਡੀਓ ਮਾਡਲਾਂ ਦੇ ਸਭ ਤੋਂ ਉੱਚ ਪੱਧਰ 'ਤੇ ਸਥਾਪਿਤ ਕਰ ਰਿਹਾ ਹੈ, ਜੋ ਕਿ ਪਹਿਲਾਂ ਹੀ ਪੇਸ਼ੇਵਰ ਹਾਲੀਵੁੱਡ ਵਰਕਫਲੋ ਵਿੱਚ ਵਰਤੇ ਜਾ ਰਹੇ ਸਿਸਟਮਾਂ ਨਾਲ ਮੁਕਾਬਲਾ ਕਰਨ ਦੇ ਯੋਗ ਹੈ।
ਕੰਟੈਂਟ ਕ੍ਰਿਏਸ਼ਨ ਤੋਂ ਪਰੇ: ਰੋਬੋਟਿਕਸ ਵੱਲ ਵਧਦੇ ਕਦਮ
ਸ਼ਾਇਦ Flux 3 ਦਾ ਸਭ ਤੋਂ ਅਭਿਲਾਸ਼ੀ ਪਹਿਲੂ "real-world visual intelligence" ਵੱਲ ਇਸਦਾ ਵਧਣਾ ਹੈ। BFL ਸਿਰਫ਼ ਇੱਕ ਰਚਨਾਤਮਕ ਟੂਲ ਨਹੀਂ ਬਣਾ ਰਿਹਾ; ਉਹ ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਬਣਾ ਰਹੇ ਹਨ ਜੋ ਮਹਿਸੂਸ ਕਰ ਸਕਦਾ ਹੈ, ਭਵਿੱਖਬਾਣੀ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ। ਆਪਣੇ ਟ੍ਰਾਂਸਫਾਰਮਰ ਆਰਕੀਟੈਕਚਰ ਦੇ ਅੰਦਰ ਇੱਕ ਸਮਰਪਿਤ ਐਕਸ਼ਨ ਕੰਪੋਨੈਂਟ ਰਾਹੀਂ, ਇਸ ਮਾਡਲ ਦੀ ਵਰਤੋਂ "Flux-mimic" ਵਿਕਸਿਤ ਕਰਨ ਲਈ ਕੀਤੀ ਜਾ ਰਹੀ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਵੀਡੀਓ-ਐਕਸ਼ਨ ਮਾਡਲ ਹੈ।
ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ, BFL ਨੇ Audi ਵਿਖੇ ਪ੍ਰੋਡਕਸ਼ਨ ਕੰਮਾਂ 'ਤੇ ਇਸ ਤਕਨਾਲੋਜੀ ਦਾ ਟੈਸਟ ਕਰਨ ਲਈ Mimic Robotics ਨਾਲ ਭਾਈਵਾਲੀ ਕੀਤੀ ਹੈ। ਇਹ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਕਿ Flux 3 ਦੀ ਅੰਡਰਲਾਈਨ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਰੋਬੋਟਿਕਸ ਲਈ ਇੱਕ ਬੁਨਿਆਦ ਵਜੋਂ ਕੰਮ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ, ਜਿੱਥੇ ਦੁਨੀਆ ਦੇ ਭੌਤਿਕ ਨਿਯਮਾਂ ਨੂੰ ਸਮਝਣਾ ਇੱਕ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੀ ਵੀਡੀਓ ਤਿਆਰ ਕਰਨ ਜਿੰਨਾ ਹੀ ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਡਿਪਲਾਈਮੈਂਟ ਅਤੇ "Flux 3 Dev" ਓਪਨ-ਵੇਟ ਦਾ ਵਾਅਦਾ
BFL ਸੁਰੱਖਿਆ ਨੂੰ
