Black Forest Labs উন্মোচন করল Flux 3: ভিডিও এবং অডিওর ক্ষেত্রে একটি বিরাট অগ্রগতি
Black Forest Labs (BFL) Flux 3 রিলিজের মাধ্যমে আনুষ্ঠানিকভাবে "world models"-এর সীমানায় প্রবেশ করেছে। এটি একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ডিজিটাল জেনারেশন এবং ফিজিক্যাল ইন্টেলিজেন্সের মধ্যে ব্যবধান ঘুচিয়ে দেওয়ার জন্য ডিজাইন করা হয়েছে। ইমেজ, ভিডিও এবং অডিওর ওপর যুগপৎ প্রশিক্ষণের মাধ্যমে, Flux 3 এমন এক ধরনের সেন্সরি কোহেশন (sensory cohesion) অর্জন করেছে যা প্রথাগত সিঙ্গেল-মোডালিটি মডেলগুলোর পক্ষে অনুকরণ করা কঠিন।
মাল্টিমোডাল ট্রেনিং এবং নেটিভ অডিওর শক্তি
ভিডিও মডেলের আগের প্রজন্মগুলোর মতো যেখানে শব্দ সিঙ্ক করার জন্য প্রায়শই আলাদা প্রক্রিয়ার প্রয়োজন হতো, Flux 3 সেখানে ২০ সেকেন্ড পর্যন্ত দীর্ঘ ভিডিও ক্লিপের জন্য নেটিভ অডিও জেনারেশন সুবিধা নিয়ে এসেছে। এই উন্নয়নটি BFL-এর সেই দর্শনের ওপর ভিত্তি করে তৈরি যে, কোনো একক মোডালিটি দিয়ে বাস্তবতাকে পুরোপুরি ফুটিয়ে তোলা সম্ভব নয়। যেখানে ইমেজ স্পেশাল স্ট্রাকচার (spatial structure) প্রদান করে এবং ভিডিও টেম্পোরাল পরিবর্তন (temporal changes) দেখায়, সেখানে অডিও যান্ত্রিক ঘটনা এবং তাদের শব্দের মধ্যে কার্যকারণ সম্পর্ক (causal links) প্রকাশ করে।
BFL-এর নিজস্ব "Self-Flow" পদ্ধতির ওপর ভিত্তি করে তৈরি একটি মাল্টিমোডাল ট্রান্সফরমার ব্যবহার করে, এই মডেলটি ইমেজ, ভিডিও, অডিও এবং এমনকি অ্যাকশনকেও একটি শেয়ারড ইন্টারনাল রিপ্রেজেন্টেশনে রূপান্তর করে। এই ইউনিফাইড ট্রেনিং মডেলটিকে তথ্যের ঘাটতি পূরণ করতে সাহায্য করে—উদাহরণস্বরূপ, একটি ভিজ্যুয়াল মুভমেন্টের ফিজিক্স আরও ভালোভাবে বোঝার জন্য অডিও কিউ (audio cues) ব্যবহার করা। Flux 3 টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, কি-ফ্রেম ভিত্তিক ট্রানজিশন এবং এমনকি মাল্টিলিঙ্গুয়াল ডায়ালগের মতো বিস্তৃত উন্নত ফিচার সাপোর্ট করে।
ইন্ডাস্ট্রির জায়ান্টদের বিপরীতে Flux 3-এর পারফরম্যান্স যাচাই
720p রেজোলিউশনে ১০ সেকেন্ডের ক্লিপ ব্যবহার করে প্রাথমিক মূল্যায়নে Flux 3 উল্লেখযোগ্য প্রতিযোগিতামূলক সুবিধা প্রদর্শন করেছে। সরাসরি ইউজার প্রেফারেন্স টেস্টে, BFL জানিয়েছে যে ৯৩% ক্ষেত্রে Luma Ray 3.2-এর তুলনায় এবং ৭৭% ক্ষেত্রে Runway Gen-4.5-এর তুলনায় Flux 3-কে বেশি পছন্দ করা হয়েছে।
যদিও শীর্ষস্থানীয় প্রতিযোগীদের সাথে ব্যবধান কমে এসেছে, তবুও Flux 3 Grok Imagine Video (৬৯%) এবং Kling v3 Pro (৬০%)-এর ওপর আধিপত্য বজায় রেখেছে। এটি Seedance 2.0 এবং Gemini Omni Flash-কেও ৫২% প্রেফারেন্স রেট দিয়ে ছাড়িয়ে গেছে। এই ফলাফলগুলো ইঙ্গিত দেয় যে, Flux 3 জেনারেটিভ ভিডিও মডেলগুলোর একদম শীর্ষ স্তরে নিজেদের অবস্থান তৈরি করছে, যা ইতিমধ্যে প্রফেশনাল হলিউড ওয়ার্কফ্লোতে ব্যবহৃত সিস্টেমগুলোর সাথে প্রতিদ্বন্দ্বিতা করতে সক্ষম।
কন্টেন্ট ক্রিয়েশনের বাইরে: রোবোটিক্সের দিকে যাত্রা
সম্ভবত Flux 3-এর সবচেয়ে উচ্চাভিলাষী দিক হলো "রিয়েল-ওয়ার্ল্ড ভিজ্যুয়াল ইন্টেলিজেন্স"-এর দিকে এর যাত্রা। BFL কেবল একটি ক্রিয়েটিভ টুল তৈরি করছে না; তারা এমন একটি মডেল তৈরি করছে যা উপলব্ধি করতে পারে, পূর্বাভাস দিতে পারে এবং কাজ করতে পারে। এর ট্রান্সফরমার আর্কিটেকচারের মধ্যে একটি ডেডিকেটেড অ্যাকশন কম্পোনেন্টের মাধ্যমে, মডেলটি "Flux-mimic" নামক একটি ভিডিও-অ্যাকশন মডেল তৈরি করতে ব্যবহৃত হচ্ছে।
একটি উচ্চ-স্তরের রিয়েল-ওয়ার্ল্ড অ্যাপ্লিকেশনে, BFL Audi-তে প্রোডাকশন টাস্কগুলোতে এই প্রযুক্তি পরীক্ষা করার জন্য Mimic Robotics-এর সাথে অংশীদারিত্ব করেছে। এটি নির্দেশ করে যে, Flux 3-এর অন্তর্নিহিত আর্কিটেকচারটি রোবোটিক্সের জন্য একটি ভিত্তি হিসেবে কাজ করার উদ্দেশ্যে তৈরি করা হয়েছে, যেখানে একটি হাই-ফিডেলিটি ভিডিও জেনারেট করার মতোই গুরুত্বপূর্ণ হলো বিশ্বের ভৌত নিয়মগুলো (physical laws) বোঝা।
ডিপ্লয়মেন্ট এবং "Flux 3 Dev" ওপেন-ওয়েট প্রতিশ্রুতি
নিরাপত্তা নিশ্চিত করতে এবং ব্যবহারকারীদের ফিডব্যাক সংগ্রহ করতে BFL একটি ধাপে ধাপে রোলআউট কৌশল গ্রহণ করছে। Flux 3 Video বর্তমানে উপলব্ধ রয়েছে এবং আগামী কয়েক সপ্তাহের মধ্যে Flux 3 Image-এর আর্লি অ্যাক্সেস চালু হওয়ার কথা রয়েছে। আরও দূরদর্শীভাবে চিন্তা করলে, BFL "Flux 3 Dev" নামে তাদের মাল্টিমোডাল ব্যাকবোনটির ওপেন-ওয়েট অ্যাক্সেস রিলিজ করার প্রতিশ্রুতি দিয়েছে, যা সম্ভবত বিশ্বজুড়ে ডেভেলপার এবং গবেষকদের তাদের আর্কিটেকচারের ওপর ভিত্তি করে নতুন কিছু তৈরি করতে সক্ষম করে তুলবে।
মূল বিষয়সমূহ
- নেটিভ মাল্টিমোডালিটি: Flux 3 ইমেজ, ভিডিও এবং অডিও ট্রেনিংকে একটি একক "Self-Flow" ট্রান্সফরমারের মধ্যে সমন্বিত করে, যা ২০ সেকেন্ডের ভিডিওর সাথে সিঙ্ক্রোনাইজড নেটিভ অডিও প্রদান করতে সক্ষম।
- শীর্ষ স্তরের পারফরম্যান্স: প্রাথমিক পরীক্ষায়, Flux 3 Luma Ray 3.2 (৯৩% প্রেফারেন্স) এবং Runway Gen-4.5 (৭৭% প্রেফারেন্স)-সহ প্রধান প্রতিদ্বন্দ্বীদের ছাড়িয়ে গেছে।
- রোবোটিক্স ইন্টিগ্রেশন: মডেলটিতে একটি অ্যাকশন-প্রেডিকশন কম্পোনেন্ট রয়েছে যা বর্তমানে Mimic Robotics-এর মাধ্যমে Audi-তে প্রোডাকশন রোবোটিক্স টাস্কের জন্য পরীক্ষা করা হচ্ছে।
