Black Forest Labs تكشف عن Flux 3: قفزة متعددة الوسائط في الفيديو والصوت
دخلت Black Forest Labs (BFL) رسميًا آفاق "نماذج العالم" (world models) مع إطلاق Flux 3، وهو نموذج أساسي متعدد الوسائط مصمم لسد الفجوة بين التوليد الرقمي والذكاء الفيزيائي. ومن خلال التدريب على الصور والفيديو والصوت في آن واحد، يحقق Flux 3 مستوى من التماسك الحسي الذي تجد النماذج التقليدية أحادية الوسائط صعوبة في محاكاته.
قوة التدريب متعدد الوسائط والصوت الأصلي
على عكس الأجيال السابقة من نماذج الفيديو التي غالبًا ما تتطلب عمليات منفصلة لمزامنة الصوت، يقدم Flux 3 توليدًا أصليًا للصوت لمقاطع الفيديو التي تصل مدتها إلى 20 ثانية. وتتجذر هذه التطورات في فلسفة BFL القائلة بأنه لا يمكن لأي وسيط واحد أن يجسد الواقع بالكامل. فبينما توفر الصور الهيكل المكاني ويوفر الفيديو التغيرات الزمنية، يكشف الصوت عن الروابط السببية بين الأحداث الميكانيكية وأصواتها.
من خلال استخدام محول متعدد الوسائط (multimodal transformer) يعتمد على نهج "Self-Flow" المملوك لشركة BFL، يقوم النموذج بتحويل الصور والفيديو والصوت وحتى الأفعال إلى تمثيل داخلي مشترك. ويسمح هذا التدريب الموحد للنموذج بملء الفجوات المعلوماتية؛ على سبيل المثال، استخدام الإشارات الصوتية لفهم فيزياء الحركة البصرية بشكل أفضل. يدعم Flux 3 مجموعة واسعة من الميزات المتقدمة، بما في ذلك تحويل النص إلى فيديو (text-to-video)، وتحويل الصورة إلى فيديو (image-to-video)، والانتقالات القائمة على الإطارات الرئيسية (keyframe-based transitions)، وحتى الحوارات متعددة اللغات.
مقارنة أداء Flux 3 مع عمالقة الصناعة
في التقييمات الأولية باستخدام مقاطع مدتها 10 ثوانٍ وبدقة 720p، أظهر Flux 3 مزايا تنافسية كبيرة. وفي اختبارات تفضيل المستخدم المباشرة، أفادت BFL أن Flux 3 كان المفضل على Luma Ray 3.2 في 93% من المقارنات، وعلى Runway Gen-4.5 في 77% من الحالات.
وبينما تتقلص الفوارق أمام المنافسين النخبة، لا يزال Flux 3 يحافظ على صدارته على Grok Imagine Video (69%) و Kling v3 Pro (60%). كما تفوق على Seedance 2.0 و Gemini Omni Flash بمعدل تفضيل بلغ 52%. وتشير هذه النتائج إلى أن Flux 3 يضع نفسه في الفئة العليا من نماذج الفيديو التوليدية، مما يجعله قادرًا على منافسة الأنظمة التي بدأت بالفعل في الاندماج ضمن سير العمل الاحترافي في هوليوود.
ما وراء إنشاء المحتوى: التحرك نحو الروبوتات
ربما يكون الجانب الأكثر طموحًا في Flux 3 هو توجهه نحو "الذكاء البصري في العالم الحقيقي". فشركة BFL لا تبني مجرد أداة إبداعية، بل تبني نموذجًا يمكنه الإدراك والتنبؤ والعمل. ومن خلال مكون مخصص للأفعال ضمن بنية المحول (transformer architecture) الخاصة به، يتم استخدام النموذج لتطوير "Flux-mimic"، وهو نموذج فيديو-حركي (video-action model).
وفي تطبيق واقعي عالي الأهمية، عقدت BFL شراكة مع Mimic Robotics لاختبار هذه التقنية في مهام الإنتاج لدى Audi. ويشير هذا إلى أن البنية التحتية لـ Flux 3 تهدف إلى أن تكون أساسًا للروبوتات، حيث يعد فهم القوانين الفيزيائية للعالم لا يقل أهمية عن توليد فيديو عالي الدقة.
النشر ووعد الأوزان المفتوحة "Flux 3 Dev"
تتبع BFL استراتيجية طرح تدريجي لضمان السلامة وجمع ملاحظات المستخدمين. يتوفر Flux 3 Video حاليًا، ومن المتوقع إطلاق Flux 3 Image في مرحلة الوصول المبكر خلال الأسابيع القليلة القادمة. وبالنظر إلى المستقبل، التزمت BFL بإتاحة الوصول إلى الأوزان المفتوحة (open-weight access) للعمود الفقري متعدد الوسائط تحت اسم "Flux 3 Dev"، وهي خطوة من المرجح أن تمكن المطورين والباحثين عالميًا من البناء على بنيتها التقنية.
النقاط الرئيسية
- تعدد الوسائط الأصلي: يدمج Flux 3 التدريب على الصور والفيديو والصوت في محول "Self-Flow" واحد، مما يتيح إنشاء مقاطع فيديو مدتها 20 ثانية مع صوت أصلي متزامن.
- أداء من الفئة العليا: في الاختبارات المبكرة، تفوق Flux 3 على المنافسين الرئيسيين بما في ذلك Luma Ray 3.2 (تفضيل بنسبة 93%) و Runway Gen-4.5 (تفضيل بنسبة 77%).
- التكامل مع الروبوتات: يتضمن النموذج مكونًا للتنبؤ بالأفعال يتم اختباره حاليًا لمهام الروبوتات الإنتاجية في Audi عبر Mimic Robotics.
