كشفت World Labs عن Atlas، وهو نموذج شامل (omni-model) يحول حفنة من الصور العادية إلى عالم ثلاثي الأبعاد قابل للتنقل بالكامل، ويقوم برندرة (rendering) ما يصل إلى دقيقة من الفيديو بدقة 1440p. وتقول الشركة إن هذه التقنية تنشئ مسار عمل من "الواقع إلى المحاكاة" (real-to-sim).
لماذا يمثل التحول من التسلسلات المسطحة أهمية كبرى
تتعامل معظم أنظمة الذكاء الاصطناعي متعددة الوسائط اليوم مع المدخلات كتدفقات أحادية أو ثنائية الأبعاد — مثل النصوص، أو شبكات الصور، أو إطارات الفيديو. ويجبر هذا التصميم النموذج على استنتاج العلاقات المكانية من بيانات تفتقر إلى الهندسة الصريحة، مما يحد من دقة الفيديو المُنشأ وإعادة البناء ثلاثي الأبعاد. لكن Atlas يتخلى عن هذا النهج؛ فكل رمز (token) يعالجه النموذج مرتبط بنقطة ملموسة في فضاء ثلاثي الأبعاد، وهي تقنية تطلق عليها الشركة اسم "الترسيخ المكاني" (spatial anchoring). ومن خلال التدريب من الصفر على النصوص والصور والفيديو والبيانات ثلاثية الأبعاد باستخدام بنية هندسية تدرك الأبعاد الثلاثية — أو حتى الرباعية (الزمن) — يمكن لـ Atlas فهم الهندسة والتحكم بها مباشرة.
من فيديو "آلة الحظ" إلى التوليد المتحكم به عبر الكاميرا
تعتمد أدوات توليد الفيديو الحالية على مطالبات نصية (prompts) غامضة لتحريك كاميرا افتراضية، مما يؤدي غالبًا إلى نتائج غير متوقعة. يستبدل Atlas المطالبة بمدخل هندسي: حيث يحدد المستخدم وضعية الكاميرا أو مسارًا، ويقوم النموذج برندرة المشهد من تلك الزاوية المحددة تمامًا. وفي العروض التوضيحية، أنتج النظام فيديو سلسًا وعالي الدقة حافظ على اتساقه عبر تحركات الكاميرا، مما يمثل خطوة نحو التحكم بمستوى احترافي.
إعادة بناء العوالم بأقل قدر من الصور
يمكن لـ Atlas إعادة بناء بيئات معقدة بدءًا من صورة واحدة وصولاً إلى بضع عشرات من الصور، دون الحاجة إلى أي أجهزة التقاط متخصصة. وفي عرض توضيحي عام، أخذ النموذج مجموعة صغيرة من الصور الملتقطة من مستوى الأرض لساحة جامعة، وقام بتخليق منظورات جوية تتوافق مع المخطط المتوقع. وغالبًا ما تسبب النماذج المنافسة مثل VGGT و InfiniteVGGT أنسجة ضبابية أو أخطاء هندسية عند تحرك الكاميرا، بينما حافظ Atlas على السلامة الهيكلية طوال الوقت.
بعيدًا عن الفيديو، يُنتج النموذج تنسيقات ثلاثية الأبعاد أصلية — مثل السحب النقطية (point clouds) و 3-D Gaussian splats. السحب النقطية هي مجموعات من النقاط في الفضاء التي تشفر شكل السطح؛ أما Gaussian splats فتخزن كل نقطة ككتلة صغيرة متغيرة بسلاسة، مما يسمح برندرة فعالة للتفاصيل الدقيقة. ومن خلال توفير العمق إلى جانب ألوان RGB، يحول Atlas بضع لقطات من الهاتف الذكي إلى توأم رقمي يمكن استكشافه من أي زاوية.
من "الواقع إلى المحاكاة" للروبوتات
لطالما صارع مطورو الروبوتات الفجوة بين بيانات العالم الحقيقي وبيئات التدريب المحاكية. ويعد Atlas بسد هذه الفجوة من خلال توليد تغذية مستشعرات دقيقة لما قد يراه الروبوت في غرفة مُعاد بناؤها. يمكن للمطورين بعد ذلك تغيير الأشياء أو الإضاءة أو الخلفيات في التوأم الرقمي، مما يخلق آلاف السيناريوهات المتنوعة من لقطة واحدة من العالم الحقيقي. وقد استعرضت World Labs سير العمل باستخدام تقنية استحوذت عليها من شركة ناشئة تركز على تخليق المشاهد؛ حيث أنتج مسار العمل تنوعات كافية لإبقاء خمس منصات روبوتية مختلفة تعمل بشكل مستقل لمدة ساعة كاملة دون تدخل بشري.
المعايير المرجعية وادعاءات الأداء
في الاختبارات المباشرة، فضل المقيمون البشريون فيديوهات Atlas الموجهة بالكاميرا على منافس رائد في 94% من المقارنات الثنائية، وعلى نموذج رئيسي آخر في 81% من الحالات. وبالنسبة لإعادة البناء، حقق Atlas متوسط خطأ قدره 25.3، متفوقًا على المنافسين الذين سجلوا درجات خطأ أعلى. يجمع النموذج بين مزايا السرعة في النماذج اللغوية الكبيرة — باستخدام التخزين المؤقت للمفاتيح والقيم (KV caching) لإعادة استخدام الحسابات الوسيطة — وبين المخرجات عالية الجودة لنماذج الانتشار (diffusion models) التي تعمل على تحسين الصور بشكل تكراري.
العيوب المحتملة والأسئلة المفتوحة
إن إعلانات World Labs مدعومة بعروض توضيحية مثيرة للإعجاب، لكن التقنية لا تزال في مراحلها الأولى. يتطلب تدريب وتشغيل نموذج يتعامل مع النصوص والصور والفيديو والبيانات ثلاثية الأبعاد بدقة عالية قدرات حوسبة هائلة، ولم تكشف الشركة عن مواصفات الأجهزة أو تكاليف الاستدلال (inference). تعتمد المعايير المرجعية على التفضيل البشري ومقاييس متوسط الخطأ؛ وهي لا تظهر بعد كيفية أداء Atlas في المهام اللاحقة مثل معدلات نجاح التحكم في الروبوتات مقارنة بالبيانات الحقيقية البحتة. قد يلاحظ النقاد أيضًا أنه بينما يمكن للنموذج توليد هندسة معقولة من صور قليلة، فإنه لا يمكنه استبدال دقة مسوحات الـ lidar أو لقطات الضوء المهيكل (structured-light) عندما تكون هناك حاجة إلى قياسات دقيقة.
ما الذي يجب مراقبته لاحقًا
- الاعتماد من قبل منصات الروبوتات – إذا قامت فرق الروبوتات بدمج العوالم التي ينشئها Atlas في حلقات التدريب الخاصة بها وأبلغت عن مكاسب ملموسة، فإن الادعاء بأن المحاكاة ستكون أرخص وأكثر تنوعاً سيكتسب مصداقية.
- مسارات إنشاء المحتوى – قد يكشف الاستوديوهات ومطورو الألعاب الذين يجرون تجارب باستخدام Atlas للنماذج الأولية السريعة عما إذا كانت مخرجات النموذج ثلاثية الأبعاد الأصلية تتوافق مع مسارات الأصول الحالية.
- التقييمات مفتوحة المصدر أو من أطراف ثالثة – سيساعد الباحثون المستقلون الذين يعيدون إنتاج أرقام المعايير المرجعية في تأكيد تفوق النموذج على المعايير الحالية.
- الإفصاحات المتعلقة بالأجهزة والتكاليف – سيحدد فهم ميزانية الحوسبة لعملية الاستدلال ما إذا كان Atlas يمكنه العمل على أجهزة الحافة (edge devices) أو سيبقى خدمة سحابية فقط.
الخلاصة
يُظهر Atlas أن ربط رموز الذكاء الاصطناعي بالمساحة الفيزيائية يتيح لنموذج واحد إنشاء وإعادة بناء ومحاكاة بيئات كاملة من أدنى قدر من المدخلات المرئية. وإذا توسع الأداء الموعود ليشمل عمليات النشر في العالم الحقيقي دون تكاليف حوسبة باهظة، فقد يعيد النموذج تشكيل كيفية تعلم الروبوتات وكيفية بناء المحتوى الغامر، محولاً بضع صور إلى عالم رقمي تفاعلي بالكامل.
