چین کا Orca ورلڈ ماڈل ایکشن لیبلز کے بغیر مخصوص روبوٹکس کے برابر

چین کے محققین کی جانب سے ایک اہم پیش رفت مصنوعی ذہانت (AI) کی ذہانت کی بنیادی تعریف کو چیلنج کر رہی ہے، جس نے یہ ثابت کیا ہے کہ ایک متحدہ ورلڈ ماڈل براہ راست نگرانی کے بغیر روبوٹکس میں مہارت حاصل کر سکتا ہے۔ Orca ماڈل یہ ظاہر کرتا ہے کہ محض ویڈیو کے ذریعے دنیا میں ہونے والی تبدیلیوں کا مشاہدہ کر کے، ایک AI گہری اندرونی سمجھ بوجھ پیدا کر سکتا ہے جو پیچیدہ جسمانی اعمال کو انجام دینے کے قابل ہو۔

دوہرا سیکھنے والا انجن: لاشعوری اور شعوری طریقے

Orca اپنے اندرونی "ورلڈ اسٹیٹ" (world state) کی تعمیر کے لیے دوہرا تربیتی طریقہ کار استعمال کرتے ہوئے روایتی مخصوص ماڈلز سے مختلف ہے۔ پہلا طریقہ، "لاشعوری سیکھنا" (unconscious learning)، جس میں 125,000 گھنٹوں کی بغیر لیبل والی ویڈیوز پر کارروائی شامل ہے۔ اس مرحلے کے دوران، ماڈل ایک تجریدی جگہ (abstract space) میں مستقبل کے فریمز کی پیش گوئی کرتا ہے، جس سے اسے کسی بھی کیپشن کی ضرورت کے بغیر حرکت کے پیٹرن، اشیاء کا چھپنا (occlusions)، اور منظر کی حرکیات کو سمجھنے میں مدد ملتی ہے۔

دوسرا طریقہ، "شعوری سیکھنا" (conscious learning)، زبانی ہدایات اور تفصیلات متعارف کرواتا ہے۔ ویڈیوز کو حصوں میں تقسیم کر کے اور نتیجے میں ہونے والی حالت کی تبدیلیوں کو لیبل کر کے، Orca ایک مخصوص عمل اور اس کے جسمانی نتیجے کے درمیان وجہ اور اثر (causal relationship) کے تعلق کو سیکھتا ہے۔ یہ مجموعہ ماڈل کو خام بصری ادراک اور اعلیٰ سطح کی لسانی استدلال کے درمیان فرق کو ختم کرنے کی اجازت دیتا ہے۔

تبدیل ہونے والے ذہانت کے ماڈیولز کے ساتھ ایک جامد مرکز (Frozen Core)

Orca کا ڈھانچہ انتہائی ہمہ گیر ہونے کے لیے ڈیزائن کیا گیا ہے۔ یہ پہلے سے تربیت یافتہ Qwen3.5 لینگویج امیج ماڈل کو ایک "جامد مرکز" (frozen core) کے طور پر استعمال کرتا ہے۔ ہر کام کے لیے پورے سسٹم کو دوبارہ تربیت دینے کے بجائے، محققین اس مستحکم بنیاد کے ساتھ مخصوص، ہلکے پھلکے "ہیڈز" (heads) منسلک کرتے ہیں:

  • ٹیکسٹ آؤٹ پٹ: موجودہ Qwen3.5 لینگویج ہیڈ کا استعمال کرتا ہے۔
  • تصویر کی تخلیق: اندرونی ورلڈ اسٹیٹ کو بصری پیش گوئیوں میں تبدیل کرنے کے لیے Stable Diffusion 3.5 سے منسلک چھوٹے ایڈاپٹرز کا استعمال کرتا ہے۔
  • روبوٹ کنٹرول: ایک خاص طور پر تیار کردہ "Action Expert" ماڈیول کا استعمال کرتا ہے جسے ورلڈ اسٹیٹس کو جسمانی حرکات میں تبدیل کرنے کے لیے تربیت دی گئی ہے۔

یہ ماڈیولر ساخت اس بات کو یقینی بناتی ہے کہ دنیا کی مرکزی سمجھ بوجھ مستقل رہے، چاہے ماڈل کسی سوال کا جواب دے رہا ہو، ویڈیو تیار کر رہا ہو، یا کسی مکینیکل بازو کو کنٹرول کر رہا ہو۔

مخصوص ماڈلز اور بڑے ماڈلز سے بہتر کارکردگی

Orca-4B کے کارکردگی کے پیمانے نمایاں ہیں۔ ٹیکسٹ پر مبنی ویڈیو بینچ مارکس پر، Orca-4B نے اوسطاً 51.8 فیصد کامیابی حاصل کی، جو Emu3 (34B) جیسے بہت بڑے ماڈلز اور DeepSeek-VL2-3B جیسے مخصوص VLMs سے بہتر ہے۔ PRICE-V0.1 بینچ مارک کے ذریعے امیج پریڈکشن کے کاموں میں، Orca-4B نے 59.8 فیصد اسکور کیا، جو FLUX.2 small جیسے اعلیٰ درجے کے جنریٹرز سے بھی آگے ہے۔

سب سے متاثر کن بات یہ ہے کہ Orca پانچ مینیپولیشن (manipulation) کاموں، جیسے پیالے ترتیب دینا اور چینی نکالنا، میں $\pi$0.5 کے برابر کارکردگی دکھاتا ہے—جو کہ ایک ایسا سسٹم ہے جو خاص طور پر روبوٹک ایکشن ڈیٹا پر بنایا گیا ہے۔ اہم بات یہ ہے کہ Orca نے اپنے وسیع پیمانے پر پری ٹریننگ مرحلے کے دوران کبھی بھی ایکشن لیبل دیکھے بغیر یہ کامیابی حاصل کی۔ اس نے بہتر طور پر غلطیوں سے نکلنے کی صلاحیت بھی دکھائی، جہاں ناکام گرفتوں (grasps) کو دوبارہ آزمانے میں وہ کامیاب رہا جبکہ مخصوص ماڈلز اکثر تکراری چکروں (repetitive loops) میں پھنس جاتے ہیں۔

یہ AI کے مستقبل کے لیے کیوں اہم ہے

Orca جدید روبوٹکس کے سب سے بڑے مسائل میں سے ایک کو حل کرتا ہے: لیبل شدہ ایکشن ڈیٹا کی شدید کمی۔ یہ ثابت کر کے کہ ایک AI غیر فعال مشاہدے (passive observation) کے ذریعے "دنیا کی فزکس" سیکھ سکتا ہے، یہ تحقیق ایسے عام مقصد کے روبوٹس کے لیے راستہ ہموار کرتی ہے جنہیں لاکھوں گھنٹوں کے دستی، ہاتھ سے لیبل شدہ ٹیلی آپریشن ڈیٹا کے بغیر نئے ماحول میں استعمال کیا جا سکتا ہے۔

اہم نکات

  • غیر نگرانی شدہ بنیاد: Orca بغیر لیبل والی ویڈیوز کے "لاشعوری سیکھنے" کے ذریعے دنیا کی حرکیات سیکھتا ہے، جس سے مہنگے انسانی طور پر لیبل شدہ ڈیٹا سیٹس پر انحصار کم ہو جاتا ہے۔
  • ماڈیولر ڈھانچہ: ایک جامد Qwen3.5 کور اور تبدیل ہونے والے ایڈاپٹرز کا استعمال ایک ہی ماڈل کو بیک وقت ٹیکسٹ، امیج اور روبوٹک کنٹرول میں مہارت حاصل کرنے کی اجازت دیتا ہے۔
  • روبوٹک برابری: پری ٹریننگ کے دوران ایکشن لیبلز کے کسی بھی سابقہ تجربے کے بغیر بھی، Orca-4B مینیپولیشن کے کاموں میں مخصوص روبوٹک سسٹمز کی کارکردگی کے برابر ہے۔