ActiveVision بینچ مارک سے پتہ چلتا ہے کہ آج کے صف اول کے ملٹی موڈل لارج لینگویج ماڈلز (LLMs) ان میں سے صرف 10.6% ٹاسک حل کر پاتے ہیں جن میں ایک تصویر کو ایک سے زیادہ بار دیکھنے کی ضرورت ہوتی ہے۔ 17 تکراری ادراک (iterative-perception) کے چیلنجز کے ایک ٹیسٹ میں، انسانوں نے 96.1% بار کامیابی حاصل کی جبکہ GPT-5.5 نے 10.6% اور Claude Fable 5 نے 3.5% کامیابی حاصل کی۔ گیارہ ٹاسکس میں ماڈلز کی طرف سے کوئی بھی درست جواب نہیں ملا۔
موجودہ ویژن ماڈلز کیوں لڑکھڑاتے ہیں
زیادہ تر ویژن سسٹم ایک تصویر کو صرف ایک بار کے ان پٹ کے طور پر لیتے ہیں۔ ایک "ویژن انکوڈر" (vision encoder) ایک بار فیچرز نکالتا ہے، اور پھر انہیں استدلال کے لیے لینگویج ماڈل کے حوالے کر دیتا ہے۔ یہ پائپ لائن دوبارہ دیکھنے، کسی مخصوص حصے کو زوم کرنے، یا کسی مفروضے کا دوبارہ جائزہ لینے کی صلاحیت نہیں رکھتی۔ اس کے برعکس، انسان پہلے ایک اندازہ لگاتے ہیں، پھر توجہ کا مرکز بدلتے ہیں، نئے شواہد جمع کرتے ہیں، اور اپنے جواب کو درست کرتے ہیں۔ یہ بینچ مارک اسی عمل کو باقاعدہ شکل دیتا ہے: ہر ٹاسک ماڈل کو مشاہدہ کرنے، ایکشن تجویز کرنے، نتیجے کا مشاہدہ کرنے، اور اس وقت تک اسے دہرانے پر مجبور کرتا ہے جب تک کہ وہ درست نتیجے تک نہ پہنچ جائے۔
بینچ مارک نے کیا ٹیسٹ کیا
محققین نے 17 ایسے منظرنامے تیار کیے جن میں بار بار مشاہدے کی ضرورت ہوتی ہے۔ نتائج انتہائی حیران کن ہیں:
- انسانی شرکاء: 96.1% کامیابی
- GPT-5.5: 10.6% کامیابی
- Claude Fable 5: 3.5% کامیابی
- گیارہ ٹاسکس: ہر ٹیسٹ شدہ ماڈل کا اسکور صفر رہا
یہاں تک کہ جب ماڈلز نے تصویر کو دوبارہ پروسیس کرنے کے لیے کوڈ بھی تیار کیا، تب بھی وہ اپنے ہی آؤٹ پٹ میں غلطیوں کو نہ پا سکے، جس سے یہ ثابت ہوا کہ یہ حد محض ڈیٹا پر مبنی ہونے کے بجائے آرکیٹیکچرل (architectural) ہے۔
ڈویلپرز اور صنعت کے لیے خطرات
اگر آپ خود مختار روبوٹس، معائنے والے ڈرونز، یا کوئی ایسا سسٹم بنا رہے ہیں جسے وقت کے ساتھ بصری معلومات کی تصدیق کرنی ہو، تو ایک ہی بار میں کام کرنے والا (single-shot) ویژن ماڈل خطرناک ہو سکتا ہے۔ بینچ مارک ظاہر کرتا ہے کہ موجودہ LLM پر مبنی ویژن پائپ لائنز فیڈ بیک پر مبنی ادراک کو قابل اعتماد طریقے سے سنبھال نہیں سکتیں، اس لیے وہ نقائص کو نظر انداز کر دیں گی، اشیاء کی غلط گنتی کریں گی، یا متحرک مناظر کی غلط تشریح کریں گی۔ مزید ٹریننگ ڈیٹا شامل کرنے یا پیرامیٹرز بڑھانے سے یہ فرق ختم نہیں ہوگا؛ اصل ضرورت کنٹرول شدہ اور تکراری مشاہدے کے طریقہ کار کی ہے۔
جوابی دلیل: کیا بڑے ماڈلز مدد کر سکتے ہیں؟
مزید ٹریننگ ڈیٹا شامل کرنے یا پیرامیٹرز بڑھانے سے یہ فرق ختم نہیں ہوگا؛ اصل ضرورت کنٹرول شدہ اور تکراری مشاہدے کے طریقہ کار کی ہے۔
آگے کا راستہ
محققین ایک متبادل سمت تجویز کرتے ہیں:
- آرکیٹیکچرل ری ڈیزائن – ایک ایسا قابلِ کنٹرول ویژول ماڈول شامل کرنا جو ماڈل کی اندرونی حالت کی بنیاد پر نئے مناظر طلب کر سکے، حصوں کو کراپ (crop) کر سکے، یا روشنی کے حالات کو تبدیل کر سکے۔
خلاصہ: موجودہ ملٹی موڈل LLMs ساکن تصاویر کے سوالات کے جوابات دینے میں بہترین ہیں لیکن جب کسی مسئلے کے لیے دوبارہ دیکھنے کی ضرورت ہو تو وہ ناکام ہو جاتے ہیں۔ حقیقی بصری ذہانت کے لیے ایسے ماڈلز کی ضرورت ہوگی جو صرف ایک تصویر کو ایک بار پڑھنے کے بجائے اپنی نظر کو خود کنٹرول کر سکیں۔
