لا تزال نماذج الرؤية واللغة (VLMs) تخفق في أداء المهام البصرية الأساسية. فقد وجد تقييم جديد من PerceptionBench أن أيًا من الأنظمة الستة عشر الرائدة لم يتجاوز دقة 60% إجمالاً، وحتى أقواها ظل دون مستوى 80% في أي مهارة فردية. وتحذر هذه النتيجة المطورين من أن الدرجات العالية في اختبارات الوصف أو الاستنتاج الشائعة لا تضمن رؤية موثوقة.

لماذا تخفي الاختبارات الحالية المشكلة

تدمج معظم المعايير المرجعية العامة بين وصف الصور، والإجابة على الأسئلة، والاستنتاج القائم على المنطق السليم. فعندما يقدم النموذج وصفاً خاطئاً، قد يكون الخطأ زلة لغوية، أو خطأً في الاستنتاج، أو مجرد فشل في التعرف على الكائن. ولأن هذه المكونات الثلاثة متداخلة، فإن الدرجة المنخفضة لا تعطي أي مؤشر حول القصور البصري. وبناءً على ذلك، تكتسب الفرق التي تبني التطبيقات ثقة مفرطة من الأرقام المعلنة، مفترضة أن النموذج "يرى" بشكل صحيح.

ما الذي يفعله PerceptionBench بشكل مختلف

يقوم PerceptionBench بعزل عشر قدرات بصرية وتقييم كل نموذج بناءً على مجموعة مهام بصرية بحتة. ومن خلال تجريد المهام من اللغة والاستنتاج، يوضح المعيار المرجعي مدى كفاءة الواجهة البصرية في العمل بمفردها. وبشكل عام، لم تصل أفضل 16 نموذجاً من نماذج VLMs إلى عتبة دقة 60%، كما أن النظام الأفضل أداءً لم يصل أبداً إلى 80% في أي مهارة منفردة. وتعد "الهلوسة" —أي إنتاج تفاصيل غير موجودة في الصورة— الخطأ الأكثر شيوعاً، بينما يختلف نمط نقاط القوة والضعف بشكل كبير بين النماذج.

من المتضرر؟

لا ينبغي للمطورين استبدال المصنفات البصرية المتخصصة بنماذج الذكاء الاصطناعي العامة.

أين تضعف الحجة

تظهر بيانات PerceptionBench عوائد متناقصة: فحتى أكبر النماذج لا تزال تتعثر في مهام الإدراك الأساسية.

خطوات عملية للمطورين

  • الاحتفاظ بالمصنفات البصرية المتخصصة للمهام التي تتطلب دقة؛ والتعامل مع نماذج VLMs كعنصر مكمل وليس كبديل.
  • إضافة طبقة تحقق تقوم بمطابقة مخرجات النموذج مع كاشف موثوق قبل وصولها إلى المستخدم.
  • نشر مرشح رؤية خفيف الوزن لالتقاط حالات الهلوسة الواضحة أو التصنيفات الخاطئة في مرحلة مبكرة من مسار العمل.

إن الجمع بين نموذج VLM عام الغرض ومكون رؤية مصمم خصيصاً يتيح للفرق الاستفادة من قدرات الاستنتاج في الأول مع الحماية من نقاطه البصرية العمياء.

المصدر: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1