व्हिजन-लँग्वेज मॉडेल्स (VLMs) अजूनही मूलभूत दृश्य कार्यांमध्ये (elementary visual tasks) अपयशी ठरत आहेत. एका नवीन PerceptionBench मूल्यमापनातून असे दिसून आले आहे की, अवघ्या सोळा आघाडीच्या प्रणालींपैकी एकही प्रणाली एकूण ६०% अचूकतेपेक्षा जास्त कामगिरी करत नाही आणि सर्वात प्रबळ प्रणाली देखील कोणत्याही वैयक्तिक कौशल्यात ८०% पेक्षा कमी राहते. हे निकाल डेव्हलपर्सना सावध करतात की लोकप्रिय कॅप्शनिंग किंवा रिझनिंग टेस्टमधील उच्च गुण विश्वसनीय दृष्टीची (reliable sight) खात्री देत नाहीत.

विद्यमान चाचण्या समस्या का लपवतात

बहुतेक सार्वजनिक बेंचमार्क इमेज डिस्क्रिप्शन, प्रश्नोत्तरे आणि कॉमनसेन्स रिझनिंग यांचे मिश्रण करतात. जेव्हा एखादे मॉडेल चुकीचे कॅप्शन देते, तेव्हा ती चूक भाषेतील त्रुटी, तर्कशास्त्रातील चूक किंवा वस्तू ओळखण्यात आलेले साधे अपयश असू शकते. हे तीन घटक एकमेकांत गुंतलेले असल्यामुळे, कमी स्कोअरमुळे दृश्य त्रुटीबद्दल (visual shortfall) कोणताही संकेत मिळत नाही. त्यामुळे, ॲप्लिकेशन्स बनवणारी टीम्स हेडलाईन आकड्यांवरून अतिविश्वास ठेवतात आणि मॉडेल योग्यरित्या "पाहते" असे गृहीत धरतात.

PerceptionBench काय वेगळे करते

PerceptionBench दहा दृश्य क्षमता वेगळ्या करते आणि प्रत्येक मॉडेलचे मूल्यमापन 'प्युअर-व्हिजन टास्क सेट'वर करते. भाषा आणि तर्कशास्त्र बाजूला काढून, हा बेंचमार्क व्हिज्युअल फ्रंट-एंड स्वतःहून किती चांगले काम करते हे दर्शवतो. सर्वसाधारणपणे, अवघ्या सोळा आघाडीच्या VLMs ६०% अचूकतेच्या मर्यादेपेक्षा कमी पडतात आणि सर्वोत्तम कामगिरी करणारी प्रणाली देखील कोणत्याही एका कौशल्यात ८०% पर्यंत पोहोचू शकत नाही. हॅलुसिनेशन (Hallucination)—म्हणजेच प्रतिमेत नसलेले तपशील तयार करणे—ही सर्वात सामान्य चूक आहे, तर मॉडेल्समधील बलस्थाने आणि उणिवांचे स्वरूप मोठ्या प्रमाणात भिन्न आहे.

कोणाचे नुकसान होऊ शकते

डेव्हलपर्सनी समर्पित व्हिज्युअल क्लासिफायर्सना जनरल AI मॉडेल्सनी बदलू नये.

युक्तिवाद कुठे चुतो

PerceptionBench डेटा कमी होत जाणारे परतावे (diminishing returns) दर्शवतो: सर्वात मोठे मॉडेल्स देखील मूलभूत पर्सेप्शन टास्कमध्ये अडखळतात.

डेव्हलपर्ससाठी व्यावहारिक पावले

  • समर्पित व्हिज्युअल क्लासिफायर्स ठेवा; ज्या कामांसाठी अचूकतेची गरज आहे, तिथे VLMs ला रिप्लेसमेंटऐवजी पूरक (complementary) म्हणून वापरा.
  • व्हेरिफिकेशन लेअर जोडा; मॉडेलचे आउटपुट युजरपर्यंत पोहोचण्यापूर्वी ते विश्वसनीय डिटेक्टरद्वारे क्रॉस-चेक करा.
  • लाईटवेट व्हिजन फिल्टर तैनात करा; पाईपलाईनमध्ये सुरुवातीच्या टप्प्यावरच स्पष्ट हॅलुसिनेशन किंवा चुकीचे वर्गीकरण (misclassifications) पकडण्यासाठी याचा वापर करा.

जनरल-पर्पज VLM ला विशिष्ट कामासाठी बनवलेल्या व्हिजन कंपोनंटसोबत जोडल्यामुळे, टीम्स मॉडेलच्या तर्कशक्तीचा वापर करू शकतात आणि त्याच वेळी त्याच्या व्हिज्युअल ब्लाइंड स्पॉट्सपासून (visual blind spots) संरक्षणही मिळवू शकतात.

स्रोत: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1