విజన్-లాంగ్వేజ్ మోడల్స్ (VLMs) ప్రాథమిక విజువల్ టాస్క్లలో (visual tasks) ఇంకా వెనుకబడే ఉన్నాయి. కొత్త PerceptionBench మూల్యాంకనం ప్రకారం, అగ్రగామిగా ఉన్న పదహారు వ్యవస్థలలో ఏదీ మొత్తం మీద 60% కచ్చితత్వాన్ని మించలేదు, మరియు అత్యంత శక్తివంతమైనది కూడా ఏ ఒక్క విడి నైపుణ్యంలోనైనా 80% కంటే తక్కువగానే ఉంది. ప్రాచుర్యం పొందిన క్యాప్షనింగ్ లేదా రీజనింగ్ పరీక్షల్లో అధిక స్కోర్లు సాధించినంత మాత్రాన, అవి నమ్మదగిన దృష్టిని (reliable sight) కలిగి ఉన్నాయని చెప్పలేమని ఈ ఫలితం డెవలపర్లను హెచ్చరిస్తోంది.
ప్రస్తుత పరీక్షలు సమస్యను ఎందుకు దాచిపెడుతున్నాయి
చాలా పబ్లిక్ బెంచ్మార్క్లు ఇమేజ్ డిస్క్రిప్షన్, ప్రశ్నలకు సమాధానాలు ఇవ్వడం మరియు కామన్స్ సెన్స్ రీజనింగ్ను కలిపి ఉంచుతాయి. ఒక మోడల్ తప్పు క్యాప్షన్ను ఇచ్చినప్పుడు, ఆ తప్పు భాషా పరమైన లోపం వల్ల కావచ్చు, రీజనింగ్ లోపం వల్ల కావచ్చు లేదా వస్తువును గుర్తించడంలో విఫలం కావడం వల్ల కావచ్చు. ఈ మూడు అంశాలు కలిసి ఉండటం వల్ల, తక్కువ స్కోరు వచ్చినప్పుడు అది విజువల్ లోపం వల్ల వచ్చిందో లేదో తెలియదు. అందువల్ల, అప్లికేషన్లను రూపొందించే బృందాలు, మోడల్ సరిగ్గా "చూస్తోంది" అని భావించి, హెడ్ లైన్ నంబర్లను చూసి అతిగా నమ్మకంగా వ్యవహరిస్తున్నాయి.
PerceptionBench ఏమి భిన్నంగా చేస్తుంది
PerceptionBench పది విజువల్ సామర్థ్యాలను వేరు చేసి, ప్రతి మోడల్ను కేవలం విజువల్ టాస్క్ సెట్పై మూల్యాంకనం చేస్తుంది. భాష మరియు రీజనింగ్ను తొలగించడం ద్వారా, ఈ బెంచ్మార్క్ విజువల్ ఫ్రంట్-ఎండ్ ఎంత బాగా పనిచేస్తుందో చూపిస్తుంది. మొత్తం మీద, అగ్రశ్రేణిలోని పదహారు VLMs 60% కచ్చితత్వ పరిమితి కంటే తక్కువగానే ఉన్నాయి, మరియు అత్యుత్తమ పనితీరు కనబరిచిన సిస్టమ్ కూడా ఏ ఒక్క నైపుణ్యంలోనైనా 80% కి చేరుకోలేదు. హాలూసినేషన్ (Hallucination)—అంటే చిత్రంలో లేని వివరాలను సృష్టించడం—అత్యంత సాధారణ లోపం, అయితే మోడల్ల మధ్య బలాలు మరియు బలహీనతల నమూనా గణనీయంగా మారుతూ ఉంటుంది.
ఎవరు నష్టపోతారు
డెవలపర్లు ప్రత్యేక విజువల్ క్లాసిఫైయర్లను (dedicated visual classifiers) జనరల్ AI మోడల్స్తో భర్తీ చేయకూడదు.
వాదన ఎక్కడ తప్పుతుంది
PerceptionBench డేటా తగ్గుతున్న ఫలితాలను చూపుతోంది: అతిపెద్ద మోడల్స్ కూడా ప్రాథమిక పర్సెప్షన్ టాస్క్లలో (perception tasks) తడబడుతున్నాయి.
డెవలపర్ల కోసం ఆచరణాత్మక దశలు
- ప్రత్యేక విజువల్ క్లాసిఫైయర్లను ఉంచుకోండి: ఖచ్చితత్వం అవసరమయ్యే పనుల కోసం వీటిని వాడండి; VLMsలను భర్తీగా కాకుండా, అనుబంధంగా (complementary) పరిగణించండి.
- వెరిఫికేషన్ లేయర్ను జోడించండి: మోడల్ అవుట్పుట్లు వినియోగదారుడికి చేరకముందే, వాటిని నమ్మదగిన డిటెక్టర్తో సరిచూసేలా ఒక వెరిఫికేషన్ లేయర్ను ఏర్పాటు చేయండి.
- లైట్వెయిట్ విజన్ ఫిల్టర్ను ఉపయోగించండి: స్పష్టమైన హాలూసినేషన్లను లేదా తప్పు వర్గీకరణలను (misclassifications) పైప్లైన్లో ముందే గుర్తించడానికి లైట్వెయిట్ విజన్ ఫిల్టర్ను అమలు చేయండి.
జనరల్-పర్పస్ VLMని, ప్రత్యేకంగా రూపొందించిన విజన్ కాంపోనెంట్తో జత చేయడం ద్వారా, బృందాలు దాని రీజనింగ్ సామర్థ్యాలను ఉపయోగించుకుంటూనే, దాని విజువల్ బ్లైండ్ స్పాట్ల (visual blind spots) నుండి రక్షణ పొందవచ్చు.
మూలం: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
