ActiveVision బెంచ్మార్క్ ప్రకారం, నేటి ప్రముఖ మల్టీమోడల్ లార్జ్ లాంగ్వేజ్ మోడల్స్ (LLMs) ఒక చిత్రాన్ని ఒకటి కంటే ఎక్కువసార్లు చూడవలసి వచ్చే పనులలో కేవలం 10.6% మాత్రమే విజయవంతమయ్యాయి. 17 ఇటరేటివ్-పెర్సెప్షన్ (iterative-perception) సవాళ్ల పరీక్షలో, మనుషులు 96.1% సార్లు విజయం సాధించగా, GPT-5.5 10.6% మరియు Claude Fable 5 3.5% మాత్రమే సాధించాయి; పదకొండు పనులలో మోడల్స్ నుండి ఒక్క సరైన సమాధానం కూడా రాలేదు.
ప్రస్తుత విజన్ మోడల్స్ ఎందుకు విఫలమవుతున్నాయి
చాలా విజన్ సిస్టమ్స్ ఒక చిత్రాన్ని ఒకేసారి ఇచ్చే ఇన్పుట్గా పరిగణిస్తాయి. ఒక "విజన్ ఎన్కోడర్" ఫీచర్లను ఒకేసారి సంగ్రహించి, తదుపరి విశ్లేషణ కోసం లాంగ్వేజ్ మోడల్కు అందిస్తుంది. ఈ పైప్లైన్ మళ్ళీ చూడమని అడగడం, ఒక ప్రాంతాన్ని జూమ్ చేయడం లేదా ఒక ఊహను (hypothesis) తిరిగి అంచనా వేయడం వంటివి చేయలేదు. దీనికి విరుద్ధంగా, మనుషులు మొదట ఒక అంచనా వేసి, దృష్టిని మారుస్తూ, కొత్త ఆధారాలను సేకరిస్తూ, తమ సమాధానాన్ని సరిచేసుకుంటారు. ఈ బెంచ్మార్క్ ఆ ప్రక్రియను క్రమబద్ధీకరిస్తుంది: ప్రతి పని మోడల్ను గమనించమని, ఒక చర్యను ప్రతిపాదించమని, ఫలితాన్ని గమనించమని మరియు సరైన ముగింపు వచ్చే వరకు మళ్ళీ మళ్ళీ చేయమని నిర్బంధిస్తుంది.
బెంచ్మార్క్ దేనిని పరీక్షించింది
పరిశోధకులు పదేపదే పరిశీలన అవసరమయ్యే 17 సినారియోలను రూపొందించారు. ఫలితాలు స్పష్టంగా ఉన్నాయి:
- మానవ పాల్గొనేవారు: 96.1% విజయం
- GPT-5.5: 10.6% విజయం
- Claude Fable 5: 3.5% విజయం
- పదకొండు పనులు: పరీక్షించిన ప్రతి మోడల్ సున్నా స్కోరు సాధించాయి
మోడల్స్ చిత్రాన్ని మళ్ళీ ప్రాసెస్ చేయడానికి కోడ్ను రూపొందించినప్పటికీ, అవి తమ స్వంత అవుట్పుట్లోని లోపాలను గుర్తించలేకపోయాయి. దీనివల్ల ఈ పరిమితి కేవలం డేటా వల్ల కాకుండా, ఆర్కిటెక్చరల్ (architectural) కారణాల వల్ల అని స్పష్టమవుతోంది.
డెవలపర్లు మరియు పరిశ్రమ ఎదుర్కొంటున్న సవాళ్లు
మీరు స్వయంప్రతిపత్తి కలిగిన రోబోట్లు, ఇన్స్పెక్షన్ డ్రోన్లు లేదా కాలక్రమేణా దృశ్య సమాచారాన్ని ధృవీకరించవలసిన ఏదైనా వ్యవస్థను నిర్మిస్తుంటే, సింగిల్-షాట్ విజన్ మోడల్ను ఉపయోగించడం ప్రమాదకరం. ప్రస్తుత LLM ఆధారిత విజన్ పైప్లైన్లు ఫీడ్బ్యాక్ ఆధారిత పెర్సెప్షన్ను నమ్మదగిన రీతిలో నిర్వహించలేవని ఈ బెంచ్మార్క్ చూపుతోంది, కాబట్టి అవి లోపాలను గుర్తించలేకపోవచ్చు, వస్తువులను తప్పుగా లెక్కించవచ్చు లేదా డైనమిక్ దృశ్యాలను తప్పుగా అర్థం చేసుకోవచ్చు. మరిన్ని శిక్షణ డేటాను జోడించడం లేదా పారామీటర్లను పెంచడం వల్ల ఈ అంతరాన్ని పూరించలేము; నియంత్రిత, ఇటరేటివ్ పరిశీలన కోసం ఒక మెకానిజం లేకపోవడమే ఇక్కడ ప్రధాన సమస్య.
ప్రతివాదన: పెద్ద మోడల్స్ సహాయపడగలవా?
మరిన్ని శిక్షణ డేటాను జోడించడం లేదా పారామీటర్లను పెంచడం వల్ల ఈ అంతరాన్ని పూరించలేము; నియంత్రిత, ఇటరేటివ్ పరిశీలన కోసం ఒక మెకానిజం లేకపోవడమే ఇక్కడ ప్రధాన సమస్య.
ముందుకు వెళ్లే మార్గాలు
పరిశోధకులు ఒక అనుబంధ దిశను సూచిస్తున్నారు:
- ఆర్కిటెక్చరల్ రీడిజైన్ (Architectural redesign) – మోడల్ యొక్క అంతర్గత స్థితి ఆధారంగా కొత్త వ్యూలను అడగడం, ప్రాంతాలను క్రాప్ చేయడం లేదా లైటింగ్ పరిస్థితులను మార్చడం వంటివి చేయగల నియంత్రించదగిన విజువల్ మాడ్యూల్ను అనుసంధానించడం.
ముఖ్య అంశం: ప్రస్తుత మల్టీమోడల్ LLMలు స్థిరమైన (static) చిత్రాల ప్రశ్నలకు సమాధానం ఇవ్వడంలో రాణిస్తాయి, కానీ సమస్య మళ్ళీ చూడవలసి వచ్చినప్పుడు విఫలమవుతాయి. నిజమైన విజువల్ ఇంటెలిజెన్స్ కోసం కేవలం చిత్రాన్ని ఒకసారి చదవడం మాత్రమే కాకుండా, తమ స్వంత చూపును నియంత్రించగల మోడల్స్ అవసరం.
