വിഷൻ-ലാംഗ്വേജ് മോഡലുകൾ (VLMs) അടിസ്ഥാനപരമായ ദൃശ്യപരമായ ജോലികളിൽ (visual tasks) ഇപ്പോഴും പരാജയപ്പെടുന്നു. പുതിയ PerceptionBench മൂല്യനിർണ്ണയം അനുസരിച്ച്, മുൻനിരയിലുള്ള പതിനാറ് സിസ്റ്റങ്ങളിൽ ഒരുന്നും മൊത്തത്തിൽ 60% കൃത്യത മറികടക്കുന്നില്ല, ഏറ്റവും മികച്ച മോഡൽ പോലും ഏതെങ്കിലും ഒരു പ്രത്യേക നൈപുണ്യത്തിൽ 80%-ൽ താഴെ മാത്രമാണ് നേടുന്നത്. ജനപ്രിയമായ ക്യാപ്ഷനിംഗ് അല്ലെങ്കിൽ റീസണിംഗ് ടെസ്റ്റുകളിൽ ഉയർന്ന സ്കോറുകൾ ലഭിക്കുന്നത് വിശ്വസനീയമായ കാഴ്ചശക്തി ഉറപ്പാക്കുന്നില്ലെന്ന് ഈ ഫലം ഡെവലപ്പർമാരെ മുന്നറിയിപ്പ് നൽകുന്നു.

നിലവിലുള്ള പരിശോധനകൾ പ്രശ്നം മറച്ചുവെക്കുന്നത് എന്തുകൊണ്ട്

മിക്ക പൊതുവായ ബെഞ്ച്മാർക്കുകളും ഇമേജ് ഡിസ്ക്രിപ്ഷൻ, ചോദ്യോത്തരങ്ങൾ, കോമൺസെൻസ് റീസണിംഗ് എന്നിവയെ കൂട്ടിക്കലർത്തുന്നു. ഒരു മോഡൽ തെറ്റായ ക്യാപ്ഷൻ നൽകിയാൽ, ആ തെറ്റ് ഭാഷാപരമായ പിശകാകാം, റീസണിംഗിലെ പിശകാകാം, അല്ലെങ്കിൽ ഒരു വസ്തുവിനെ തിരിച്ചറിയുന്നതിലെ പരാജയമാകാം. ഈ മൂന്ന് ഘടകങ്ങളും പരസ്പരം ഇഴചേർന്നു കിടക്കുന്നതിനാൽ, കുറഞ്ഞ സ്കോർ ലഭിച്ചാൽ അത് ദൃശ്യപരമായ പോരായ്മയാണോ എന്ന് മനസ്സിലാക്കാൻ കഴിയില്ല. അതിനാൽ, മോഡൽ ശരിയായി "കാണുന്നുണ്ടെന്ന്" കരുതി, പ്രധാനപ്പെട്ട കണക്കുകളിൽ (headline numbers) നിന്ന് ആപ്പുകൾ നിർമ്മിക്കുന്ന ടീമുകൾ അമിത ആത്മവിശ്വാസം പ്രകടിപ്പിക്കുന്നു.

PerceptionBench വ്യത്യസ്തമായി ചെയ്യുന്നത് എന്താണ്

PerceptionBench പത്ത് ദൃശ്യപരമായ കഴിവുകളെ വേർതിരിച്ചെടുക്കുകയും ഓരോ മോഡലിനെയും ശുദ്ധമായ വിഷൻ ടാസ്ക് സെറ്റുകൾ ഉപയോഗിച്ച് വിലയിരുത്തുകയും ചെയ്യുന്നു. ഭാഷയും റീസണിംഗും ഒഴിവാക്കുന്നതിലൂടെ, വിഷ്വൽ ഫ്രണ്ട്-എൻഡ് എത്രത്തോളം മികച്ച രീതിയിൽ പ്രവർത്തിക്കുന്നു എന്ന് ഈ ബെഞ്ച്മാർക്ക് കാണിച്ചുതരുന്നു. മൊത്തത്തിൽ നോക്കിയാൽ, മുൻനിരയിലുള്ള പതിനാറ് VLMs-ഉം 60% കൃത്യത എന്ന പരിധിയിൽ താഴെയാണ് നിൽക്കുന്നത്, കൂടാതെ ഏറ്റവും മികച്ച സിസ്റ്റം പോലും ഏതെങ്കിലും ഒരു പ്രത്യേക നൈപുണ്യത്തിൽ 80% എത്തുന്നില്ല. ഹാലൂസിനേഷൻ (Hallucination)—ചിത്രത്തിൽ ഇല്ലാത്ത വിവരങ്ങൾ നൽകുന്നത്—ഏറ്റവും സാധാരണമായ പിശകാണ്, അതേസമയം ഓരോ മോഡലുകൾക്കും ഇടയിൽ കരുത്തും ബലഹീനതകളും വ്യത്യസ്തമാണ്.

ആർക്കാണ് നഷ്ടം സംഭവിക്കുക

ഡെവലപ്പർമാർ പ്രത്യേകമായി രൂപകൽപ്പന ചെയ്ത വിഷ്വൽ ക്ലാസിഫയറുകൾക്ക് പകരം ജനറൽ AI മോഡലുകൾ ഉപയോഗിക്കരുത്.

വാദങ്ങൾ എവിടെയാണ് പരാജയപ്പെടുന്നത്

PerceptionBench ഡാറ്റ കുറഞ്ഞ ഫലങ്ങളെയാണ് (diminishing returns) കാണിക്കുന്നത്: ഏറ്റവും വലിയ മോഡലുകൾ പോലും അടിസ്ഥാനപരമായ പെർസെപ്ഷൻ ടാസ്ക്കുകളിൽ ഇപ്പോഴും പതറുന്നു.

ഡെവലപ്പർമാർക്കുള്ള പ്രായോഗിക നടപടികൾ

  • പ്രത്യേക വിഷ്വൽ ക്ലാസിഫയറുകൾ നിലനിർത്തുക: കൃത്യത ആവശ്യമായ ജോലികൾക്കായി ഇവ ഉപയോഗിക്കുക; VLMs-നെ ഒരു പകരക്കാരനായല്ല, മറിച്ച് അനുബന്ധമായ ഒന്നായി കാണുക.
  • ഒരു വെരിഫിക്കേഷൻ ലെയർ ചേർക്കുക: മോഡൽ ഔട്ട്‌പുട്ടുകൾ ഉപയോക്താക്കളിലേക്ക് എത്തുന്നതിന് മുമ്പ് അവ വിശ്വസനീയമായ ഒരു ഡിറ്റക്ടറുമായി ഒത്തുനോക്കുക (cross-check).
  • ലഘുവായ ഒരു വിഷൻ ഫിൽട്ടർ ഉപയോഗിക്കുക: വ്യക്തമായ ഹാലൂസിനേഷനുകളോ തെറ്റായ വർഗ്ഗീകരണങ്ങളോ (misclassifications) തുടക്കത്തിൽ തന്നെ കണ്ടെത്താൻ ഇത് സഹായിക്കും.

ഒരു ജനറൽ-പർപ്പസ് VLM-നെ പ്രത്യേകമായി നിർമ്മിച്ച ഒരു വിഷൻ ഘടകവുമായി (vision component) സംയോജിപ്പിക്കുന്നത്, അതിന്റെ ദൃശ്യപരമായ പോരായ്മകളിൽ (blind spots) നിന്ന് സംരക്ഷണം നൽകുന്നതോടൊപ്പം തന്നെ അതിന്റെ റീസണിംഗ് കഴിവുകൾ ഉപയോഗപ്പെടുത്താനും ടീമുകളെ അനുവദിക്കുന്നു.

Source: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1