விஷன்-லாங்குவேஜ் மாடல்கள் (VLMs) அடிப்படை காட்சித் பணிகளில் (visual tasks) இன்னும் முழுமையான வெற்றியைப் பெறவில்லை. புதிய PerceptionBench மதிப்பீடு ஒன்றின்படி, முன்னணியில் உள்ள பதினாறு அமைப்புகளில் எதுவுமே ஒட்டுமொத்தமாக 60% துல்லியத்தைத் தாண்டவில்லை என்பதையும், மிகச் சிறந்த மாடல் கூட எந்தவொரு தனித்திறனிலும் 80%-க்கும் கீழே உள்ளது என்பதையும் கண்டறிந்துள்ளது. பிரபலமான கேப்ஷனிங் (captioning) அல்லது பகுத்தறிவுத் தேர்வுகளில் அதிக மதிப்பெண்கள் கிடைப்பது, நம்பகமான பார்வையை உறுதி செய்வதில்லை என்று இந்த முடிவு டெவலப்பர்களுக்கு எச்சரிக்கிறது.

ஏன் தற்போதுள்ள சோதனைகள் இந்தப் பிரச்சனையை மறைக்கின்றன

பெரும்பாலான பொதுவான பெஞ்ச்மார்க்குகள் (benchmarks) பட விளக்கம், கேள்வி பதில் மற்றும் பொது அறிவுப் பகுத்தறிவு ஆகியவற்றை ஒன்றாகக் கலந்துள்ளன. ஒரு மாடல் தவறான கேப்ஷனைத் தரும்போது, அந்தத் தவறு மொழியியல் பிழையாக இருக்கலாம், பகுத்தறிவுத் தவறாக இருக்கலாம் அல்லது ஒரு பொருளை அடையாளம் காண்பதில் ஏற்பட்ட தோல்வியாக இருக்கலாம். இந்த மூன்று கூறுகளும் ஒன்றோடொன்று பிணைக்கப்பட்டுள்ளதால், குறைந்த மதிப்பெண் கிடைத்தால் அது காட்சித் திறனில் உள்ள குறைபாட்டைப் பற்றிய எந்தத் தகவலையும் தருவதில்லை. எனவே, செயலிகளை உருவாக்கும் குழுக்கள், மாடல் சரியாகப் "பார்க்கிறது" என்று கருதி, தலைப்புச் செய்திகளில் வரும் எண்களைக் கண்டுத் தவறான நம்பிக்கையைப் பெறுகின்றன.

PerceptionBench எவ்வாறு மாறுபடுகிறது

PerceptionBench பத்து காட்சித் திறன்களைத் தனிமைப்படுத்தி, ஒவ்வொரு மாடலையும் தூய-காட்சிப் பணித் தொகுப்பின் (pure-vision task set) அடிப்படையில் மதிப்பீடு செய்கிறது. மொழி மற்றும் பகுத்தறிவை நீக்குவதன் மூலம், இந்த பெஞ்ச்மார்க் அதன் காட்சி முன்பகுதி (visual front-end) எவ்வளவு சிறப்பாகச் செயல்படுகிறது என்பதைக் காட்டுகிறது. ஒட்டுமொத்தமாகப் பார்த்தால், முதல் பதினாறு சிறந்த VLMs 60% துல்லியத் எல்லையை எட்டவில்லை, மேலும் சிறந்த முறையில் செயல்படும் அமைப்பு கூட எந்தவொரு தனித்திறனிலும் 80%-ஐ எட்டவில்லை. ஹாலுசினேஷன் (Hallucination) — அதாவது படத்தில் இல்லாத விவரங்களை உருவாக்குவது — என்பது மிகவும் பொதுவான பிழையாக உள்ளது, அதே நேரத்தில் மாடல்களுக்கு இடையிலான பலம் மற்றும் பலவீனங்களின் முறைகள் பெரிதும் மாறுபடுகின்றன.

இதனால் யார் பாதிக்கப்படுவார்கள்

டெவலப்பர்கள் பிரத்யேக காட்சி வகைப்படுத்திகளை (dedicated visual classifiers), பொதுவான AI மாடல்களால் மாற்றக்கூடாது.

வாதம் எங்கே பலவீனமடைகிறது

PerceptionBench தரவுகள் குறைந்து வரும் பலன்களைக் காட்டுகின்றன: மிகப்பெரிய மாடல்கள் கூட அடிப்படைப் புலன்சார் பணிகளில் (perception tasks) இன்னும் தடுமாறுகின்றன.

டெவலப்பர்களுக்கான நடைமுறைப் படிகள்

  • துல்லியத்தைக் கோரும் பணிகளுக்கு பிரத்யேக காட்சி வகைப்படுத்திகளைத் தொடர்ந்து பயன்படுத்தவும்; VLMs-களை ஒரு மாற்றாகக் கருதாமல், கூடுதல் உதவியாளராகக் கருதவும்.
  • மாடலின் வெளியீடுகள் பயனரைச் சென்றடைவதற்கு முன், அவற்றை ஒரு நம்பகமான கண்டறியும் கருவியுடன் (detector) ஒப்பிட்டுச் சரிபார்க்கும் ஒரு சரிபார்ப்பு அடுக்கைச் (verification layer) சேர்க்கவும்.
  • தெளிவான ஹாலுசினேஷன்கள் அல்லது தவறான வகைப்பாடுகளைப் பணியின் தொடக்கத்திலேயே கண்டறிய ஒரு இலகுரகக் காட்சி வடிகட்டியை (lightweight vision filter) பயன்படுத்தவும்.

ஒரு பொதுவான பயன்பாட்டு VLM-ஐ, ஒரு குறிப்பிட்ட நோக்கத்திற்காக உருவாக்கப்பட்ட காட்சித் தொகுப்புடன் இணைப்பதன் மூலம், குழுக்கள் அதன் பகுத்தறிவுத் திறனைப் பயன்படுத்திக்கொள்ள முடியும், அதே நேரத்தில் அதன் காட்சிப் பார்வையில் உள்ள குறைகளிலிருந்தும் பாதுகாத்துக் கொள்ள முடியும்.

மூலம்: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1