ActiveVision ബെഞ്ച്മാർക്ക് പ്രകാരം, ഒരു ചിത്രത്തിലേക്ക് ഒന്നിലധികം തവണ നോക്കേണ്ടി വരുന്ന ജോലികളിൽ ഇന്നത്തെ മുൻനിര മൾട്ടിമോഡൽ ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLMs) 10.6% മാത്രമേ വിജയകരമായി പൂർത്തിയാക്കുന്നുള്ളൂ. 17 ആവർത്തനപരമായ കാഴ്ചാ വെല്ലുവിളികൾ (iterative-perception challenges) നടത്തിയ പരീക്ഷണത്തിൽ, മനുഷ്യർ 96.1% തവണ വിജയിച്ചപ്പോൾ GPT-5.5 10.6% ഉം Claude Fable 5 3.5% ഉം മാത്രമാണ് വിജയിച്ചത്; പതിനൊന്ന് ജോലികളിൽ മോഡലുകൾക്ക് ശരിയായ ഉത്തരങ്ങളൊന്നും ലഭിച്ചില്ല.
നിലവിലെ വിഷൻ മോഡലുകൾ പരാജയപ്പെടുന്നത് എന്തുകൊണ്ട്
മിക്ക വിഷൻ സിസ്റ്റങ്ങളും ഒരു ചിത്രത്തെ ഒറ്റത്തവണ ഉപയോഗിക്കാവുന്ന ഇൻപുട്ട് ആയിട്ടാണ് കാണുന്നത്. ഒരു "വിഷൻ എൻകോഡർ" (vision encoder) ചിത്രത്തിൽ നിന്നുള്ള സവിശേഷതകൾ ഒരിക്കൽ മാത്രം വേർതിരിച്ചെടുക്കുകയും, പിന്നീട് അവ യുക്തിസഹമായി വിശകലനം ചെയ്യാൻ ലാംഗ്വേജ് മോഡലിന് കൈമാറുകയും ചെയ്യുന്നു. ഈ പൈപ്പ്ലൈനിന് രണ്ടാമതൊന്ന് നോക്കാനോ, ഒരു പ്രത്യേക ഭാഗത്തേക്ക് സൂം ചെയ്യാനോ, അല്ലെങ്കിൽ ഒരു അനുമാനം വീണ്ടും വിലയിരുത്താനോ കഴിയില്ല. ഇതിനു വിപരീതമായി, മനുഷ്യർ ആദ്യം ഒരു ഊഹം നടത്തുകയും, ശ്രദ്ധ മാറ്റുകയും, പുതിയ തെളിവുകൾ ശേഖരിക്കുകയും, അതിനനുസരിച്ച് ഉത്തരം ക്രമീകരിക്കുകയും ചെയ്യുന്നു. ഈ പ്രക്രിയയെയാണ് ബെഞ്ച്മാർക്ക് ഔദ്യോഗികമായി നിർവചിക്കുന്നത്: ഓരോ ജോലിയും ഒരു മോഡലിനെ നിരീക്ഷിക്കാനും, ഒരു പ്രവർത്തനം നിർദ്ദേശിക്കാനും, അതിന്റെ ഫലം നിരീക്ഷിക്കാനും, ശരിയായ നിഗമനത്തിൽ എത്തുന്നതുവരെ ഇത് ആവർത്തിക്കാനും നിർബന്ധിക്കുന്നു.
ബെഞ്ച്മാർക്ക് പരിശോധിച്ചത് എന്തൊക്കെയാണ്
ആവർത്തിച്ചുള്ള നിരീക്ഷണം ആവശ്യമായ 17 സാഹചര്യങ്ങളാണ് ഗവേഷകർ തയ്യാറാക്കിയത്. ഫലങ്ങൾ ഞെട്ടിക്കുന്നതാണ്:
- മനുഷ്യർ: 96.1% വിജയം
- GPT-5.5: 10.6% വിജയം
- Claude Fable 5: 3.5% വിജയം
- പതിനൊന്ന് ജോലികൾ: പരീക്ഷിച്ച എല്ലാ മോഡലുകളും പൂജ്യം മാർക്ക് നേടി
ചിത്രങ്ങൾ വീണ്ടും പ്രോസസ്സ് ചെയ്യാൻ മോഡലുകൾ കോഡ് നിർമ്മിച്ചപ്പോൾ പോലും, അവ സ്വന്തം ഔട്ട്പുട്ടിലെ പിശകുകൾ തിരിച്ചറിഞ്ഞില്ല. ഇത് ഈ പരിമിതി ഡാറ്റയുടെ കുറവ് കൊണ്ടല്ല, മറിച്ച് ആർക്കിടെക്ചറിലെ പോരായ്മകൾ കൊണ്ടാണെന്ന് സ്ഥിരീകരിക്കുന്നു.
ഡെവലപ്പർമാർക്കും വ്യവസായത്തിനും നേരിടേണ്ടി വരുന്ന വെല്ലുവിളികൾ
നിങ്ങൾ സ്വയം പ്രവർത്തിക്കുന്ന റോബോട്ടുകൾ (autonomous robots), പരിശോധനാ ഡ്രോണുകൾ (inspection drones), അല്ലെങ്കിൽ കാലക്രമേണ ദൃശ്യവിവരങ്ങൾ പരിശോധിക്കേണ്ടി വരുന്ന ഏതെങ്കിലും സംവിധാനം എന്നിവ നിർമ്മിക്കുകയാണെങ്കിൽ, ഒരു തവണ മാത്രം ചിത്രം വിശകലനം ചെയ്യുന്ന (single-shot) വിഷൻ മോഡലുകൾ ഉപയോഗിക്കുന്നത് അപകടകരമാണ്. നിലവിലെ LLM അധിഷ്ഠിത വിഷൻ പൈപ്പ്ലൈനുകൾക്ക് ഫീഡ്ബാക്ക് അടിസ്ഥാനമാക്കിയുള്ള കാഴ്ചാപരമായ തിരിച്ചറിവ് (feedback-driven perception) വിശ്വസനീയമായി കൈകാര്യം ചെയ്യാൻ കഴിയില്ലെന്ന് ബെഞ്ച്മാർക്ക് കാണിക്കുന്നു. അതിനാൽ അവയ്ക്ക് പിശകുകൾ കണ്ടെത്താനോ, വസ്തുക്കളുടെ എണ്ണം തെറ്റായി കണക്കാക്കാനോ, ചലനാത്മകമായ രംഗങ്ങൾ തെറ്റായി വ്യാഖ്യാനിക്കാനോ സാധ്യതയുണ്ട്. കൂടുതൽ പരിശീലന ഡാറ്റ നൽകുന്നതോ പാരാമീറ്ററുകൾ വർദ്ധിപ്പിക്കുന്നതോ ഈ വിടവ് നികത്താൻ സഹായിക്കില്ല; നിയന്ത്രിതവും ആവർത്തനപരവുമായ നിരീക്ഷണത്തിനുള്ള ഒരു സംവിധാനമാണ് ഇവിടെ ആവശ്യമായിട്ടുള്ളത്.
എതിർവാദം: വലിയ മോഡലുകൾ സഹായിക്കുമോ?
കൂടുതൽ പരിശീലന ഡാറ്റ നൽകുന്നതോ പാരാമീറ്ററുകൾ വർദ്ധിപ്പിക്കുന്നതോ ഈ വിടവ് നികത്താൻ സഹായിക്കില്ല; നിയന്ത്രിതവും ആവർത്തനപരവുമായ നിരീക്ഷണത്തിനുള്ള ഒരു സംവിധാനമാണ് ഇവിടെ ആവശ്യമായിട്ടുള്ളത്.
മുന്നോട്ടുള്ള വഴികൾ
ഗവേഷകർ ഒരു അനുബന്ധ ദിശ നിർദ്ദേശിക്കുന്നു:
- ആർക്കിടെക്ചറൽ പുനർരൂപകൽപ്പന (Architectural redesign) – മോഡലിന്റെ ആന്തരിക അവസ്ഥയെ അടിസ്ഥാനമാക്കി പുതിയ കാഴ്ചകൾ ആവശ്യപ്പെടാനോ, ഭാഗങ്ങൾ ക്രോപ്പ് ചെയ്യാനോ, അല്ലെങ്കിൽ വെളിച്ചം ക്രമീകരിക്കാനോ കഴിയുന്ന ഒരു നിയന്ത്രിത വിഷ്വൽ മോഡ്യൂൾ ഉൾപ്പെടുത്തുക.
ചുരുക്കത്തിൽ: നിലവിലെ മൾട്ടിമോഡൽ LLM-കൾ സ്ഥിരമായ ചിത്രങ്ങളിലെ ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകുന്നതിൽ മികച്ചവയാണ്, എന്നാൽ ഒരു പ്രശ്നം വീണ്ടും പരിശോധിക്കാൻ ആവശ്യമായി വരുമ്പോൾ അവ പരാജയപ്പെടുന്നു. യഥാർത്ഥ ദൃശ്യ ബുദ്ധി (visual intelligence) എന്നത് ഒരു ചിത്രം ഒരിക്കൽ മാത്രം വായിക്കുന്നതിന് പകരം, സ്വന്തം കാഴ്ചയെ നിയന്ത്രിക്കാൻ കഴിയുന്ന മോഡലുകളെ ആവശ്യപ്പെടുന്നു.
