Anthropic ના Fable 5 મોડેલે માત્ર ગેમના વિઝ્યુઅલ આઉટપુટનો ઉપયોગ કરીને Pokémon FireRed ના ચાઈનીઝ-ભાષાના વર્ઝન રમતી વખતે, $65.40 ખર્ચ કરીને 1,785 ટર્નમાં પ્રથમ જિમ બેજ (gym badge) જીતી લીધો. આ પ્રક્રિયા સાબિત કરે છે કે મોડેલ કોઈપણ ટેક્સ્ટ્યુઅલ પ્રોમ્પ્ટ વગર ગેમના ઓળખી શકાય તેવા ભાગને પૂર્ણ કરી શકે છે, પરંતુ મોડેલની 'થિંકિંગ ચેઈન' (thinking chain) ના ઊંડાણપૂર્વક વિશ્લેષણથી જાણવા મળે છે કે તે દરેક પિક્સેલને ખરેખર "જોઈ" અને તેના પર તર્ક કરવાને બદલે, મોઢે કરેલી ગેમની જાણકારી રજૂ કરી રહ્યું હતું.
Anthropic ના દાવાનું પરીક્ષણ
જ્યારે Anthropic એ Fable 5 રિલીઝ કર્યું, ત્યારે કંપનીએ એક "વિઝન-ઓન્લી" (vision-only) ડેમો પર ભાર મૂક્યો હતો જેમાં મોડેલે માત્ર સ્ક્રીન જોઈને Pokémon FireRed માં નેવિગેટ કર્યું હતું. હેડલાઇન વાંચતા એવું લાગતું હતું કે સિસ્ટમ કોઈપણ વિઝ્યુઅલ વાતાવરણને શૂન્યથી સમજી શકે છે. એક ડેવલપરે Anthropic ના લોન્ચ પેજ પર વર્ણવેલ સેટઅપને ફરીથી બનાવીને અને ગેમના ચાઈનીઝ અનુવાદ પર મોડેલ ચલાવીને તે દાવાને ચકાસવાનું નક્કી કર્યું.
પ્રયોગ કેવી રીતે કરવામાં આવ્યો હતો
એક કસ્ટમ હાર્નેસ (harness) એ મોડેલને રો (raw) વિડિયો ફ્રેમ્સ આપી અને તેના એક્શન ચોઈસને કેપ્ચર કરી. આ હાર્નેસ Anthropic ના વર્ણન સાથે સુસંગત હતું, જે દરેક નવી ફ્રેમ મોડેલને મોકલતું હતું અને પસંદ કરેલ કંટ્રોલર ઇનપુટને વાંચતું હતું. આ ટેસ્ટ મોડેલ પ્રથમ જિમ બેજ મેળવે ત્યાં સુધી આખી ગેમ લૂપ ચલાવતો રહ્યો, અને પછી ટર્ન 2,000 સુધી ચાલ્યો, જ્યારે અવતાર Route 3 પર પહોંચ્યો.
તેનું પરિણામ સ્પષ્ટ હતું:
- 1,785 ટર્ન પછી પ્રથમ જિમ બેજ મેળવ્યો
- કુલ કમ્પ્યુટ ખર્ચ $65.40
- ટર્ન 2,000 સુધીમાં અવતાર Route 3 પર હતો
લોગ્સ (logs) શું દર્શાવે છે
જોકે, રો લોગ્સ મોડેલ ત્યાં કેવી રીતે પહોંચ્યું તે વિશે અલગ જ વાર્તા કહે છે. મોડેલની આંતરિક "થિંકિંગ ચેઈન" વારંવાર એવી માહિતી લખતી હતી જે હજુ સ્ક્રીન પર દેખાઈ નહોતી.
- ટર્ન 78 પર મોડેલે નોંધ્યું કે પ્રતિસ્પર્ધી (rival) Charmander પસંદ કરશે, ભલે ગેમમાં પ્રતિસ્પર્ધીની પસંદગી દર્શાવવામાં આવી નહોતી.
- 141 ટર્ન પછી, જ્યારે ગેમે આખરે ખેલાડીને Oak’s Parcel આપ્યું, ત્યારે મોડેલે તેની નોંધમાં આ આઇટમનું નામ પહેલેથી જ રેકોર્ડ કરી લીધું હતું.
- Route 3 પર મુસાફરી કરતી વખતે, મોડેલે સંવાદની એક પ્રખ્યાત લાઇન ટાંકીને એક ચોક્કસ ટ્રેનરને ઓળખી કાઢ્યો, જે વિઝ્યુઅલ ફીડમાં ક્યારેય દેખાઈ નહોતી.
આ એન્ટ્રીઓ પિક્સેલ-બાય-પિક્સેલ વિશ્લેષણનું પરિણામ નથી. તે એવા સિસ્ટમની ઓળખ છે જેણે ગેમની વિગતવાર સ્ક્રિપ્ટને આત્મસાત કરી લીધી છે—બરાબર એ જ પ્રકારની જાણકારી જે ઇન્ટરનેટ પર ઉપલબ્ધ walkthroughs, wikis અને ફેન વિડિયોમાં જોવા મળે છે. બીજા શબ્દોમાં કહીએ તો, મોડેલ વિઝનને માત્ર એવા નકશાની પુષ્ટિ કરવા માટે વાપરતું હોય તેવું લાગે છે જે તે પહેલેથી જ મોઢે જાણે છે.
વિઝ્યુઅલ-રીઝનિંગ બેન્ચમાર્ક માટે આ કેમ મહત્વનું છે
આ પ્રયોગ ઘણા વિઝ્યુઅલ-રીઝનિંગ ટેસ્ટમાં રહેલી એક સૂક્ષ્મ પરંતુ નિર્ણાયક ખામીને રેખાંકિત કરે છે:
- ક્લીન ઇનપુટ ક્લીન નોલેજ સ્ટેટની ખાતરી આપતું નથી. ભલે એકમાત્ર ચેનલ ઇમેજ સ્ટ્રીમ હોય, મોડેલ મોઢે કરેલા તથ્યોના વિશાળ ભંડારનો ઉપયોગ કરી શકે છે.
- સિસ્ટમ પ્રોમ્પ્ટ્સ ટ્રેનિંગ ડેટાને ભૂંસી શકતા નથી. જે મોડેલે સંપૂર્ણ walkthrough જોયું હોય તેને ફરીથી ટ્રેનિંગ આપ્યા વિના "ભૂલી" જવા માટે મજબૂર કરી શકાતું નથી.
- પરફોર્મન્સ મેમરી માપી શકે છે, પર્સેપ્શન (perception) નહીં. જ્યારે ટેસ્ટ વર્લ્ડ જાણીતા ડેટાસેટ સાથે મેળ ખાય છે, ત્યારે મોડેલ નવી વિઝ્યુઅલ માહિતીનું અર્થઘટન કરવાને બદલે પેટર્નને પેટર્ન સાથે જોડીને સફળ થઈ શકે છે.
જો બેન્ચમાર્ક "વિઝન-ઓન્લી" ને વિઝ્યુઅલ રીઝનિંગના પ્રતિનિધિ તરીકે ગણવાનું ચાલુ રાખશે, તો તેઓ નવા વાતાવરણને સમજવાની AI ની ક્ષમતા વિશેના દાવાઓને વધારી દેવાનું જોખમ ઉઠાવશે. કંપનીઓ આકર્ષક આંકડાઓ બતાવી શકે છે જ્યારે મૂળભૂત કૌશલ્ય મર્યાદિત રહે છે—આ એક એવો મુદ્દો છે જે રોકાણકારો, ડેવલપર્સ અને સુરક્ષા-ક્રિટિકલ સિસ્ટમ્સ બનાવતા કોઈપણ વ્યક્તિ માટે મહત્વપૂર્ણ છે જેમને ખરેખર અજાણ્યા વાતાવરણમાં કામ કરવું પડે છે.
વિરોધ પક્ષ: શું મોઢે કરવું ખરેખર સમસ્યા છે?
કેટલાક દલીલ કરે છે કે જાણીતા નકશાની પુષ્ટિ કરવા માટે હજુ પણ એક પ્રકારના તર્કની જરૂર છે: મોડેલે તેની આંતરિક રજૂઆતને વર્તમાન વિઝ્યુઅલ સંકેત સાથે સુસંગત કરવી જોઈએ. તે દૃષ્ટિકોણથી, ડેમો એક ઉપયોગી ક્ષમતા દર્શાવે છે—પૂર્વ-અસ્તિત્વ ધરાવતા નોલેજ બેઝને પાયો આપવા માટે વિઝનનો ઉપયોગ કરવો. આ વાંધો યોગ્ય છે; કાર્યમાં પર્સેપ્ચ્યુઅલ ચેક (perceptual check) સામેલ છે.
જોકે, મુખ્ય બેન્ચમાર્કનો ધ્યેય સામાન્ય વિઝ્યુઅલ ઇન્ફરન્સ (inference) નું મૂલ્યાંકન કરવાનો છે, સંગ્રહિત સ્ક્રિપ્ટ મેળવવાનો નહીં. જ્યારે મોડેલ ઘટનાઓ દેખાય તે પહેલાં તેની આગાહી કરી શકે છે, ત્યારે ટેસ્ટ હવે પર્સેપ્શનને અલગ પાડી શકતું નથી. ઉપયોગી ગ્રાઉન્ડિંગ અને સીધી છેતરપિંડી વચ્ચેની રેખા ધૂંધળી બની જાય છે, અને પરિણામોનું નિદાન મૂલ્ય (diagnostic value) ઘટી જાય છે.
આગામી પગલાં અને સમુદાયનો પ્રતિસાદ
યાદશક્તિની મર્યાદાઓને તપાસવા માટે, ટેસ્ટર હવે બદલાયેલી ભૂગોળ ધરાવતા સુધારેલા નકશા પર તે જ મોડેલ ચલાવી રહ્યો છે. તમામ કોડ, કસ્ટમ હાર્નેસ અને સંપૂર્ણ લોગ ફાઇલો જાહેર કરવામાં આવી છે, જે અન્ય સંશોધકોને પ્રયોગનું પુનરાવર્તન કરવા અથવા તેને વિવિધ રમતોમાં લાગુ કરવા માટે આમંત્રિત કરે છે. સતત સંવાદ માટે લર્નિંગ કોમ્યુનિટી પ્લેટફોર્મ પર એક ચર્ચા ચેનલ પણ ખોલવામાં આવી છે.
મુખ્ય તારણ
માત્ર વિઝન-આધારિત ડેમો, જે મોડેલ પહેલેથી જ જવાબ જાણે છે તેના કારણે સફળ થાય છે, તે વાસ્તવિક વિઝ્યુઅલ રિઝનિંગનો પુરાવો નથી. બેન્ચમાર્ક્સ એ યાદ રાખેલું જ્ઞાન અને તાત્કાલિક અવલોકન (on-the-fly perception) વચ્ચે તફાવત કરવો જોઈએ, અન્યથા તે ખરેખર અજાણ્યા વિઝ્યુઅલ વિશ્વમાં નેવિગેટ કરવાની AI ની ક્ષમતાને અતિશયોક્તિભરી રીતે દર્શાવવાનું જોખમ ઊભું કરે છે.
