Anthropic च्या Fable 5 मॉडेलने केवळ गेमच्या व्हिज्युअल आउटपुटचा वापर करून, Pokémon FireRed ची चिनी भाषेतील आवृत्ती खेळताना १,७८५ टर्नमध्ये पहिले जिम बॅज मिळवले आणि त्यासाठी $६५.४० खर्च केले. या प्रयोगातून हे सिद्ध होते की मॉडेल कोणत्याही टेक्स्ट प्रॉम्प्टशिवाय गेमचा एक ओळखण्यायोग्य भाग पूर्ण करू शकते, परंतु मॉडेलच्या 'थिंकिंग चेन'चा (thinking chain) सखोल अभ्यास केल्यास असे दिसून येते की ते प्रत्येक पिक्सेलला खरोखर "पाहून" त्यावर तर्क करण्याऐवजी, पाठांतर केलेल्या गेमच्या माहितीचा वापर करत होते.

Anthropic च्या दाव्याची कसोटी

जेव्हा Anthropic ने Fable 5 लाँच केले, तेव्हा कंपनीने एका "व्हिजन-ओन्ली" (vision-only) डेमोवर भर दिला, ज्यामध्ये मॉडेलने केवळ स्क्रीनकडे पाहून Pokémon FireRed मध्ये नेव्हिगेशन केले होते. या हेडलाईनवरून असे वाटत होते की हे सिस्टम कोणत्याही व्हिज्युअल वातावरणाचे शून्यातून विश्लेषण करू शकते. एका डेव्हलपरने Anthropic च्या लाँच पेजवर वर्णन केलेली सेटअप पुन्हा तयार करून आणि गेमच्या चिनी भाषांतरामध्ये मॉडेल चालवून या दाव्याची पडताळणी करण्याचा प्रयत्न केला.

प्रयोग कसा राबवला गेला

एका कस्टम हार्नेसने (harness) मॉडेलला रॉ व्हिडिओ फ्रेम्स पुरवल्या आणि त्याच्या कृतींच्या निवडी (action choices) कॅप्चर केल्या. हे हार्नेस Anthropic च्या वर्णनाशी सुसंगत होते; ते प्रत्येक नवीन फ्रेम मॉडेलला पाठवत असे आणि निवडलेले कंट्रोलर इनपुट वाचत असे. मॉडेलने पहिले जिम बॅज मिळवण्यापर्यंत गेम लूप पूर्णपणे चालवण्यात आला आणि त्यानंतर टर्न २,००० पर्यंत, म्हणजेच अवतार Route 3 वर पोहोचेपर्यंत, हा प्रयोग सुरू होता.

याचे परिमाणवाचक (quantitative) परिणाम स्पष्ट होते:

  • १,७८५ टर्न नंतर पहिले जिम बॅज मिळाले
  • एकूण कम्प्युट खर्च $६५.४०
  • टर्न २,००० पर्यंत अवतार Route 3 वर होता

लॉग्स (logs) काय दर्शवतात

तथापि, रॉ लॉग्स मॉडेल तिथे कसे पोहोचले याबद्दल वेगळीच गोष्ट सांगतात. मॉडेलच्या अंतर्गत "थिंकिंग चेन"मध्ये वारंवार अशी माहिती लिहिली जात होती जी अद्याप स्क्रीनवर दिसली नव्हती.

  • टर्न ७८ वर मॉडेलने नोंदवले की प्रतिस्पर्धी (rival) Charmander निवडेल, जरी गेममध्ये प्रतिस्पर्ध्याची निवड अद्याप प्रदर्शित झाली नव्हती.
  • १४१ टर्न नंतर, जेव्हा गेमने अखेर खेळाडूला Oak’s Parcel दिले, तेव्हा मॉडेलने त्या वस्तूचे नाव आधीच आपल्या नोट्समध्ये नोंदवले होते.
  • Route 3 वरून प्रवास करताना, मॉडेलने संवादातील एक प्रसिद्ध ओळ उद्धृत करून एका विशिष्ट ट्रेनरची ओळख पटवली, जी व्हिज्युअल फीडमध्ये कधीही दिसली नव्हती.

या नोंदी पिक्सेल-बाय-पिक्सेल विश्लेषणातून आलेल्या नाहीत. या अशा सिस्टमची लक्षणे आहेत जिने गेमची सविस्तर स्क्रिप्ट आत्मसात केली आहे—नेमकी तीच माहिती जी इंटरनेटवर उपलब्ध असलेल्या वॉकथ्रू (walkthroughs), विकी (wikis) आणि फॅन व्हिडिओमध्ये आढळते. दुसऱ्या शब्दांत सांगायचे तर, मॉडेल केवळ अशा नकाशाची पुष्टी करण्यासाठी व्हिजनचा वापर करत असल्याचे दिसते जो त्याला आधीच तोंडपाठ आहे.

व्हिज्युअल-रीझनिंग बेंचमार्कसाठी हे का महत्त्वाचे आहे

हा प्रयोग अनेक व्हिज्युअल-रीझनिंग चाचण्यांमधील एक सूक्ष्म पण गंभीर त्रुटी अधोरेखित करतो:

  • स्वच्छ इनपुट म्हणजे ज्ञानाची स्थितीही स्वच्छ असेलच याची खात्री नसते. जरी एकमेव चॅनेल इमेज स्ट्रीम असला, तरी मॉडेल पाठांतर केलेल्या तथ्यांच्या अफाट साठ्यातून माहिती घेऊ शकते.
  • सिस्टम प्रॉम्प्ट्स ट्रेनिंग डेटा पुसू शकत नाहीत. ज्या मॉडेलने संपूर्ण वॉकथ्रू पाहिले आहे, त्याला पुन्हा ट्रेनिंग दिल्याशिवाय ते "विसरणे" भाग पाडले जाऊ शकत नाही.
  • कामगिरी ही स्मृती मोजू शकते, आकलन (perception) नाही. जेव्हा टेस्ट वर्ल्ड एखाद्या ज्ञात डेटासेटशी जुळते, तेव्हा मॉडेल नवीन व्हिज्युअल माहितीचे प्रत्यक्ष विश्लेषण करण्याऐवजी केवळ पॅटर्नला पॅटर्नशी जुळवून यश मिळवू शकते.

जर बेंचमार्क्स "व्हिजन-ओन्ली"ला व्हिज्युअल रीझनिंगचा पर्याय मानत राहिले, तर नवीन वातावरणांना समजून घेण्याच्या AI च्या क्षमतेबद्दलचे दावे फुगवण्याचा धोका निर्माण होईल. कंपन्या प्रभावी आकडेवारीचे प्रदर्शन करू शकतात, परंतु मूळ कौशल्य मर्यादित राहू शकते—ही एक अशी समस्या आहे जी गुंतवणूकदार, डेव्हलपर्स आणि खरोखरच न पाहिलेल्या वातावरणात काम करणाऱ्या सुरक्षा-महत्त्वाच्या (safety-critical) सिस्टम्स बनवणाऱ्या प्रत्येकासाठी महत्त्वाची आहे.

प्रतिवाद: पाठांतर खरोखर समस्या आहे का?

काही लोकांचा असा युक्तिवाद आहे की ज्ञात नकाशाची पुष्टी करण्यासाठी तरीही एका प्रकारच्या तर्काची (reasoning) आवश्यकता असते: मॉडेलला त्याचे अंतर्गत प्रतिनिधित्व सध्याच्या व्हिज्युअल संकेतांशी जुळवावे लागते. त्या दृष्टिकोनातून, हा डेमो एक उपयुक्त क्षमता दर्शवतो—अस्तित्वात असलेल्या ज्ञानकोशाला आधार देण्यासाठी व्हिजनचा वापर करणे. हा आक्षेप योग्य आहे; या कामात आकलन तपासणी (perceptual check) समाविष्ट आहे.

तथापि, बेंचमार्कचे मुख्य उद्दिष्ट सामान्य व्हिज्युअल इन्फरन्स (visual inference) तपासणे हे आहे, साठवलेली स्क्रिप्ट शोधणे नाही. जेव्हा एखादे मॉडेल घटना घडण्यापूर्वीच त्यांचा अंदाज लावू शकते, तेव्हा ती चाचणी केवळ आकलनावर लक्ष केंद्रित करू शकत नाही. उपयुक्त ग्राउंडिंग आणि थेट फसवणूक यातील रेषा धूसर होते आणि निकालांचे निदानात्मक मूल्य (diagnostic value) कमी होते.

पुढील पावले आणि समुदायाचा प्रतिसाद

To probe the limits of memorization, the tester is now running the same model on a modified map with altered geography. All code, the custom harness, and the full log files have been made public, inviting other researchers to replicate the experiment or apply it to different games. A discussion channel on a learning community platform has also been opened for ongoing dialogue.

Takeaway

A vision-only demo that succeeds because the model already knows the answer is not evidence of genuine visual reasoning. Benchmarks must separate memorized knowledge from on-the-fly perception, or else they risk overstating AI’s ability to navigate truly unknown visual worlds.