Anthropic के Fable 5 मॉडल ने केवल गेम के विजुअल आउटपुट का उपयोग करके Pokémon FireRed के चीनी-भाषा वाले संस्करण को खेलते हुए, 1,785 टर्न में पहला जिम बैज हासिल किया और $65.40 खर्च किए। यह रन साबित करता है कि मॉडल बिना किसी टेक्स्टुअल प्रॉम्प्ट के गेम के एक पहचानने योग्य हिस्से को पूरा कर सकता है, लेकिन मॉडल की 'थिंकिंग चेन' (thinking chain) के गहन विश्लेषण से पता चलता है कि वह वास्तव में प्रत्येक पिक्सेल को "देखने" और उसके बारे में तर्क करने के बजाय, याद किए गए गेम ज्ञान को दोहरा रहा था।

Anthropic के दावे की परीक्षा

जब Anthropic ने Fable 5 रिलीज़ किया, तो कंपनी ने एक "विज़न-ओनली" (vision-only) डेमो पर ज़ोर दिया, जिसमें मॉडल ने केवल स्क्रीन को देखकर Pokémon FireRed में नेविगेट किया। हेडलाइन से ऐसा लग रहा था जैसे सिस्टम किसी भी विजुअल वातावरण को शुरुआत से ही समझ सकता है। एक डेवलपर ने Anthropic के लॉन्च पेज पर बताए गए सेटअप को फिर से बनाकर और गेम के चीनी अनुवाद पर मॉडल चलाकर उस दावे को सत्यापित करने का प्रयास किया।

प्रयोग कैसे किया गया

एक कस्टम हार्नेस (harness) ने मॉडल को रॉ वीडियो फ्रेम दिए और उसके एक्शन विकल्पों को कैप्चर किया। यह हार्नेस Anthropic के विवरण से मेल खाता था, जो प्रत्येक नए फ्रेम को मॉडल को भेजता था और चुने गए कंट्रोलर इनपुट को पढ़ता था। टेस्ट में गेम लूप को तब तक चलाया गया जब तक मॉडल ने अपना पहला जिम बैज नहीं जीत लिया, और फिर यह टर्न 2,000 तक जारी रहा, जब अवतार Route 3 पर पहुँच गया।

मात्रात्मक परिणाम स्पष्ट थे:

  • 1,785 टर्न के बाद पहला जिम बैज मिला
  • कुल कंप्यूट लागत $65.40
  • टर्न 2,000 तक अवतार Route 3 पर था

लॉग्स क्या खुलासा करते हैं

हालाँकि, रॉ लॉग्स इस बारे में एक अलग कहानी बताते हैं कि मॉडल वहाँ कैसे पहुँचा। मॉडल की आंतरिक "थिंकिंग चेन" ने बार-बार ऐसी जानकारी लिखी जो अभी तक स्क्रीन पर दिखाई नहीं दी थी।

  • टर्न 78 पर मॉडल ने नोट किया कि प्रतिद्वंद्वी Charmander को चुनेगा, भले ही गेम ने प्रतिद्वंद्वी का चयन प्रदर्शित नहीं किया था।
  • 141 टर्न बाद, जब गेम ने अंततः खिलाड़ी को Oak’s Parcel दिया, तो मॉडल ने पहले ही आइटम का नाम अपने नोट्स में दर्ज कर लिया था।
  • Route 3 पर यात्रा करते समय, मॉडल ने संवाद की एक प्रसिद्ध पंक्ति उद्धृत करके एक विशिष्ट ट्रेनर की पहचान की, जो विजुअल फीड में कभी नहीं दिखी थी।

ये प्रविष्टियाँ पिक्सेल-दर-पिक्सेल विश्लेषण का परिणाम नहीं हैं। ये एक ऐसे सिस्टम की पहचान हैं जिसने गेम की एक विस्तृत स्क्रिप्ट को आत्मसात कर लिया है—ठीक उसी तरह का ज्ञान जो इंटरनेट पर मौजूद वॉकथ्रू (walkthroughs), विकी और फैन वीडियो में पाया जाता है। दूसरे शब्दों में, ऐसा लगता है कि मॉडल विज़न का उपयोग केवल उस मैप की पुष्टि करने के लिए कर रहा है जिसे वह पहले से ही रट चुका है।

विजुअल-रीजनिंग बेंचमार्क के लिए यह क्यों महत्वपूर्ण है

यह प्रयोग कई विजुअल-रीजनिंग टेस्ट में एक सूक्ष्म लेकिन महत्वपूर्ण खामी को रेखांकित करता है:

  • क्लीन इनपुट एक क्लीन नॉलेज स्टेट की गारंटी नहीं देता। भले ही एकमात्र चैनल इमेज स्ट्रीम हो, मॉडल याद किए गए तथ्यों के विशाल भंडार का उपयोग कर सकता है।
  • सिस्टम प्रॉम्प्ट्स ट्रेनिंग डेटा को मिटा नहीं सकते। जिस मॉडल ने पूरा वॉकथ्रू देख लिया है, उसे बिना रीट्रेनिंग के "भूलने" के लिए मजबूर नहीं किया जा सकता।
  • परफॉरमेंस मेमोरी को माप सकती है, धारणा (perception) को नहीं। जब टेस्ट वर्ल्ड किसी ज्ञात डेटासेट से मेल खाता है, तो एक मॉडल नई विजुअल जानकारी की व्याख्या करने के बजाय पैटर्न से पैटर्न मिलाकर सफल हो सकता है।

यदि बेंचमार्क "विज़न-ओनली" को विजुअल रीजनिंग के प्रॉक्सी के रूप में मानना जारी रखते हैं, तो वे नए वातावरण को समझने की AI की क्षमता के बारे में दावों को बढ़ा-चढ़ाकर पेश करने का जोखिम उठाते हैं। कंपनियाँ प्रभावशाली नंबरों का बखान कर सकती हैं जबकि अंतर्निहित कौशल सीमित बना रह सकता है—एक ऐसा मुद्दा जो निवेशकों, डेवलपर्स और सुरक्षा-महत्वपूर्ण (safety-critical) सिस्टम बनाने वाले किसी भी व्यक्ति के लिए मायने रखता है जिन्हें वास्तव में अनदेखे परिवेश में काम करना होता है।

काउंटर-पॉइंट: क्या रटना वास्तव में एक समस्या है?

कुछ लोगों का तर्क है कि ज्ञात मैप की पुष्टि करने के लिए अभी भी एक प्रकार के तर्क की आवश्यकता होती है: मॉडल को अपने आंतरिक प्रतिनिधित्व (internal representation) को वर्तमान विजुअल संकेत के साथ संरेखित करना चाहिए। उस दृष्टिकोण से, डेमो एक उपयोगी क्षमता प्रदर्शित करता है—एक पूर्व-मौजूद ज्ञान आधार को ग्राउंड (ground) करने के लिए विज़न का उपयोग करना। आपत्ति वैध है; कार्य में वास्तव में एक धारणात्मक जांच (perceptual check) शामिल है।

हालाँकि, मुख्य बेंचमार्क लक्ष्य सामान्य विजुअल इन्फरेंस (visual inference) का आकलन करना है, न कि किसी संग्रहीत स्क्रिप्ट को पुनः प्राप्त करना। जब एक मॉडल घटनाओं के प्रकट होने से पहले ही उनकी भविष्यवाणी कर सकता है, तो टेस्ट अब धारणा (perception) को अलग नहीं कर पाता। उपयोगी ग्राउंडिंग और सीधे तौर पर धोखाधड़ी के बीच की रेखा धुंधली हो जाती है, और परिणाम अपना नैदानिक मूल्य (diagnostic value) खो देते हैं।

अगले कदम और समुदाय की प्रतिक्रिया

रटने की सीमाओं को परखने के लिए, टेस्टर अब परिवर्तित भूगोल वाले एक संशोधित मैप पर उसी मॉडल को चला रहा है। सारा कोड, कस्टम हार्नेस और पूरी लॉग फाइलें सार्वजनिक कर दी गई हैं, जिससे अन्य शोधकर्ताओं को इस प्रयोग को दोहराने या इसे विभिन्न गेम्स पर लागू करने के लिए आमंत्रित किया गया है। निरंतर संवाद के लिए एक लर्निंग कम्युनिटी प्लेटफॉर्म पर एक चर्चा चैनल भी खोला गया है।

मुख्य निष्कर्ष

एक विजन-ओनली डेमो, जो केवल इसलिए सफल होता है क्योंकि मॉडल को उत्तर पहले से ही पता है, वास्तविक विजुअल रीजनिंग का प्रमाण नहीं है। बेंचमार्क को रटे हुए ज्ञान और तात्कालिक धारणा (on-the-fly perception) के बीच अंतर करना चाहिए, अन्यथा वे वास्तव में अज्ञात विजुअल दुनियाओं में नेविगेट करने की AI की क्षमता को बढ़ा-चढ़ाकर दिखाने का जोखिम उठाते हैं।