Anthropic యొక్క Fable 5 మోడల్, కేవలం గేమ్ యొక్క విజువల్ అవుట్పుట్ను మాత్రమే ఉపయోగించి, చైనీస్ భాషా వెర్షన్ Pokémon FireRed ఆడుతూ, 1,785 టర్న్లలో మొదటి జిమ్ బ్యాడ్జ్ను సాధించింది మరియు దీని కోసం $65.40 ఖర్చు చేసింది. ఈ ప్రయోగం ద్వారా మోడల్ ఎటువంటి టెక్స్ట్ual ప్రాంప్ట్లు లేకుండా గేమ్ యొక్క ఒక గుర్తింపు పొందిన భాగాన్ని పూర్తి చేయగలదని నిరూపితమైంది, కానీ మోడల్ యొక్క 'థింకింగ్ చైన్' (thinking chain) లోని లోతైన విశ్లేషణ చూస్తే, అది ప్రతి పిక్సెల్ను నిజంగా "చూసి" మరియు విశ్లేషించడం కంటే, ముందుగానే గుర్తుంచుకున్న గేమ్ సమాచారాన్ని తిరిగి చెబుతోందని అర్థమవుతోంది.
Anthropic యొక్క వాదనకు పరీక్ష
Anthropic, Fable 5ని విడుదల చేసినప్పుడు, మోడల్ కేవలం స్క్రీన్ను మాత్రమే చూస్తూ Pokémon FireRedని ఎలా నావిగేట్ చేస్తుందో చూపే ఒక "విజన్-ఓన్లీ" (vision-only) డెమోను కంపెనీ హైలైట్ చేసింది. ఆ హెడ్లైన్ చూస్తుంటే, ఈ సిస్టమ్ ఏ విజువల్ ఎన్విరాన్మెంట్నైనా మొదటి నుండి అర్థం చేసుకోగలదని అనిపించింది. ఒక డెవలపర్, Anthropic లాంచ్ పేజీలో వివరించిన సెటప్ను పునరుత్పత్తి చేయడం ద్వారా మరియు గేమ్ యొక్క చైనీస్ అనువాదంతో మోడల్ను రన్ చేయడం ద్వారా ఆ వాదనను ధృవీకరించాలని నిర్ణయించుకున్నారు.
ప్రయోగం ఎలా నిర్వహించబడింది
ఒక కస్టమ్ హార్నెస్ (harness) మోడల్కు రా వీడియో ఫ్రేమ్లను అందించింది మరియు దాని చర్యల ఎంపికలను (action choices) క్యాప్చర్ చేసింది. ఈ హార్నెస్ Anthropic వివరణకు అనుగుణంగా ఉంది, ప్రతి కొత్త ఫ్రేమ్ను మోడల్కు పంపిస్తూ మరియు ఎంచుకున్న కంట్రోలర్ ఇన్పుట్ను తిరిగి చదువుతోంది. మోడల్ తన మొదటి జిమ్ బ్యాడ్జ్ను సాధించే వరకు పూర్తి గేమ్ లూప్ను ఈ పరీక్ష నిర్వహించింది, ఆపై అవతార్ Route 3కి చేరుకునే వరకు అంటే 2,000వ టర్న్ వరకు కొనసాగింది.
పరిమాణాత్మక ఫలితం స్పష్టంగా ఉంది:
- 1,785 టర్న్ల తర్వాత మొదటి జిమ్ బ్యాడ్జ్ లభించింది
- మొత్తం కంప్యూట్ ఖర్చు $65.40
- 2,000వ టర్న్ నాటికి అవతార్ Route 3 లో ఉంది
లాగ్లు (logs) ఏమి చెబుతున్నాయి
అయితే, మోడల్ అక్కడికి ఎలా చేరుకుందనే విషయంపై రా లాగ్లు వేరే కథను చెబుతున్నాయి. మోడల్ యొక్క అంతర్గత "థింకింగ్ చైన్" స్క్రీన్పై ఇంకా కనిపించని సమాచారాన్ని పదేపదే రాసుకుంటోంది.
- 78వ టర్న్లో, గేమ్ ప్రత్యర్థి ఎంపికను ఇంకా చూపించకపోయినప్పటికీ, ప్రత్యర్థి Charmanderని ఎంచుకుంటాడని మోడల్ గమనించింది.
- 141 టర్న్ల తర్వాత, గేమ్ చివరకు ప్లేయర్కు Oak’s Parcel అందించినప్పుడు, మోడల్ ఆ ఐటమ్ పేరును ఇప్పటికే తన నోట్స్లో నమోదు చేసింది.
- Route 3 గుండా ప్రయాణిస్తున్నప్పుడు, విజువల్ ఫీడ్లో ఎప్పుడూ కనిపించని ఒక ప్రసిద్ధ డైలాగ్ను ఉటంకిస్తూ, మోడల్ ఒక నిర్దిష్ట ట్రైనర్ను గుర్తించింది.
ఈ ఎంట్రీలు పిక్సెల్-బై-పిక్సెల్ విశ్లేషణ ద్వారా వచ్చినవి కావు. ఇవి గేమ్ యొక్క వివరణాత్మక స్క్రిప్ట్ను అంతర్గతీకరించుకున్న (internalized) సిస్టమ్ యొక్క లక్షణాలు—ఇంటర్నెట్లో లభించే వాక్త్రూస్ (walkthroughs), వికీలు మరియు ఫ్యాన్ వీడియోలలో ఉండే సమాచారం ఇవి. మరో మాటలో చెప్పాలంటే, మోడల్ తనకు ఇప్పటికే బాగా తెలిసిన మ్యాప్ను ధృవీకరించుకోవడానికి మాత్రమే విజన్ను ఉపయోగిస్తున్నట్లు కనిపిస్తోంది.
విజువల్-రీజనింగ్ బెంచ్మార్క్లకు ఇది ఎందుకు ముఖ్యం
ఈ ప్రయోగం అనేక విజువల్-రీజనింగ్ పరీక్షలలోని ఒక సూక్ష్మమైన కానీ కీలకమైన లోపాన్ని నొక్కి చెబుతోంది:
- క్లీన్ ఇన్పుట్ (Clean input) అనేది క్లీన్ నాలెడ్జ్ స్టేట్ను గ్యారెంటీ చేయదు. ఇమేజ్ స్ట్రీమ్ మాత్రమే ఏకైక ఛానెల్ అయినప్పటికీ, మోడల్ తాను గుర్తుంచుకున్న భారీ సమాచారాన్ని ఉపయోగించుకోవచ్చు.
- సిస్టమ్ ప్రాంప్ట్లు ట్రైనింగ్ డేటాను తుడిచివేయలేవు. పూర్తి వాక్త్రూని చూసిన మోడల్ను, మళ్ళీ రీట్రైనింగ్ చేయకుండా "మర్చిపోమని" బలవంతం చేయలేము.
- పనితీరు జ్ఞాపకశక్తిని (memory) కొలవవచ్చు, గ్రహణశక్తిని (perception) కాదు. టెస్ట్ ప్రపంచం తెలిసిన డేటాసెట్తో సరిపోలినప్పుడు, మోడల్ కొత్త విజువల్ సమాచారాన్ని నిజంగా విశ్లేషించే బదులు, ఒక ప్యాటర్న్ను మరొక ప్యాటర్న్తో సరిపోల్చడం ద్వారా విజయం సాధించగలదు.
బెంచ్మార్క్లు "విజన్-ఓన్లీ"ని విజువల్ రీజనింగ్కు ప్రత్యామ్నాయంగా పరిగణిస్తూనే ఉంటే, కొత్త వాతావరణాలను అర్థం చేసుకునే AI సామర్థ్యం గురించి చేసే వాదనలు అతిశయోక్తిగా మారే ప్రమాదం ఉంది. కంపెనీలు ఆకట్టుకునే సంఖ్యలను ప్రదర్శించవచ్చు, కానీ వాటి వెనుక ఉన్న నైపుణ్యం మాత్రం పరిమితంగానే ఉండవచ్చు—ఇది ఇన్వెస్టర్లు, డెవలపర్లు మరియు నిజంగా తెలియని వాతావరణాలలో పనిచేయవలసిన సేఫ్టీ-క్రిటికల్ సిస్టమ్స్ను నిర్మించే ఎవరికైనా చాలా ముఖ్యమైన విషయం.
ప్రతివాదన: గుర్తుంచుకోవడం నిజంగా సమస్యేనా?
తెలిసిన మ్యాప్ను ధృవీకరించడానికి కూడా ఒక రకమైన రీజనింగ్ అవసరమని కొందరు వాదిస్తారు: మోడల్ తన అంతర్గత ప్రతినిధిని (internal representation) ప్రస్తుత విజువల్ క్యూతో సరిపోల్చుకోవాలి. ఆ కోణంలో చూస్తే, ఈ డెమో ఒక ఉపయోగకరమైన సామర్థ్యాన్ని చూపిస్తుంది—అంటే ముందుగా ఉన్న నాలెడ్జ్ బేస్ను దృశ్యరూపంలో స్థిరపరచడానికి (ground) విజన్ను ఉపయోగించడం. ఈ అభ్యంతరం సమంజసమే; ఈ పనిలో గ్రహణశక్తి పరీక్ష (perceptual check) కూడా ఉంటుంది.
అయితే, బెంచ్మార్క్ యొక్క ప్రధాన లక్ష్యం సాధారణ (general) విజువల్ ఇన్ఫరెన్స్ను అంచనా వేయడం, నిల్వ చేయబడిన స్క్రిప్ట్ను తిరిగి పొందడం కాదు. సంఘటనలు జరగకముందే మోడల్ వాటిని ఊహించగలిగినప్పుడు, ఆ పరీక్ష ఇకపై గ్రహణశక్తిని మాత్రమే విశ్లేషించలేదు. ఉపయోగకరమైన గ్రౌండింగ్ మరియు నేరుగా మోసం చేయడం మధ్య ఉన్న గీత మసకబారుతుంది, మరియు ఫలితాలు విశ్లేషణాత్మక విలువను కోల్పోతాయి.
తదుపరి దశలు మరియు కమ్యూనిటీ స్పందన
To probe the limits of memorization, the tester is now running the same model on a modified map with altered geography. All code, the custom harness, and the full log files have been made public, inviting other researchers to replicate the experiment or apply it to different games. A discussion channel on a learning community platform has also been opened for ongoing dialogue.
Takeaway
A vision-only demo that succeeds because the model already knows the answer is not evidence of genuine visual reasoning. Benchmarks must separate memorized knowledge from on-the-fly perception, or else they risk overstating AI’s ability to navigate truly unknown visual worlds.
