Modeli ya Fable 5 ya Anthropic ilishinda alama ya kwanza ya gym katika mizunguko 1,785, ikitumia $65.40, huku ikicheza toleo la lugha ya Kichina la Pokémon FireRed kwa kutumia matokeo ya picha pekee ya mchezo. Jaribio hilo linathibitisha kuwa modeli inaweza kumaliza sehemu inayotambulika ya mchezo bila maelekezo yoyote ya maandishi, lakini uchambuzi wa kina wa mnyororo wa mawazo (thinking chain) wa modeli unaonyesha kuwa ilikuwa ikikariri maarifa ya mchezo yaliyohifadhiwa badala ya "kuona" na kufanya mantiki kuhusu kila piksel.
Dai la Anthropic lilipimwa
Wakati Anthropic ilipotoa Fable 5, kampuni hiyo ilisisitiza onyesho la "vision-only" ambapo modeli iliongoza katika Pokémon FireRed kwa kuangalia skrini pekee. Kichwa cha habari kilifanya ionekane kana kwamba mfumo unaweza kutafsiri mazingira yoyote ya picha kuanzia mwanzo. Mvumbuzi mmoja aliamua kuhakiki dai hilo kwa kuiga mpangilio ulioelezwa kwenye ukurasa wa uzinduzi wa Anthropic na kuendesha modeli kwenye tafsiri ya Kichina ya mchezo huo.
Jinsi jaribio lilivyofanyika
Mfumo maalum (custom harness) uliipa modeli fremu za video mbichi na kunasa chaguzi zake za vitendo. Mfumo huo uliendana na maelezo ya Anthropic, ukipitisha kila fremu mpya kwa modeli na kusoma uingizaji ulioteuliwa wa kishikwambi (controller). Jaribio hilo liliendesha mzunguko mzima wa mchezo hadi modeli ilipopata alama yake ya kwanza ya gym, kisha likaendelea hadi mzunguko wa 2,000, ambapo avatar ilifika Route 3.
Matokeo ya kiasi yalikuwa wazi:
- Alama ya kwanza ya gym ilipatikana baada ya mizunguko 1,785
- Jumla ya gharama ya kompyuta ni $65.40
- Kufikia mzunguko wa 2,000, avatar ilikuwa kwenye Route 3
Kumbukumbu (logs) zinaonyesha nini
Hata hivyo, kumbukumbu mbichi zinaelezea hadithi tofauti kuhusu jinsi modeli ilivyofika hapo. "Mnyororo wa mawazo" wa ndani wa modeli uliandika mara kwa mara habari ambayo haijakuwa imeonekana kwenye skrini.
- Katika mzunguko wa 78, modeli ilibainisha kuwa mpinzani angechagua Charmander, ingawa mchezo haukuwa umeonyesha chaguo la mpinzani.
- Mizunguko 141 baadaye, wakati mchezo hatimaye ulipompa mchezaji Oak’s Parcel, modeli ilikuwa tayari imerekodi jina la kitu hicho kwenye maelezo yake.
- Wakati ikipita Route 3, modeli ilimtambua mwalimu (trainer) fulani kwa kunukuu sentensi maarufu ya mazungumzo ambayo haikuwahi kuonekana kwenye mtiririko wa picha.
Ingizo hizi si matokeo ya uchambuzi wa kila piksel. Ni alama za mfumo ambao umejifunza kwa undani mswada (script) wa mchezo huo—aina ile ile ya maarifa yanayopatikana kwenye walkthroughs, wikis, na video za mashabiki zinazojaza mtandao. Kwa maneno mengine, inaonekana kuwa modeli inatumia uono (vision) ili tu kuthibitisha ramani ambayo tayari inaijua kwa moyo.
Kwa nini ni muhimu kwa viwango vya upimaji wa mantiki ya picha (visual-reasoning benchmarks)
Jaribio hili linasisitiza kasoro ndogo lakini muhimu katika majaribio mengi ya mantiki ya picha:
- Ingizo safi haihakikishii hali safi ya maarifa. Hata wakati njia pekee ni mtiririko wa picha, modeli inaweza kutumia akiba kubwa ya ukweli uliokumbukwa.
- Maelekezo ya mfumo (system prompts) hayawezi kufuta data za mafunzo. Modeli ambayo imeona walkthrough kamili haiwezi kulazimishwa "kuisahau" bila kufanyiwa mafunzo upya.
- Utendaji unaweza kupima kumbukumbu, si utambuzi. Wakati ulimwengu wa jaribio unalingana na seti ya data inayojulikana, modeli inaweza kufanikiwa kwa kulinganisha mfumo na mfumo badala ya kutafsiri habari mpya za picha.
Ikiwa viwango vya upimaji (benchmarks) vitaendelea kuchukulia "vision-only" kama kigezo cha mantiki ya picha, vina hatari ya kukuza madai kuhusu uwezo wa AI kuelewa mazingira mapya. Makampuni yanaweza kujivunia namba za kuvutia huku ujuzi wa msingi unabaki kuwa mdogo—tatizo ambalo ni muhimu kwa wawekezaji, watengenezaji, na mtu yeyote anayetengeneza mifumo muhimu kwa usalama ambayo lazima ifanye kazi katika mazingira ambayo haijawahi kuonekana kabisa.
Hoja kinyume: je, kukariri ni tatizo kweli?
Baadhi wanahoji kuwa kuthibitisha ramani inayojulikana bado kunahitaji aina fulani ya mantiki: modeli lazima ilinganishe uwakilishi wake wa ndani na ishara ya picha ya sasa. Kutoka mtazamo huo, onyesho hilo linaonyesha uwezo muhimu—kutumia uono ili kuimarisha msingi wa maarifa uliopo tayari. Pingamizi hilo ni la msingi; kazi hiyo inahusisha ukaguzi wa utambuzi.
Hata hivyo, lengo kuu la upimaji ni kutathmini ufasiri wa jumla wa picha (general visual inference), si upatikanaji wa mswada uliohifadhiwa. Wakati modeli inaweza kutabiri matukio kabla hayajaonekana, jaribio hilo halitenganishi tena utambuzi. Mpaka kati ya kuimarisha maarifa na udanganyifu wa wazi unakuwa hafifu, na matokeo yanapoteza thamani ya utambuzi.
Hatua zinazofuata na mwitikio wa jamii
Ili kuchunguza mipaka ya kukariri, mtahini sasa anatumia modeli ile ile kwenye ramani iliyorekebishwa yenye jiografia iliyobadilishwa. Code zote, kifaa maalum cha majaribio (custom harness), na faili kamili za logi zimefanywa kuwa za umma, zikiwaandalia watafiti wengine fursa ya kurudia jaribio hilo au kulitumia kwenye michezo tofauti. Chaneli ya majadiliano kwenye jukwaa la jamii ya kujifunza pia imefunguliwa kwa ajili ya mazungumzo endelevu.
Funzo Kuu
Onyesho la majaribio la kuona pekee (vision-only demo) linalofanikiwa kwa sababu modeli tayari inajua jibu si ushahidi wa uwezo wa kweli wa kufikiri kwa kutumia uono (visual reasoning). Viwango vya utendaji (benchmarks) lazima vitenganishe maarifa yaliyokaririwa na uwezo wa kutambua mambo papo hapo (on-the-fly perception), vinginevyo vinahatarisha kutilia chumvi uwezo wa AI wa kuendesha katika ulimwengu wa kuona usiojulikana kabisa.
