Kipimo cha ActiveVision kinaonyesha kuwa mifano mikuu ya lugha kubwa ya multimodal (LLMs) ya leo imetatua 10.6% ya kazi zinazohitaji kutazama picha zaidi ya mara moja. Katika jaribio la changamoto 17 za mtazamo wa mfululizo (iterative-perception), binadamu walifanikiwa kwa 96.1% wakati GPT-5.5 ilifanikiwa kwa 10.6% na Claude Fable 5 ilifanikiwa kwa 3.5%; kazi kumi na moja hazikupata jibu sahihi hata moja kutoka kwa mifano hiyo.
Kwa nini mifano ya sasa ya uoni inakwama
Mifumo mingi ya uoni inachukulia picha kama ingizo la mara moja tu. "Vision encoder" hutoa sifa (features) mara moja, kisha inazikabidhi kwa mfano wa lugha kwa ajili ya kufanya mantiki. Mchakato huo hauwezi kuomba kutazama mara ya pili, kukuza eneo fulani (zoom in), au kutathmini upya nadharia. Binadamu, kinyume chake, hufanya makisio ya awali, hubadilisha mwelekeo wa fikra, hukusanya ushahidi mpya, na kurekebisha jibu lao. Kipimo hiki kinaweka utaratibu wa mzunguko huo: kila kazi inamlazimu mfano kutazama, kupendekeza hatua, kutazama matokeo, na kurudia mpaka wafikie hitimisho sahihi.
Kile kipimo kilichojaribu
Watafiti walitengeneza mazingira 17 yanayohitaji uchunguzi wa mara kwa mara. Matokeo ni ya kushtua:
- Washiriki binadamu: mafanikio ya 96.1%
- GPT-5.5: mafanikio ya 10.6%
- Claude Fable 5: mafanikio ya 3.5%
- Kazi kumi na moja: kila mfano uliojaribiwa ulipata sifuri
Hata wakati mifano ilipozalisha kodi (code) ili kuchakata upya picha, ilikosa makosa katika matokeo yake yenyewe, ikithibitisha kuwa kikwazo hicho ni cha kimuundo (architectural) badala ya kutokana na data pekee.
Hatari kwa watengenezaji na sekta ya viwanda
Ikiwa unajenga roboti zinazojitegemea, ndege zisizo na rubani za ukaguzi (inspection drones), au mfumo wowote unaopaswa kuhakiki taarifa za kuona kwa muda, mfano wa uoni wa mara moja (single-shot vision model) ni hatari. Kipimo kinaonyesha kuwa michakato ya uoni inayotegemea LLM kwa sasa haiwezi kushughulikia kwa uhakika mtazamo unaoendeshwa na mrejesho (feedback-driven perception), hivyo itakosa kasoro, itakosea kuhesabu vitu, au itatafsiri vibaya matukio yanayobadilika. Kuongeza data zaidi za mafunzo au kuongeza vigezo (parameters) hakutaziba pengo hilo; kiungo kinachokosekana ni utaratibu wa uchunguzi uliodhibitiwa na wa mfululizo (iterative observation).
Hoja ya kinyume: je, mifano mikubwa zaidi inaweza kusaidia?
Kuongeza data zaidi za mafunzo au kuongeza vigezo hakutaziba pengo hilo; kiungo kinachokosekana ni utaratibu wa uchunguzi uliodhibitiwa na wa mfululizo.
Njia za kuelekea mbele
Watafiti wanapendekeza mwelekeo wa ziada:
- Urejelezaji wa kimuundo (Architectural redesign) – weka moduli ya kuona inayoweza kudhibitiwa ambayo inaweza kuomba mitazamo mipya, kukata maeneo (crop regions), au kubadilisha hali ya mwanga kulingana na hali ya ndani ya mfano.
Muhtasari: LLM za sasa za multimodal zina uwezo mkubwa katika kujibu maswali ya picha tuli lakini zinashindwa wakati tatizo linahitaji kutazama tena. Akili ya kweli ya kuona itahitaji mifano inayoweza kudhibiti uoni wao wenyewe, si kusoma picha mara moja tu.
