Google imetangaza kuwa familia yake ya Gemini sasa inasaidia mfumo wa uchambuzi wa video wa “agentic” unaoweza kupunguza matumizi ya token hadi 88% kwenye vipimo vya kawaida (benchmarks), mabadiliko ambayo yanaweza kufanya AI ya video ndefu kuwa na gharama nafuu zaidi kwa watengenezaji.
Mfumo huu mpya unachukua nafasi ya mbinu ya zamani ya fremu kwa fremu—kawaida sampuli iliyofungwa ya fremu moja kwa kila sekunde—na kuleta mzunguko unaoongozwa na modeli (model-driven loop) unaoamua ni sehemu gani za video zitakazochunguzwa, kwa kasi gani, na kupitia njia gani (fremu, sauti, au nakala/transcript). Kwa kuchukua ishara (signals) zinazohitajika tu kwa swali maalum, mfumo huu unapunguza data inayotumwa kwenye modeli ya lugha huku bado ukikamata matukio ya chini ya sekunde ambayo sampuli ya kawaida ingeyakosa.
Kutoka Sampuli Iliyofungwa hadi Maono Huru (Autonomous Vision)
Uwezo wa awali wa video wa Gemini uliwalazimu watengenezaji kuchagua kiwango cha sampuli mapema. Kiwango cha juu kilimaanisha token nyingi zaidi na bili kubwa zaidi; kiwango cha chini kilikuwa na hatari ya kukosa vipande vya haraka. Toleo jipya la agentic, ambalo kwa sasa linapatikana kwa Gemini 3.7 Flash, 3.6 Flash na 3.5 Flash-Lite, linaingiza mzunguko wa “fikiri-tenda-angalia” (think-act-observe) moja kwa moja kwenye API. Kwanza, modeli inafanya mantiki kuhusu kazi husika. Kisha, inachagua sehemu ya kuchunguza. Hatimaye, inaangalia fremu zilizochaguliwa, vipande vya sauti, au sehemu za nakala. Ikiwa sehemu inaonekana yenye matokeo mazuri, modeli inachukua sampuli tena kwa undani zaidi papo hapo.
Sampuli hii inayobadilika inaruhusu modeli kupitia saa nyingi za video—fikiria hotuba ndefu au rekodi ya saa nyingi—bila kutumia mamilioni ya token. Vipimo vinavyoiga maswali-na-majibu ya video katika ulimwengu halisi (1H-VideoQA) na kazi pana za uelewa wa video (LVBench) vinaonyesha maswali yale yale yakikamilika kwa takriban sehemu moja ya kumi ya bajeti ya token huku yakitoa usahihi wa juu zaidi.
Kwa Nini Akiba ya Token Ni Muhimu
Idadi ya token inatafsiriwa moja kwa moja kuwa bili za API. Kwa mtengenezaji anayeunda zana ya kuhariri video kiotomatiki, video ya dakika 90 inayochakatwa kwa fremu moja kwa kila sekunde inaweza kuzalisha mamilioni ya token, na kusukuma gharama hadi mamia ya dola kwa kila saa ya maudhui. Punguzo la 88% linashusha takwimu hiyo hadi dola chache, na kufungua uchambuzi wa video wa kiwango kikubwa kwa kampuni changa (startups) na timu ndogo ambazo hapo awali zilikuwa zinakabiliwa na bili kubwa sana.
Faida hiyo ya gharama pia inapunguza vikwazo vya majaribio. Hapo awali, wahandisi waliandika kodi maalum ili kutambua nyakati muhimu, kutoa vipande vinavyohusika, na kuviingiza tena kwenye modeli. Kwa maono ya agentic yaliyojumuishwa kwenye Gemini API, watengenezaji huwasha kipengele hiki kwa kubadilisha mpangilio wa uchakataji kuwa “agentic” katika Google AI Studio au Gemini Enterprise Agent Platform. Google inaendelea kutumia kiwango cha kawaida cha token cha Gemini; hakuna malipo ya ziada kwa sampuli hii ya akili zaidi.
Usahihi Bila Kukisia
Kwa sababu modeli inaamua wapi pa kuangalia, inaweza kutambua matukio ya chini ya sekunde moja—jambo ambalo sampuli ya kawaida ya 1 FPS ingeliacha bila kukusudia. Usahihi huu ni muhimu kwa kuhesabu marudio katika video ya mazoezi, kufuatilia kitu katika eneo lenye watu wengi, au kuashiria hitilafu za ghafla katika video za usalama. Wakati modeli inapobainisha kipindi chenye matokeo mazuri, inaongeza kiwango cha fremu (frame-rate) kwa sehemu hiyo moja kwa moja, ikitoa data yenye ubora wa juu pale tu inapohitajika.
Mfumo huo huo unaendesha vipengele vinavyotumiwa na watumiaji kama vile “Ask YouTube,” ambapo watumiaji huuliza maswali ya picha wakati video ikiendelea na kupata majibu yanayozingatia maudhui halisi ya picha. Kwa kuweka kikomo cha kiasi cha video kinachotumwa kwenye modeli, kipengele hiki hujibu kwa haraka zaidi na kwa gharama nafuu, kikiboresha uzoefu wa mtumiaji bila kupoteza kina cha maelezo.
Mapungufu na Miingiliano Inayoweza Kutokea
Mbinu ya agentic si suluhisho la kila tatizo. Matumizi ya token yanapungua kwa kiasi kikubwa, lakini modeli bado inafanya mzunguko wake wa ndani, jambo ambalo linaweza kuongeza ucheleweshaji (latency) ikilinganishwa na kupitia fremu zilizochukuliwa sampuli mapema. Watengenezaji wanaolenga programu za wakati halisi (real-time) wanaweza kuhitaji kusawazisha gharama nafuu za token dhidi ya muda wa ziada wa uchakataji.
Utabiri ni wasiwasi mwingine. Kwa sababu modeli inaamua ni sehemu gani za kuchukua sampuli, idadi kamili ya token kwa video fulani inaweza kutofautiana kila wakati inapofanya kazi. Timu zinazohitaji bajeti kali zinaweza kuhitaji kujenga mfumo wa ufuatiliaji wa matumizi ya token, hasa wakati wa hatua za awali za kuunganisha mfumo.
Hatimaye, utoaji huu umezuiliwa kwa matoleo ya Flash ya Gemini pekee. Miradi inayotegemea modeli za zamani au zisizo za Flash haitafaidika mpaka itakapohamia kwenye matoleo hayo, jambo ambalo linaweza kuhusisha juhudi za ziada za uendelezaji.
Nini cha Kufuatilia Kufuatia Hili
- Mitindo ya utumiaji: Ripoti za awali kutoka kwa watengenezaji wanaotumia mfumo wa agentic zitafichua ikiwa upunguzaji wa gharama utadumu katika elimu, burudani, ufuatiliaji, na nyanja nyinginezo.
- Marekebisho ya bei: Google inaweza kurekebisha bei za tokeni au kuongeza mipango ya ngazi mbalimbali ikiwa mahitaji ya uchambuzi wa video wa kiasi kikubwa yataongezeka.
- Upanuzi wa vipengele: Kuingiza mzunguko uleule wa mantiki (reasoning loop) kwenye bidhaa nyingi zaidi za walaji kunaweza kuibua matumizi mapya na kuongeza uelewa mpana wa AI ya video inayotumia tokeni kwa ufanisi.
- Mageuzi ya viwango vya kulinganisha (benchmarks): Kadiri timu nyingi zinavyofanya majaribio kwenye seti za data za ulimwengu halisi, jamii itaboresha alama za 1H-VideoQA na LVBench, ikigundua uwezekano wa hali nadra (edge cases) ambapo sampuli tuli (static sampling) bado inafanya vizuri zaidi kuliko mfumo wa agentic.
Hitimisho
Uchambuzi wa video wa agentic wa Google unawawezesha watengenezaji kupunguza matumizi ya tokeni kwa hadi 88% huku wakipata ufahamu wa kina zaidi wa muda (temporal insight). Changamoto yake ni ongezeko kidogo la utata wa usindikaji na idadi inayobadilika ya tokeni, lakini kwa programu nyingi za video za muda mrefu, upunguzaji wa gharama na urahisi wa kuunganisha unazidi wasiwasi huo. Timu zinazojenga AI inayozingatia video zinapaswa kutathmini mfumo huu mpya haraka; uchumi wa kukuza uelewa wa video unaweza kuwa umebadilika hivi punde.
