Google એ જાહેરાત કરી છે કે તેના Gemini ફેમિલી હવે “agentic” વિડિયો-એનાલિસિસ મોડને સપોર્ટ કરે છે, જે સ્ટાન્ડર્ડ બેન્ચમાર્ક પર ટોકન વપરાશમાં 88% સુધીનો ઘટાડો કરી શકે છે. આ ફેરફાર ડેવલપર્સ માટે લાંબા વિડિયો AI ને નોંધપાત્ર રીતે સસ્તું બનાવી શકે છે.
આ નવો મોડ જૂની ફ્રેમ-બાય-ફ્રેમ પદ્ધતિ—જે સામાન્ય રીતે પ્રતિ સેકન્ડ એક ફ્રેમનો નિશ્ચિત સેમ્પલ હોય છે—તેને મોડલ-ડ્રિવન લૂપ સાથે બદલે છે, જે નક્કી કરે છે કે વિડિયોના કયા ભાગો તપાસવા, કઈ ઝડપે અને કઈ મોડાલિટી (ફ્રેમ્સ, ઓડિયો અથવા ટ્રાન્સક્રિપ્ટ) દ્વારા તપાસવા. ચોક્કસ ક્વેરી માટે જરૂરી સિગ્નલોને જ લેવાથી, સિસ્ટમ લેંગ્વેજ મોડલને મોકલવામાં આવતા ડેટામાં ઘટાડો કરે છે અને સાથે સાથે એવા સબ-સેકન્ડ ઇવેન્ટ્સને પણ પકડી લે છે જે સામાન્ય સેમ્પલિંગમાં રહી જાય.
ફિક્સ્ડ સેમ્પલિંગથી સ્વાયત્ત વિઝન (Autonomous Vision) સુધી
Gemini ની અગાઉની વિડિયો ક્ષમતાઓ ડેવલપર્સને પહેલેથી જ સેમ્પલિંગ રેટ પસંદ કરવા માટે મજબૂર કરતી હતી. ઊંચો રેટ એટલે વધુ ટોકન્સ અને ઊંચા બિલ; નીચો રેટ એટલે ઝડપી કટ્સ ચૂકી જવાનું જોખમ. નવો agentic વેરિઅન્ટ, જે હાલમાં Gemini 3.7 Flash, 3.6 Flash અને 3.5 Flash-Lite માટે ઉપલબ્ધ છે, તે સીધું જ API માં “think-act-observe” સાયકલને એમ્બેડ કરે છે. સૌ પ્રથમ, મોડલ કાર્ય વિશે વિચાર કરે છે. ત્યારબાદ, તે તપાસવા માટે એક સેગમેન્ટ પસંદ કરે છે. અંતે, તે પસંદ કરેલી ફ્રેમ્સ, ઓડિયો ક્લિપ્સ અથવા ટ્રાન્સક્રિપ્ટના અંશોનું અવલોકન કરે છે. જો કોઈ સેગમેન્ટ આશાસ્પદ લાગે, તો મોડલ તેને તરત જ વધુ ઝીણવટપૂર્વક રિસેમ્પલ કરે છે.
આ ડાયનેમિક સેમ્પલિંગ મોડલને લાખો ટોકન્સ ખર્ચ્યા વગર કલાકોના ફૂટેજ—જેમ કે આખું લેક્ચર અથવા કલાકોનું રેકોર્ડિંગ—માધ્યમથી પસાર થવા દે છે. વાસ્તવિક દુનિયાના વિડિયો-પ્રશ્ન-ઉત્તર (1H-VideoQA) અને વ્યાપક વિડિયો-અન્ડરસ્ટેન્ડિંગ કાર્યો (LVBench) ની નકલ કરતા બેન્ચમાર્ક દર્શાવે છે કે સમાન ક્વેરીઝ વધુ ચોકસાઈ આપતી વખતે અંદાજે દસમાં ભાગના ટોકન બજેટ સાથે પૂર્ણ થાય છે.
ટોકન બચત શા માટે મહત્વની છે
ટોકન કાઉન્ટ સીધું જ API બિલમાં રૂપાંતરિત થાય છે. ઓટોમેટેડ વિડિયો-એડિટિંગ ટૂલ બનાવતા ડેવલપર માટે, પ્રતિ સેકન્ડ એક ફ્રેમ સાથે પ્રોસેસ કરવામાં આવતા 90 મિનિટના વિડિયોથી કરોડો ટોકન્સ જનરેટ થઈ શકે છે, જેનાથી કન્ટેન્ટના દરેક કલાક દીઠ ખર્ચ સેંકડો ડોલર સુધી પહોંચી શકે છે. 88% નો ઘટાડો આ આંકડાને થોડા દસ ડોલર સુધી લાવી દે છે, જે સ્ટાર્ટઅપ્સ અને નાની ટીમો માટે મોટા પાયે વિડિયો એનાલિસિસના દ્વાર ખોલે છે જેઓ અગાઉ ખૂબ ઊંચા બિલનો સામનો કરતા હતા.
ખર્ચનો આ ફાયદો પ્રયોગો કરવા માટેના અવરોધોને પણ ઘટાડે છે. અગાઉ, એન્જિનિયરો મુખ્ય ક્ષણો શોધવા, સંબંધિત ક્લિપ્સ કાઢવા અને તેને મોડલમાં પાછા ફીડ કરવા માટે કસ્ટમ કોડ લખતા હતા. Gemini API માં agentic વિઝન સામેલ હોવાથી, ડેવલપર્સ Google AI Studio અથવા Gemini Enterprise Agent Platform માં પ્રોસેસિંગ કોન્ફિગરેશનને “agentic” પર સેટ કરીને આ ફીચર સક્રિય કરી શકે છે. Google સ્ટાન્ડર્ડ Gemini ટોકન રેટ જ રાખે છે; સ્માર્ટ સેમ્પલિંગ માટે કોઈ વધારાનો સરચાર્જ નથી.
અનુમાન વગરની ચોકસાઈ
મોડલ પોતે નક્કી કરે છે કે ક્યાં જોવું, તેથી તે એક સેકન્ડથી પણ ટૂંકી ઘટનાઓને શોધી શકે છે—જે સ્થિર 1 FPS સેમ્પલ ચોક્કસપણે ચૂકી જાય. વર્કઆઉટ વિડિયોમાં રિપીટેશન ગણવા, ભીડભાડવાળા સીનમાં કોઈ વસ્તુને ટ્રેક કરવા અથવા સિક્યુરિટી ફૂટેજમાં અચાનક અસાધારણ ઘટનાઓ શોધવા માટે આ ચોકસાઈ મહત્વની છે. જ્યારે મોડલ કોઈ આશાસ્પદ વિન્ડોને ફ્લેગ કરે છે, ત્યારે તે તે ભાગ માટે આપમેળે ફ્રેમ-રેટ વધારી દે છે, અને જ્યાં જરૂર હોય ત્યાં જ હાઈ-ફિડેલિટી ડેટા પૂરો પાડે છે.
આ જ મિકેનિઝમ “Ask YouTube” જેવા ગ્રાહક-લક્ષી ફીચર્સને સજ્જ કરે છે, જ્યાં વપરાશકર્તાઓ વિડિયો ચાલતી વખતે વિઝ્યુઅલ પ્રશ્નો પૂછે છે અને વાસ્તવિક વિઝ્યુઅલ કન્ટેન્ટ પર આધારિત જવાબો મેળવે છે. મોડલને મોકલવામાં આવતા વિડિયોના પ્રમાણને મર્યાદિત કરીને, આ ફીચર ઝડપથી અને ઓછા ખર્ચે પ્રતિસાદ આપે છે, જે ઊંડાણ સાથે સમાધાન કર્યા વિના યુઝર એક્સપિરિયન્સમાં સુધારો કરે છે.
સંભવિત મર્યાદાઓ અને ટ્રેડ-ઓફ્સ
Agentic અભિગમ કોઈ જાદુઈ લાકડી (silver bullet) નથી. ટોકન વપરાશમાં મોટો ઘટાડો થાય છે, પરંતુ મોડલ હજુ પણ તેનું આંતરિક લૂપ ચલાવે છે, જે પહેલેથી સેમ્પલ કરેલી ફ્રેમ્સ પર સીધા પાસની સરખામણીમાં લેટન્સી વધારી શકે છે. રિયલ-ટાઇમ એપ્લિકેશન્સ પર ધ્યાન કેન્દ્રિત કરતા ડેવલપર્સ માટે ઓછા ટોકન ખર્ચ અને વધારાના પ્રોસેસિંગ સમય વચ્ચે સંતુલન જાળવવું પડી શકે છે.
અનુમાનિતતા (Predictability) એ બીજી ચિંતા છે. મોડલ નક્કી કરે છે કે કયા સેગમેન્ટ્સને સેમ્પલ કરવા, તેથી આપેલ વિડિયો માટે ચોક્કસ ટોકન કાઉન્ટ દરેક વખતે અલગ હોઈ શકે છે. જે ટીમોને કડક બજેટિંગની જરૂર હોય તેમને, ખાસ કરીને શરૂઆતના ઇન્ટિગ્રેશન દરમિયાન, ટોકન વપરાશ પર દેખરેખ રાખવા માટે મોનિટરિંગ બનાવવું પડી શકે છે.
અંતે, આ રોલઆઉટ Gemini ના Flash વેરિઅન્ટ્સ પૂરતું મર્યાદિત છે. જે પ્રોજેક્ટ્સ જૂના અથવા નોન-ફ્લેશ મોડલ્સ પર આધારિત છે તેઓ જ્યાં સુધી માઇગ્રેટ ન થાય ત્યાં સુધી તેનો લાભ લઈ શકશે નહીં, જેમાં વધારાના ડેવલપમેન્ટ પ્રયત્નો સામેલ હોઈ શકે છે.
આગળ શું જોવું
- સ્વીકૃતિના વલણો: એજન્ટિક મોડનો ઉપયોગ કરતા ડેવલપર્સના પ્રારંભિક અહેવાલો એ દર્શાવશે કે શિક્ષણ, મનોરંજન, દેખરેખ અને અન્ય ક્ષેત્રોમાં ખર્ચમાં થતી બચત ટકી રહે છે કે નહીં.
- કિંમતમાં ફેરફાર: જો મોટા પ્રમાણમાં વિડિયો વિશ્લેષણ માટેની માંગમાં વધારો થાય, તો Google ટોકન પ્રાઇસિંગમાં ફેરફાર કરી શકે છે અથવા સ્તરિત (tiered) પ્લાન ઉમેરી શકે છે.
- ફીચર વિસ્તરણ: વધુ ગ્રાહક ઉત્પાદનોમાં સમાન રીઝનિંગ લૂપને સામેલ કરવાથી નવા ઉપયોગના કિસ્સાઓ (use cases) સામે આવી શકે છે અને ટોકન-કાર્યક્ષમ વિડિયો AI વિશે વ્યાપક જાગૃતિ લાવી શકે છે.
- બેન્ચમાર્ક ઉત્ક્રાંતિ: જેમ જેમ વધુ ટીમો વાસ્તવિક ડેટાસેટ્સ પર પરીક્ષણ કરશે, તેમ સમુદાય 1H-VideoQA અને LVBench સ્કોર્સને વધુ સચોટ બનાવશે, જે સંભવતઃ એવા એજ કેસ (edge cases) શોધી કાઢશે જ્યાં સ્ટેટિક સેમ્પલિંગ હજુ પણ એજન્ટિક પદ્ધતિ કરતા વધુ સારું પ્રદર્શન કરે છે.
નિષ્કર્ષ
Google નું એજન્ટિક વિડિયો વિશ્લેષણ ડેવલપર્સને વધુ સચોટ ટેમ્પોરલ ઇનસાઇટ (temporal insight) મેળવવાની સાથે ટોકન વપરાશમાં 88% સુધીનો ઘટાડો કરવાની મંજૂરી આપે છે. તેના બદલામાં પ્રોસેસિંગની જટિલતા અને બદલાતા ટોકન કાઉન્ટમાં થોડો વધારો થાય છે, પરંતુ ઘણા લાંબા વિડિયો એપ્લિકેશન્સ માટે, ખર્ચમાં બચત અને ઇન્ટિગ્રેશનની સરળતા આ ચિંતાઓ કરતા વધુ મહત્વની છે. વિડિયો-કેન્દ્રિત AI બનાવતી ટીમોએ આ નવા મોડનું ઝડપથી મૂલ્યાંકન કરવું જોઈએ; વિડિયો સમજણના સ્કેલિંગના અર્થશાસ્ત્રમાં કદાચ હમણાં જ મોટો ફેરફાર થયો હોય શકે છે.
