Google തങ്ങളുടെ Gemini കുടുംബത്തിലേക്ക് പുതിയൊരു “agentic” വീഡിയോ-വിശകലന രീതി (video-analysis mode) അവതരിപ്പിച്ചു എന്ന് അറിയിച്ചു. ഇത് സ്റ്റാൻഡേർഡ് ബെഞ്ച്മാർക്കുകളിൽ ടോക്കൺ ഉപയോഗം 88% വരെ കുറയ്ക്കാൻ സഹായിക്കുന്നു. ഈ മാറ്റം ഡെവലപ്പർമാർക്ക് ദീർഘമായ വീഡിയോകൾ ഉപയോഗിച്ചുള്ള AI നിർമ്മാണം വളരെ ലാഭകരമാക്കും.

പഴയ ഫ്രെയിം-ബൈ-ഫ്രെയിം രീതിക്ക് (സാധാരണയായി സെക്കൻഡിൽ ഒരു ഫ്രെയിം എന്ന രീതി) പകരം, വീഡിയോയുടെ ഏത് ഭാഗം, ഏത് വേഗതയിൽ, ഏത് രീതിയിൽ (ഫ്രെയിമുകൾ, ഓഡിയോ, അല്ലെങ്കിൽ ട്രാൻസ്ക്രിപ്റ്റ്) പരിശോധിക്കണമെന്ന് തീരുമാനിക്കുന്ന ഒരു മോഡൽ-ഡ്രൈവൻ ലൂപ്പ് ആണ് ഈ പുതിയ രീതിയിൽ ഉപയോഗിക്കുന്നത്. ഒരു പ്രത്യേക ചോദ്യത്തിന് ആവശ്യമായ വിവരങ്ങൾ മാത്രം എടുക്കുന്നതിലൂടെ, ലാംഗ്വേജ് മോഡലിലേക്ക് അയക്കുന്ന ഡാറ്റ കുറയ്ക്കാൻ ഇതിന് സാധിക്കുന്നു. അതേസമയം, സാധാരണ സാമ്പിളിംഗിലൂടെ നഷ്ടപ്പെട്ടുപോകുന്ന സെക്കൻഡിന്റെ ചെറിയ ഭാഗങ്ങളിലെ സംഭവങ്ങൾ പോലും ഇതിലൂടെ കണ്ടെത്താനാകും.

ഫിക്സഡ് സാമ്പിളിംഗിൽ നിന്ന് സ്വയംഭരണാധികാരമുള്ള വിഷനിൽ (Autonomous Vision) നിന്ന്

Gemini-യുടെ മുൻപത്തെ വീഡിയോ കഴിവുകളിൽ, ഡെവലപ്പർമാർ മുൻകൂട്ടി ഒരു സാമ്പിളിംഗ് റേറ്റ് തിരഞ്ഞെടുക്കേണ്ടി വരുമായിരുന്നു. ഉയർന്ന റേറ്റ് എന്നാൽ കൂടുതൽ ടോക്കണുകളും ഉയർന്ന ചിലവും; കുറഞ്ഞ റേറ്റ് എന്നാൽ വേഗത്തിലുള്ള മാറ്റങ്ങൾ (cuts) നഷ്ടപ്പെടാനുള്ള സാധ്യതയും ഉണ്ടായിരുന്നു. നിലവിൽ Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite എന്നിവയിൽ ലഭ്യമായ പുതിയ ഏജൻറ്റിക് വേരിയന്റ്, API-യിൽ നേരിട്ട് ഒരു “think-act-observe” സൈക്കിൾ ഉൾപ്പെടുത്തുന്നു. ആദ്യം, മോഡൽ ആ ടാസ്കിനെക്കുറിച്ച് ചിന്തിക്കുന്നു. അടുത്തതായി, പരിശോധിക്കേണ്ട ഭാഗം അത് തിരഞ്ഞെടുക്കുന്നു. ഒടുവിൽ, തിരഞ്ഞെടുത്ത ഫ്രെയിമുകൾ, ഓഡിയോ ക്ലിപ്പുകൾ അല്ലെങ്കിൽ ട്രാൻസ്ക്രിപ്റ്റ് ഭാഗങ്ങൾ എന്നിവ നിരീക്ഷിക്കുന്നു. ഒരു ഭാഗം കൂടുതൽ വിവരങ്ങൾ നൽകുമെന്ന് തോന്നിയാൽ, മോഡൽ അത് കൂടുതൽ സൂക്ഷ്മമായി വീണ്ടും പരിശോധിക്കുന്നു.

ഈ ഡൈനാമിക് സാമ്പിളിംഗ് രീതിയിലൂടെ, ദീർഘമായ വീഡിയോകൾ (ഉദാഹരണത്തിന് മണിക്കൂറുകൾ നീളുന്ന പ്രഭാഷണങ്ങൾ അല്ലെങ്കിൽ റെക്കോർഡിംഗുകൾ) ലക്ഷക്കണക്കിന് ടോക്കണുകൾ പാഴാക്കാതെ പരിശോധിക്കാൻ മോഡലിന് സാധിക്കും. യഥാർത്ഥ വീഡിയോ-ചോദ്യോത്തരങ്ങൾ (1H-VideoQA), വീഡിയോ അണ്ടർസ്റ്റാൻഡിംഗ് (LVBench) തുടങ്ങിയ ബെഞ്ച്മാർക്കുകൾ പ്രകാരം, പത്തിലൊന്ന് ടോക്കൺ ഉപയോഗിച്ച് കൂടുതൽ കൃത്യതയോടെ തന്നെ ഇത്തരം ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാൻ ഇതിന് കഴിയുന്നു.

എന്തുകൊണ്ടാണ് ടോക്കൺ ലാഭത്തിൽ പ്രാധാന്യം നൽകുന്നത്?

ടോക്കൺ എണ്ണം നേരിട്ട് API ബില്ലുകളെ ബാധിക്കുന്നു. ഒരു ഓട്ടോമേറ്റഡ് വീഡിയോ എഡിറ്റിംഗ് ടൂൾ നിർമ്മിക്കുന്ന ഡെവലപ്പറെ സംബന്ധിച്ചിടത്തോളം, സെക്കൻഡിൽ ഒരു ഫ്രെയിം എന്ന രീതിയിൽ 90 മിനിറ്റ് ദൈർഘ്യമുള്ള ഒരു വീഡിയോ പ്രോസസ്സ് ചെയ്താൽ കോടിക്കണക്കിന് ടോക്കണുകൾ ആവശ്യമായി വരും. ഇത് ഓരോ മണിക്കൂർ വീഡിയോയ്ക്കും നൂറുകണക്കിന് ഡോളർ ചിലവ് വരുത്തിവെക്കും. എന്നാൽ 88% കുറവ് വരുന്നതോടെ ഈ ചിലവ് ഏതാനും ഡോളറുകളായി കുറയും. ഇത് വലിയ തോതിലുള്ള വീഡിയോ വിശകലനം മുൻപ് വലിയ ചിലവ് കാരണം ചെയ്യാൻ കഴിയാതിരുന്ന സ്റ്റാർട്ടപ്പുകൾക്കും ചെറിയ ടീമുകൾക്കും സാധ്യമാക്കുന്നു.

പരീക്ഷണങ്ങൾ നടത്തുന്നതിനുള്ള തടസ്സങ്ങളും ഇത് കുറയ്ക്കുന്നു. മുൻപ്, പ്രധാന നിമിഷങ്ങൾ കണ്ടെത്താനും അവ വേർതിരിച്ചെടുത്ത് മോഡലിലേക്ക് നൽകാനും എഞ്ചിനീയർമാർക്ക് പ്രത്യേക കോഡുകൾ എഴുതേണ്ടി വരുമായിരുന്നു. എന്നാൽ Gemini API-യിൽ ഏജൻറ്റിക് വിഷൻ ഉൾപ്പെടുത്തിയതോടെ, Google AI Studio അല്ലെങ്കിൽ Gemini Enterprise Agent Platform-ൽ പ്രോസസ്സിംഗ് കോൺഫിഗറേഷൻ “agentic” എന്ന് മാറ്റുന്നതിലൂടെ ഡെവലപ്പർമാർക്ക് ഈ ഫീച്ചർ ഉപയോഗിക്കാം. ഗൂഗിൾ നിലവിലുള്ള Gemini ടോക്കൺ നിരക്ക് തന്നെ തുടരുന്നു; ഈ പുതിയ സാമ്പിളിംഗ് രീതിക്കായി അധിക ചാർജ് ഈടാക്കുന്നില്ല.

ഊഹങ്ങൾ ഇല്ലാതെ കൃത്യതയോടെ

മോഡൽ എവിടെ നോക്കണമെന്ന് സ്വയം തീരുമാനിക്കുന്നതുകൊണ്ട്, ഒരു സെക്കൻഡിൽ താഴെ മാത്രം ദൈർഘ്യമുള്ള സംഭവങ്ങൾ പോലും കണ്ടെത്താൻ ഇതിന് സാധിക്കും—സാധാരണ 1 FPS സാമ്പിളിംഗിലൂടെ ഇത് സാധ്യമാകില്ല. വർക്ക്ഔട്ട് വീഡിയോകളിൽ ആവർത്തനങ്ങൾ എണ്ണുന്നതിനും, തിരക്കുള്ള ദൃശ്യങ്ങളിൽ ഒരു വസ്തുവിനെ പിന്തുടരുന്നതിനും, സെക്യൂരിറ്റി ദൃശ്യങ്ങളിലെ പെട്ടെന്നുള്ള മാറ്റങ്ങൾ കണ്ടെത്തുന്നതിനും ഈ കൃത്യത വളരെ പ്രധാനമാണ്. മോഡൽ ഒരു ഭാഗം ശ്രദ്ധേയമാണെന്ന് കണ്ടെത്തിയാൽ, ആ ഭാഗത്തെ ഫ്രെയിം-റേറ്റ് സ്വയമേവ വർദ്ധിപ്പിക്കുകയും ആവശ്യമുള്ള ഇടങ്ങളിൽ മാത്രം ഉയർന്ന നിലവാരമുള്ള ഡാറ്റ നൽകുകയും ചെയ്യുന്നു.

ഉപഭോക്താക്കൾക്കായി ലഭ്യമായ “Ask YouTube” പോലുള്ള ഫീച്ചറുകൾ പ്രവർത്തിക്കുന്നത് ഇതേ സാങ്കേതികവിദ്യ ഉപയോഗിച്ചാണ്. ഇതിലൂടെ വീഡിയോ പ്ലേ ചെയ്യുമ്പോൾ തന്നെ ഉപയോക്താക്കൾക്ക് ദൃശ്യങ്ങളെ സംബന്ധിച്ച ചോദ്യങ്ങൾ ചോദിക്കാനും വീഡിയോയിലെ കാര്യങ്ങളെ അടിസ്ഥാനമാക്കി ഉത്തരം ലഭിക്കാനും സാധിക്കുന്നു. മോഡലിലേക്ക് അയക്കുന്ന വീഡിയോയുടെ അളവ് പരിമിതപ്പെടുത്തുന്നതിലൂടെ, ഈ ഫീച്ചർ വേഗത്തിലും കുറഞ്ഞ ചിലവിലും പ്രവർത്തിക്കുന്നു, ഇത് ഉപയോക്താവിന്റെ അനുഭവം മെച്ചപ്പെടുത്തുന്നു.

പരിമിതികളും വിട്ടുവീഴ്ചകളും

ഏജൻറ്റിക് രീതി എല്ലാ പ്രശ്നങ്ങൾക്കും പരിഹാരമല്ല. ടോക്കൺ ഉപയോഗം ഗണ്യമായി കുറയുന്നുണ്ടെങ്കിലും, മോഡൽ അതിന്റെ ആന്തരിക ലൂപ്പുകൾ പ്രവർത്തിപ്പിക്കേണ്ടതുണ്ട്. ഇത് നേരത്തെ സാമ്പിൾ ചെയ്ത ഫ്രെയിമുകൾ നേരിട്ട് ഉപയോഗിക്കുന്നതിനേക്കാൾ അല്പം കൂടുതൽ ലേറ്റൻസി (latency) ഉണ്ടാക്കിയേക്കാം. റിയൽ-ടൈം ആപ്ലിക്കേഷനുകൾ നിർമ്മിക്കുന്നവർ കുറഞ്ഞ ടോക്കൺ ചിലവും അധിക പ്രോസസ്സിംഗ് സമയവും തമ്മിൽ ഒരു ബാലൻസ് കണ്ടെത്തേണ്ടി വരും.

പ്രവചനാതീതമായ ചില കാര്യങ്ങളും ഇതിലുണ്ട്. മോഡൽ ഏത് ഭാഗങ്ങൾ സാമ്പിൾ ചെയ്യണമെന്ന് സ്വയം തീരുമാനിക്കുന്നതിനാൽ, ഒരു വീഡിയോയുടെ ടോക്കൺ എണ്ണം ഓരോ തവണ പ്രോസസ്സ് ചെയ്യുമ്പോഴും വ്യത്യാസപ്പെട്ടേക്കാം. കൃത്യമായ ബജറ്റ് പാലിക്കേണ്ട ടീമുകൾ ടോക്കൺ ഉപയോഗം നിരീക്ഷിക്കേണ്ടതുണ്ട്.

അവസാനമായി, ഈ സേവനം Gemini-യുടെ Flash വേരിയന്റുകളിൽ മാത്രമാണ് ലഭ്യമായിട്ടുള്ളത്. പഴയതോ അല്ലെങ്കിൽ Flash അല്ലാത്തതോ ആയ മോഡലുകളെ ആശ്രയിക്കുന്ന പ്രോജക്റ്റുകൾക്ക് ഇത് ഉപയോഗിക്കാൻ അവ മാറ്റേണ്ടി വരും, ഇതിന് കൂടുതൽ ഡെവലപ്‌മെന്റ് ശ്രമങ്ങൾ ആവശ്യമായി വന്നേക്കാം.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • ഉപയോഗ രീതികൾ: ഏജന്റിക് മോഡ് ഉപയോഗിക്കുന്ന ഡെവലപ്പർമാരിൽ നിന്നുള്ള ആദ്യകാല റിപ്പോർട്ടുകൾ, വിദ്യാഭ്യാസം, വിനോദം, നിരീക്ഷണം, മറ്റ് മേഖലകൾ എന്നിവിടങ്ങളിൽ ചെലവ് കുറയ്ക്കാൻ ഇത് എത്രത്തോളം ഫലപ്രദമാണെന്ന് വെളിപ്പെടുത്തും.
  • വിലനിർണ്ണയ ക്രമീകരണങ്ങൾ: ഉയർന്ന അളവിലുള്ള വീഡിയോ വിശകലനത്തിനായുള്ള ആവശ്യം വർദ്ധിക്കുകയാണെങ്കിൽ, ഗൂഗിൾ ടോക്കൺ വിലയിൽ മാറ്റം വരുത്തിയേക്കാം അല്ലെങ്കിൽ വിവിധ പ്ലാനുകൾ (tiered plans) അവതരിപ്പിച്ചേക്കാം.
  • ഫീച്ചറുകളുടെ വിപുലീകരണം: ഇതേ റീസണിംഗ് ലൂപ്പ് കൂടുതൽ ഉപഭോക്തൃ ഉൽപ്പന്നങ്ങളിൽ ഉൾപ്പെടുത്തുന്നത് പുതിയ ഉപയോഗങ്ങൾ (use cases) കണ്ടെത്താനും ടോക്കൺ-കാര്യക്ഷമമായ വീഡിയോ AI-യെ കുറിച്ച് കൂടുതൽ അവബോധം സൃഷ്ടിക്കാനും സഹായിക്കും.
  • ബെഞ്ച്മാർക്ക് പരിണാമം: കൂടുതൽ ടീമുകൾ യഥാർത്ഥ ഡാറ്റാസെറ്റുകളിൽ പരീക്ഷിക്കുമ്പോൾ, കമ്മ്യൂണിറ്റി 1H-VideoQA, LVBench സ്കോറുകൾ പരിഷ്കരിക്കും; സ്റ്റാറ്റിക് സാമ്പിളിംഗ് ഇപ്പോഴും ഏജന്റിക് രീതിയെക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്ന പ്രത്യേക സാഹചര്യങ്ങൾ (edge cases) ഇതിലൂടെ കണ്ടെത്താൻ സാധിച്ചേക്കാം.

ചുരുക്കത്തിൽ

ഗൂഗിളിന്റെ ഏജന്റിക് വീഡിയോ അനാലിസിസ്, കൂടുതൽ കൃത്യമായ ടെമ്പറൽ ഇൻസൈറ്റുകൾ (temporal insight) നൽകുന്നതോടൊപ്പം ടോക്കൺ ഉപയോഗം 88% വരെ കുറയ്ക്കാൻ ഡെവലപ്പർമാരെ സഹായിക്കുന്നു. പ്രോസസ്സിംഗ് സങ്കീർണ്ണതയിലും ടോക്കൺ എണ്ണത്തിലെ വ്യതിയാനത്തിലും നേരിയ വർദ്ധനവ് ഉണ്ടാകുമെന്നതാണ് ഇതിന്റെ പരിമിതി, എന്നാൽ ദീർഘമായ വീഡിയോ ആപ്ലിക്കേഷനുകളിൽ ചെലവ് കുറയുന്നതും എളുപ്പത്തിൽ സംയോജിപ്പിക്കാൻ കഴിയുന്നതും ഈ ആശങ്കകളെ മറികടക്കുന്നു. വീഡിയോ കേന്ദ്രീകൃതമായ AI നിർമ്മിക്കുന്ന ടീമുകൾ ഈ പുതിയ രീതി വേഗത്തിൽ വിലയിരുത്തണം; വീഡിയോ അറിവ് വിപുലീകരിക്കുന്നതിന്റെ സാമ്പത്തിക വശങ്ങളിൽ വലിയ മാറ്റം വരാം.