Google தனது Gemini குடும்பத்தினர் இப்போது "agentic" வீடியோ-பகுப்பாய்வு முறையை ஆதரிக்கின்றன என்று அறிவித்துள்ளது. இது தரநிலையான பெஞ்ச்மார்க்குகளில் (benchmarks) டோக்கன் பயன்பாட்டை 88% வரை குறைக்க முடியும், இது நீண்ட கால வீடியோ AI-யை டெவலப்பர்களுக்கு வியத்தகு முறையில் மலிவாக்கும் ஒரு மாற்றமாகும்.
இந்த புதிய முறை பழைய பிரேம்-பை-பிரேம் (frame-by-frame) அணுகுமுறைக்கு (பொதுவாக ஒரு வினாடிக்கு ஒரு பிரேம் மாதிரி) பதிலாக, வீடியோவின் எந்தப் பகுதிகளை, எந்த வேகத்தில் மற்றும் எந்த முறையில் (பிரேம்கள், ஆடியோ அல்லது டிரான்ஸ்கிரிப்ட்) ஆய்வு செய்ய வேண்டும் என்பதைத் தீர்மானிக்கும் ஒரு மாடல் சார்ந்த லூப் (model-driven loop) முறையைப் பயன்படுத்துகிறது. ஒரு குறிப்பிட்ட வினாவிற்குத் தேவையான சிக்னல்களை மட்டும் எடுப்பதன் மூலம், இந்த அமைப்பு மொழி மாதிரியத்திற்கு (language model) அனுப்பப்படும் தரவைக் குறைக்கிறது, அதே சமயம் ஒரு சாதாரண மாதிரித் தொகுப்பில் (coarse sample) விடுபடக்கூடிய ஒரு வினாடிக்கும் குறைவான நிகழ்வுகளையும் இது கண்டறிகிறது.
நிலையான மாதிரி எடுத்தலில் இருந்து தன்னாட்சி பார்வை வரை
Gemini-யின் முந்தைய வீடியோ திறன்கள், டெவலப்பர்கள் முன்கூட்டியே ஒரு மாதிரி விகிதத்தைத் (sampling rate) தேர்ந்தெடுக்கக் கட்டாயப்படுத்தின. அதிக விகிதம் என்பது அதிக டோக்கன்கள் மற்றும் அதிக கட்டணத்தைக் குறிக்கும்; குறைந்த விகிதம் என்பது விரைவான மாற்றங்களைத் தவறவிடும் அபாயத்தைக் கொண்டிருக்கும். தற்போது Gemini 3.7 Flash, 3.6 Flash மற்றும் 3.5 Flash-Lite ஆகியவற்றிற்குத் தயாராக உள்ள புதிய agentic வகை, "think-act-observe" சுழற்சியை நேரடியாக API-க்குள் இணைக்கிறது. முதலில், மாடல் அந்தப் பணியைப் பற்றிச் சிந்திக்கிறது (reasons). அடுத்து, ஆய்வு செய்ய வேண்டிய ஒரு பகுதியைத் தேர்ந்தெடுக்கிறது. இறுதியாக, தேர்ந்தெடுக்கப்பட்ட பிரேம்கள், ஆடியோ துண்டுகள் அல்லது டிரான்ஸ்கிரிப்ட் பகுதிகளைக் கவனிக்கிறது (observes). ஒரு பகுதி நம்பிக்கையளிப்பதாகத் தோன்றினால், மாடல் அதை உடனுக்குடன் நுணுக்கமான அளவில் மீண்டும் மாதிரியாக்கம் (resamples) செய்கிறது.
இந்த டைனமிக் சாம்பிளிங் முறை, மில்லியன் கணக்கான டோக்கன்களைச் செலவழிக்காமல், பல மணிநேர வீடியோக்களை (உதாரணமாக ஒரு முழு நீள விரிவுரை அல்லது பல மணிநேரப் பதிவு) மாடல் ஆய்வு செய்ய அனுமதிக்கிறது. நிஜ உலக வீடியோ-கேள்வி-பதில் (1H-VideoQA) மற்றும் விரிவான வீடியோ-புரிதல் பணிகளைப் (LVBench) பிரதிபலிக்கும் பெஞ்ச்மார்க்குகள், அதே வினவல்களைப் பயன்படுத்துவதன் மூலம் டோக்கன் பட்ஜெட்டில் ஏறத்தாழப் பத்தில் ஒரு பங்கு மட்டுமே செலவாகிறது என்பதையும், அதே நேரத்தில் அதிக துல்லியத்தை வழங்குகிறது என்பதையும் காட்டுகின்றன.
டோக்கன் சேமிப்பு ஏன் முக்கியமானது
டோக்கன் எண்ணிக்கை நேரடியாக API கட்டணங்களாக மாறுகிறது. ஒரு தானியங்கி வீடியோ-எடிட்டிங் கருவியை உருவாக்கும் டெவலப்பருக்கு, ஒரு வினாடிக்கு ஒரு பிரேம் என்ற அடிப்படையில் செயலாக்கப்படும் 90 நிமிட வீடியோ, பல கோடி டோக்கன்களை உருவாக்கக்கூடும், இது ஒரு மணிநேர உள்ளடக்கத்திற்கு நூற்றுக்கணக்கான டாலர்கள் வரை செலவை உயர்த்தும். 88% குறைப்பு அந்தத் தொகையை சில பத்து டாலர்களாகக் குறைக்கிறது, இது இதற்கு முன்பு அதிக கட்டணங்களைச் சந்தித்த ஸ்டார்ட்அப்கள் மற்றும் சிறிய குழுக்களுக்குப் பெரிய அளவிலான வீடியோ பகுப்பாய்வைச் சாத்தியமாக்குகிறது.
இந்தச் செலவுச் சாதகம் சோதனைகளை மேற்கொள்வதற்கான தடையையும் குறைக்கிறது. இதற்கு முன்பு, பொறியாளர்கள் முக்கிய தருணங்களைக் கண்டறியவும், தொடர்புடைய கிளிப்களைப் பிரித்தெடுக்கவும் மற்றும் அவற்றை மீண்டும் மாடலுக்கு வழங்கவும் தனிப்பயன் குறியீடுகளை (custom code) எழுத வேண்டியிருந்தது. Gemini API-இல் agentic vision இணைக்கப்பட்டுள்ளதால், டெவலப்பர்கள் Google AI Studio அல்லது Gemini Enterprise Agent Platform-இல் செயலாக்க உள்ளமைப்பை (processing configuration) "agentic" என மாற்றுவதன் மூலம் இந்த வசதியைச் செயல்படுத்தலாம். Google வழக்கமான Gemini டோக்கன் விகிதத்தையே வைத்திருக்கிறது; இந்தச் சிறந்த மாதிரி முறைக்காகக் கூடுதல் கட்டணம் எதுவும் வசூலிக்கப்படுவதில்லை.
யூகங்கள் இன்றித் துல்லியம்
மாடல் எங்குப் பார்க்க வேண்டும் என்பதைத் தீர்மானிப்பதால், ஒரு வினாடிக்கும் குறைவான கால அளவு கொண்ட நிகழ்வுகளைக் கூட அதனால் கண்டறிய முடியும்—இது ஒரு நிலையான 1 FPS மாதிரித் தொகுப்பில் (sample) நிச்சயமாகத் தவறவிடப்படும் ஒன்று. உடற்பயிற்சி வீடியோவில் மீண்டும் மீண்டும் செய்யப்படும் செயல்களை எண்ணுவதற்கும், நெரிசலான காட்சியில் ஒரு பொருளைக் கண்காணிப்பதற்கும் அல்லது பாதுகாப்பு வீடியோவில் திடீர் மாற்றங்களைக் கண்டறிவதற்கும் இந்தத் துல்லியம் முக்கியமானது. மாடல் ஒரு நம்பிக்கையளிக்கும் பகுதியை அடையாளம் காணும்போது, அது தானாகவே அந்தப் பகுதிக்கான பிரேம்-ரேட்டை (frame-rate) அதிகரிக்கிறது, இதன் மூலம் முக்கியமான இடங்களில் மட்டும் உயர் தரவுத் தகவல்களை வழங்குகிறது.
இதே நுட்பம் "Ask YouTube" போன்ற நுகர்வோர் சார்ந்த அம்சங்களுக்கும் சக்தியூட்டுகிறது. இதில் பயனர்கள் வீடியோ ஓடிக்கொண்டிருக்கும்போது காட்சி சார்ந்த கேள்விகளைக் கேட்கலாம் மற்றும் வீடியோவின் உண்மையான காட்சித் தரவுகளின் அடிப்படையில் பதில்களைப் பெறலாம். மாடலுக்கு அனுப்பப்படும் வீடியோவின் அளவைக் குறைப்பதன் மூலம், இந்த அம்சம் வேகமாகவும் குறைந்த செலவிலும் பதிலளிக்கிறது, இது ஆழமான தகவல்களைத் தியாகம் செய்யாமல் பயனர் அனுபவத்தை மேம்படுத்துகிறது.
சாத்தியமான வரம்புகள் மற்றும் சவால்கள்
இந்த agentic அணுகுமுறை ஒரு முழுமையான தீர்வாக (silver bullet) இருக்காது. டோக்கன் பயன்பாடு வியத்தகு முறையில் குறைகிறது, ஆனால் மாடல் தனது உள் சுழற்சியை (internal loop) இயக்குகிறது, இது ஏற்கனவே மாதிரி எடுக்கப்பட்ட பிரேம்களை நேரடியாகப் பயன்படுத்துவதை விடச் சற்று தாமதத்தை (latency) ஏற்படுத்தக்கூடும். நிகழ்நேரப் பயன்பாடுகளில் (real-time applications) கவனம் செலுத்தும் டெவலப்பர்கள், குறைந்த டோக்கன் செலவிற்கும் கூடுதல் செயலாக்க நேரத்திற்கும் இடையே ஒரு சமநிலையைத் தேட வேண்டியிருக்கலாம்.
கணிக்கக்கூடிய தன்மை (Predictability) என்பது மற்றொரு கவலை. மாடல் எந்தப் பகுதிகளை மாதிரி எடுக்க வேண்டும் என்பதைத் தீர்மானிப்பதால், ஒரு குறிப்பிட்ட வீடியோவிற்கான துல்லியமான டோக்கன் எண்ணிக்கை ஒவ்வொரு முறையும் மாறுபடலாம். கடுமையான பட்ஜெட் முறையைப் பின்பற்றும் குழுக்கள், குறிப்பாக ஆரம்பகால ஒருங்கிணைப்பின் போது, டோக்கன் நுகர்வு குறித்த கண்காணிப்பை உருவாக்க வேண்டியிருக்கலாம்.
இறுதியாக, இந்த வெளியீடு Gemini-யின் Flash வகைகளுக்கு மட்டுமே மட்டுப்படுத்தப்பட்டுள்ளது. பழைய அல்லது Flash அல்லாத மாடல்களைப் பயன்படுத்தும் திட்டங்கள், அவற்றை மாற்றும் வரை (migration) இதிலிருந்து பயனடைய முடியாது, இதற்கு கூடுதல் மேம்பாட்டு முயற்சி தேவைப்படலாம்.
அடுத்து கவனிக்க வேண்டியவை
- தழுவல் முறைகள்: agentic mode-ஐப் பயன்படுத்தும் டெவலப்பர்களிடமிருந்து வரும் ஆரம்பக்கட்ட அறிக்கைகள், கல்வி, பொழுதுபோக்கு, கண்காணிப்பு மற்றும் பிற துறைகளில் செலவுச் சேமிப்பு நிலைத்திருக்கிறதா என்பதை வெளிப்படுத்தும்.
- விலை நிர்ணய மாற்றங்கள்: அதிக அளவிலான வீடியோ பகுப்பாய்விற்கான தேவை அதிகரித்தால், Google டோக்கன் விலையை மாற்றியமைக்கலாம் அல்லது அடுக்குத் திட்டங்களைச் சேர்க்கலாம்.
- அம்ச விரிவாக்கங்கள்: இதே போன்ற reasoning loop-ஐ அதிக நுகர்வோர் தயாரிப்புகளில் இணைப்பது, புதிய பயன்பாட்டு முறைகளை வெளிக்கொண்டு வரலாம் மற்றும் token-efficient வீடியோ AI பற்றிய பரவலான விழிப்புணர்வை ஏற்படுத்தலாம்.
- பெஞ்ச்மார்க் பரிணாமம்: அதிகப்படியான குழுக்கள் real-world datasets-களில் சோதனை செய்யும்போது, சமூகம் 1H-VideoQA மற்றும் LVBench மதிப்பெண்களைச் செம்மைப்படுத்தும்; இது static sampling முறையானது agentic முறையை விடச் சிறப்பாகச் செயல்படும் edge cases-களைக் கண்டறியக்கூடும்.
முக்கிய அம்சம்
Google-இன் agentic வீடியோ பகுப்பாய்வு, டெவலப்பர்கள் நுணுக்கமான காலவரிசை நுண்ணறிவைப் (temporal insight) பெறும் அதே வேளையில், டோக்கன் நுகர்வை 88% வரை குறைக்க அனுமதிக்கிறது. இதற்கான சவாலாக, செயலாக்கச் சிக்கல் மற்றும் மாறுபடும் டோக்கன் எண்ணிக்கையில் ஒரு சிறிய உயர்வு ஏற்படும்; ஆனால் பல நீண்ட கால வீடியோ பயன்பாடுகளுக்கு, செலவுச் சேமிப்பும் எளிதான ஒருங்கிணைப்பும் அந்தச் சிக்கல்களை விட முக்கியமானவை. வீடியோ சார்ந்த AI-ஐ உருவாக்கும் குழுக்கள் இந்த புதிய முறையை விரைவாக மதிப்பீடு செய்ய வேண்டும்; வீடியோ புரிதலை விரிவாக்குவதற்கான பொருளாதாரக் கணக்கீடுகள் இப்போது மாறியிருக்கலாம்.
