Google ने जाहीर केले आहे की त्यांच्या Gemini कुटुंबाला आता “agentic” व्हिडिओ-विश्लेषण मोडचा सपोर्ट मिळेल, ज्यामुळे मानक बेंचमार्कवर टोकन वापरामध्ये ८८% पर्यंत कपात होऊ शकते. हा बदल डेव्हलपर्ससाठी दीर्घकालीन (long-form) व्हिडिओ AI लक्षणीयरीत्या स्वस्त बनवू शकतो.
हा नवीन मोड जुन्या फ्रेम-बाय-फ्रेम पद्धतीची (जी सहसा प्रति सेकंद एक फ्रेम नमुना घेते) जागा घेतो आणि त्याऐवजी मॉडेल-चालित लूपचा वापर करतो. हा लूप व्हिडिओचा कोणता भाग, कोणत्या वेगाने आणि कोणत्या माध्यमातून (फ्रेम्स, ऑडिओ किंवा ट्रान्सक्रिप्ट) तपासायचा हे ठरवतो. विशिष्ट क्वेरीसाठी आवश्यक असलेले सिग्नलच वापरल्यामुळे, सिस्टीम लँग्वेज मॉडेलला पाठवल्या जाणाऱ्या डेटाचे प्रमाण कमी करते आणि तरीही सेकंदापेक्षा कमी कालावधीच्या घटना (sub-second events) टिपू शकते, ज्या कदाचित साध्या नमुन्यात सुटल्या असत्या.
फिक्स्ड सॅम्पलिंगकडून स्वायत्त व्हिजनकडे (Autonomous Vision)
Gemini च्या पूर्वीच्या व्हिडिओ क्षमतांमध्ये डेव्हलपर्सना आधीच सॅम्पलिंग रेट निवडावा लागत असे. उच्च रेट म्हणजे अधिक टोकन्स आणि जास्त बिल; कमी रेट म्हणजे जलद हालचाली किंवा कट्स सुटण्याचा धोका. नवीन agentic प्रकार, जो सध्या Gemini 3.7 Flash, 3.6 Flash आणि 3.5 Flash-Lite साठी उपलब्ध आहे, थेट API मध्ये “think-act-observe” चक्र समाविष्ट करतो. प्रथम, मॉडेल कार्याचा विचार करते. त्यानंतर, ते तपासण्यासाठी एक सेगमेंट निवडते. शेवटी, ते निवडलेल्या फ्रेम्स, ऑडिओ क्लिप्स किंवा ट्रान्सक्रिप्टचे अंश पाहते. जर एखादा सेगमेंट महत्त्वाचा वाटला, तर मॉडेल लगेच त्या भागाचे अधिक सूक्ष्मतेने (finer granularity) पुन्हा सॅम्पलिंग करते.
हे डायनॅमिक सॅम्पलिंग मॉडेलला लाखो टोकन्स खर्च न करता तासाभराचे फुटेज—जसे की एखादे पूर्ण व्याख्यान किंवा तासाभराचे रेकॉर्डिंग—तपासू देते. वास्तविक जगातील व्हिडिओ-प्रश्न-उत्तरांचे (1H-VideoQA) आणि व्यापक व्हिडिओ-समजण्याचे (LVBench) कार्य सिम्युलेट करणारे बेंचमार्क असे दर्शवतात की, ही क्वेरी साधारणपणे एक-दहाव्या (1/10th) टोकन बजेटमध्ये पूर्ण होते आणि अचूकता देखील अधिक मिळते.
टोकन बचत का महत्त्वाची आहे
टोकनची संख्या थेट API बिलांशी संबंधित असते. ऑटोमेटेड व्हिडिओ-एडिटिंग टूल बनवणाऱ्या डेव्हलपरसाठी, प्रति सेकंद एक फ्रेम या वेगाने प्रोसेस केलेला ९० मिनिटांचा व्हिडिओ करोडो टोकन्स तयार करू शकतो, ज्यामुळे खर्च प्रति तासाला शेकडो डॉलर्सपर्यंत जाऊ शकतो. ८८% कपातीमुळे हा खर्च काही दश डॉलर्सपर्यंत खाली येतो, ज्यामुळे स्टार्टअप्स आणि लहान टीम्ससाठी मोठ्या प्रमाणावरील व्हिडिओ विश्लेषण करणे शक्य होते, ज्यांना यापूर्वी प्रचंड बिलांचा सामना करावा लागत असे.
खर्चातील ही बचत प्रयोगांसाठीचा अडथळा देखील कमी करते. यापूर्वी, इंजिनिअर्सना महत्त्वाचे क्षण शोधण्यासाठी, संबंधित क्लिप्स काढण्यासाठी आणि त्या मॉडेलला पुन्हा फीड करण्यासाठी कस्टम कोड लिहावा लागत असे. आता Gemini API मध्ये agentic vision समाविष्ट असल्याने, डेव्हलपर्स Google AI Studio किंवा Gemini Enterprise Agent Platform मध्ये प्रोसेसिंग कॉन्फिगरेशन “agentic” वर सेट करून हे फीचर सक्षम करू शकतात. Google ने Gemini चा स्टँडर्ड टोकन रेट कायम ठेवला आहे; या स्मार्ट सॅम्पलिंगसाठी कोणताही अतिरिक्त शुल्क आकारला जात नाही.
अंदाज न लावता अचूकता
मॉडेल कुठे पाहायचे हे स्वतः ठरवत असल्याने, ते एक सेकंदापेक्षा कमी कालावधीच्या घटना देखील शोधू शकते—ज्या गोष्टी १ FPS च्या स्थिर नमुन्यात नक्कीच सुटल्या असत्या. वर्कआउट व्हिडिओमध्ये पुनरावृत्ती मोजणे, गर्दीच्या दृश्यात एखाद्या वस्तूचा मागोवा घेणे किंवा सुरक्षा फुटेजमधील अचानक घडणाऱ्या विसंगती (anomalies) ओळखणे यासाठी ही अचूकता महत्त्वाची आहे. जेव्हा मॉडेलला एखादा महत्त्वाचा भाग आढळतो, तेव्हा ते आपोआप त्या भागासाठी फ्रेम-रेट वाढवते, ज्यामुळे केवळ आवश्यक तिथेच उच्च-गुणवत्तेचा (high-fidelity) डेटा मिळतो.
हीच यंत्रणा “Ask YouTube” सारख्या ग्राहक-केंद्रित फीचर्सना शक्ती देते, जिथे वापरकर्ते व्हिडिओ सुरू असताना दृश्य प्रश्न विचारू शकतात आणि प्रत्यक्ष दृश्य सामग्रीवर आधारित उत्तरे मिळवू शकतात. मॉडेलला पाठवल्या जाणाऱ्या व्हिडिओचे प्रमाण मर्यादित केल्यामुळे, हे फीचर वेगाने आणि कमी खर्चात प्रतिसाद देते, ज्यामुळे खोली (depth) कमी न करता वापरकर्त्याचा अनुभव सुधारतो.
संभाव्य मर्यादा आणि तडजोड (Trade-offs)
Agentic दृष्टिकोन हा सर्व समस्यांवर रामबाण उपाय (silver bullet) नाही. टोकनचा वापर लक्षणीयरीत्या कमी होतो, परंतु मॉडेल अजूनही त्याचे अंतर्गत लूप चालवते, ज्यामुळे आधीच सॅम्पल केलेल्या फ्रेम्सवर प्रक्रिया करण्याच्या तुलनेत विलंब (latency) वाढू शकतो. रिअल-टाइम ॲप्लिकेशन्सवर लक्ष केंद्रित करणाऱ्या डेव्हलपर्सना कमी टोकन खर्च आणि अतिरिक्त प्रोसेसिंग वेळ यांच्यात संतुलन साधावे लागू शकते.
अंदाज वर्तवणे (Predictability) ही दुसरी चिंता आहे. मॉडेल कोणते सेगमेंट सॅम्पल करायचे हे स्वतः ठरवत असल्याने, एखाद्या विशिष्ट व्हिडिओसाठी टोकनची अचूक संख्या प्रत्येक वेळी बदलू शकते. ज्या टीम्सना कडक बजेटिंगची आवश्यकता आहे, त्यांना विशेषतः सुरुवातीच्या इंटिग्रेशन दरम्यान टोकन वापराचे मॉनिटरिंग करावे लागू शकते.
शेवटी, हे रोलआउट केवळ Gemini च्या Flash व्हेरिएंट्सपुरते मर्यादित आहे. जे प्रकल्प जुन्या किंवा नॉन-फ्लॅश मॉडेल्सवर अवलंबून आहेत, त्यांना मायग्रेट करेपर्यंत याचा फायदा होणार नाही, ज्यासाठी अतिरिक्त डेव्हलपमेंट प्रयत्न करावे लागतील.
पुढे काय पाहायचे
- वापराचे नमुने: 'agentic mode' वापरणाऱ्या डेव्हलपर्सचे सुरुवातीचे अहवाल शिक्षण, मनोरंजन, देखरेख आणि इतर क्षेत्रांमध्ये खर्च बचतीचा फायदा टिकून राहतो की नाही हे स्पष्ट करतील.
- किंमत समायोजन: जर मोठ्या प्रमाणात व्हिडिओ विश्लेषणाची मागणी वाढली, तर Google टोकनच्या किमतीत बदल करू शकते किंवा टियर्ड प्लॅन्स (tiered plans) जोडू शकते.
- वैशिष्ट्यांचा विस्तार: तोच 'reasoning loop' अधिक ग्राहक उत्पादनांमध्ये समाविष्ट केल्यामुळे नवीन वापराची उदाहरणे समोर येऊ शकतात आणि टोकन-कार्यक्षम (token-efficient) व्हिडिओ AI बद्दल व्यापक जागरूकता निर्माण होऊ शकते.
- बेंचमार्कमधील उत्क्रांती: जसजशा अधिक टीम्स वास्तविक जगातील डेटासेटवर चाचणी करतील, तसतसा समुदाय 1H-VideoQA आणि LVBench स्कोअर अधिक अचूक करेल, ज्यामुळे संभाव्यतः अशा 'edge cases' समोर येतील जिथे 'static sampling' अजूनही 'agentic method' पेक्षा सरस ठरते.
निष्कर्ष
Google चे agentic व्हिडिओ विश्लेषण डेव्हलपर्सना टोकनचा वापर ८८% पर्यंत कमी करण्याची सुविधा देते आणि त्याच वेळी अधिक सूक्ष्म कालबद्ध माहिती (temporal insight) मिळवून देते. याचा तोटा म्हणजे प्रोसेसिंगची गुंतागुंत आणि टोकनच्या संख्येत होणारी थोडी वाढ आहे, परंतु अनेक दीर्घ व्हिडिओ ॲप्लिकेशन्ससाठी, खर्च बचत आणि इंटिग्रेशनची सुलभता या चिंतांपेक्षा जास्त महत्त्वाची आहे. व्हिडिओ-केंद्रित AI तयार करणाऱ्या टीम्सनी या नवीन मोडचे लवकरात लवकर मूल्यमापन केले पाहिजे; व्हिडिओ समजून घेण्याच्या (video understanding) विस्ताराची आर्थिक समीकरणे आता बदलली असू शकतात.
