Google తన Gemini ఫ్యామిలీ ఇప్పుడు “agentic” వీడియో-విశ్లేషణ మోడ్ను సపోర్ట్ చేస్తోందని ప్రకటించింది. ఇది స్టాండర్డ్ బెంచ్మార్క్లలో టోకెన్ వినియోగాన్ని 88% వరకు తగ్గించగలదు, ఈ మార్పు డెవలపర్ల కోసం లాంగ్-ఫార్మ్ వీడియో AIని గణనీయంగా చౌకగా మార్చవచ్చు.
ఈ కొత్త మోడ్ పాత ఫ్రేమ్-బై-ఫ్రేమ్ విధానాన్ని—సాధారణంగా సెకనుకు ఒక ఫ్రేమ్ శాంపిల్—భర్తీ చేసి, వీడియోలోని ఏ భాగాలను, ఏ వేగంతో మరియు ఏ మాడాలిటీ (ఫ్రేమ్లు, ఆడియో లేదా ట్రాన్స్క్రిప్ట్) ద్వారా పరిశీలించాలో నిర్ణయించే మోడల్-డ్రివెన్ లూప్ను అందిస్తుంది. ఒక నిర్దిష్ట క్వెరీ కోసం అవసరమైన సిగ్నల్స్ను మాత్రమే తీసుకోవడం ద్వారా, ఈ సిస్టమ్ లాంగ్వేజ్ మోడల్కు పంపే డేటాను తగ్గిస్తుంది, అదే సమయంలో ఒక సాధారణ శాంపిల్ మిస్ అయ్యే సెకను కంటే తక్కువ సమయం జరిగే సంఘటనలను కూడా పట్టుకోగలదు.
ఫిక్స్డ్ శాంప్లింగ్ నుండి స్వయంప్రతిపత్తి కలిగిన విజన్ (Autonomous Vision) వరకు
Gemini యొక్క మునుపటి వీడియో సామర్థ్యాలు డెవలపర్లు ముందే శాంప్లింగ్ రేట్ను ఎంచుకోవాలని నిబంధించాయి. అధిక రేటు అంటే ఎక్కువ టోకెన్లు మరియు ఎక్కువ బిల్లులు; తక్కువ రేటు అంటే వేగంగా జరిగే మార్పులను (quick cuts) మిస్ అయ్యే ప్రమాదం ఉంది. ప్రస్తుతం Gemini 3.7 Flash, 3.6 Flash మరియు 3.5 Flash-Lite ల కోసం అందుబాటులో ఉన్న కొత్త ఏజెంటిక్ వేరియంట్, APIలో నేరుగా “think-act-observe” సైకిల్ను పొందుపరుస్తుంది. మొదట, మోడల్ టాస్క్ గురించి ఆలోచిస్తుంది (reasons). తర్వాత, అది పరిశీలించడానికి ఒక సెగ్మెంట్ను ఎంచుకుంటుంది. చివరగా, ఎంచుకున్న ఫ్రేమ్లు, ఆడియో క్లిప్లు లేదా ట్రాన్స్క్రిప్ట్ సారాంశాలను గమనిస్తుంది (observes). ఒకవేళ ఆ సెగ్మెంట్ ఆసక్తికరంగా అనిపిస్తే, మోడల్ దానిని మరింత సూక్ష్మంగా (finer granularity) మళ్ళీ శాంపిల్ చేస్తుంది.
ఈ డైనమిక్ శాంప్లింగ్ వల్ల మోడల్ లక్షలాది టోకెన్లను ఖర్చు చేయకుండానే గంటల కొద్దీ ఫుటేజీని—ఉదాహరణకు పూర్తి స్థాయి లెక్చర్ లేదా గంటల కొద్దీ రికార్డింగ్—పరిశీలించగలదు. రియల్-వరల్డ్ వీడియో-ప్రశ్నోత్తరాల (1H-VideoQA) మరియు విస్తృతమైన వీడియో-అండర్స్టాండింగ్ టాస్క్ల (LVBench) బెంచ్మార్క్లు, అదే క్వెరీలను దాదాపు de వందో వంతు (one-tenth) టోకెన్ బడ్జెట్తో పూర్తి చేస్తూనే, అధిక ఖచ్చితత్వాన్ని అందిస్తున్నాయని చూపుతున్నాయి.
టోకెన్ ఆదా ఎందుకు ముఖ్యం
టోకెన్ల సంఖ్య నేరుగా API బిల్లులకు అనుసంధానించబడి ఉంటుంది. ఆటోమేటెడ్ వీడియో-ఎడిటింగ్ టూల్ను రూపొందిస్తున్న డెవలపర్ కోసం, సెకనుకు ఒక ఫ్రేమ్ రేటుతో ప్రాసెస్ చేయబడిన 90 నిమిషాల వీడియో పదుల మిలియన్ల టోకెన్లను ఉత్పత్తి చేయవచ్చు, దీనివల్ల ఖర్చు కంటెంట్ గంటకు వందల డాలర్లకు చేరుతుంది. 88% తగ్గింపు ఆ మొత్తాన్ని కొన్ని పదుల డాలర్లకు తగ్గిస్తుంది, దీనివల్ల గతంలో భారీ బిల్లులను ఎదుర్కొన్న స్టార్టప్లు మరియు చిన్న బృందాలకు కూడా భారీ స్థాయి వీడియో విశ్లేషణ అందుబాటులోకి వస్తుంది.
ఈ ఖర్చు ప్రయోజనం ప్రయోగాలు చేయడానికి ఉన్న అడ్డంకిని కూడా తగ్గిస్తుంది. గతంలో, ఇంజనీర్లు కీలక క్షణాలను గుర్తించడానికి, సంబంధిత క్లిప్లను సేకరించడానికి మరియు వాటిని తిరిగి మోడల్కు అందించడానికి కస్టమ్ కోడ్ను రాసేవారు. Gemini APIలో ఏజెంటిక్ విజన్ అందుబాటులోకి వచ్చిన తర్వాత, డెవలపర్లు Google AI Studio లేదా Gemini Enterprise Agent Platformలో ప్రాసెసింగ్ కాన్ఫిగరేషన్ను “agentic”కి మార్చడం ద్వారా ఈ ఫీచర్ను ఎనేబుల్ చేయవచ్చు. Google తన స్టాండర్డ్ Gemini టోకెన్ రేటును అలాగే ఉంచుతుంది; ఈ స్మార్ట్ శాంప్లింగ్ కోసం ఎటువంటి అదనపు సర్ఛార్జ్ లేదు.
ఊహలు లేకుండా ఖచ్చితత్వం
మోడల్ ఎక్కడ చూడాలి అనేది స్వయంగా నిర్ణయించుకుంటుంది కాబట్టి, ఇది ఒక సెకను కంటే తక్కువ సమయం ఉండే సంఘటనలను కూడా గుర్తించగలదు—ఇది ఒక స్టాటిక్ 1 FPS శాంపిల్ ఖచ్చితంగా మిస్ అయ్యే విషయం. వర్కౌట్ వీడియోలో రిపిటీషన్లను లెక్కించడానికి, రద్దీగా ఉన్న దృశ్యంలో ఒక వస్తువును ట్రాక్ చేయడానికి లేదా సెక్యూరిటీ ఫుటేజీలో అకస్మాత్తుగా జరిగే అసాధారణతలను గుర్తించడానికి ఈ ఖచ్చితత్వం చాలా ముఖ్యం. మోడల్ ఏదైనా ఆసక్తికరమైన విండోను గుర్తించినప్పుడు, అది ఆ భాగానికి ఫ్రేమ్-రేట్ను ఆటోమేటిక్గా పెంచుతుంది, తద్వారా అవసరమైన చోట మాత్రమే హై-ఫిడెలిటీ డేటాను అందిస్తుంది.
వినియోగదారులకు అందుబాటులో ఉన్న “Ask YouTube” వంటి ఫీచర్లకు కూడా ఇదే మెకానిజం శక్తినిస్తుంది, ఇక్కడ వీడియో ప్లే అవుతున్నప్పుడు వినియోగదారులు దృశ్యపరమైన ప్రశ్నలు అడగవచ్చు మరియు వాస్తవ దృశ్య కంటెంట్పై ఆధారపడిన సమాధానాలను పొందవచ్చు. మోడల్కు పంపే వీడియో పరిమాణాన్ని పరిమితం చేయడం ద్వారా, ఈ ఫీచర్ వేగంగా మరియు తక్కువ ఖర్చుతో స్పందిస్తుంది, తద్వారా లోతును తగ్గించకుండా యూజర్ ఎక్స్పీరియన్స్ను మెరుగుపరుస్తుంది.
సంభావ్య పరిమితులు మరియు లాభనష్టాలు
ఏజెంటిక్ విధానం అనేది అన్ని సమస్యలకు ఒకే పరిష్కారం (silver bullet) కాదు. టోకెన్ వినియోగం గణనీయంగా తగ్గుతుంది, కానీ మోడల్ తన అంతర్గత లూప్ను నడుపుతుంది, ఇది ముందే శాంపిల్ చేసిన ఫ్రేమ్లపై నేరుగా వెళ్లే విధానంతో పోలిస్తే కొంత లాటెన్సీని (latency) పెంచవచ్చు. రియల్-టైమ్ అప్లికేషన్లపై దృష్టి సారించే డెవలపర్లు తక్కువ టోకెన్ ఖర్చు మరియు అదనపు ప్రాసెసింగ్ సమయం మధ్య సమతుల్యతను పాటించాల్సి రావచ్చు.
అంచనా వేయగలిగే సామర్థ్యం (Predictability) మరొక ఆందోళన. మోడల్ ఏ సెగ్మెంట్లను శాంపిల్ చేయాలో స్వయంగా నిర్ణయించుకుంటుంది కాబట్టి, ఒక నిర్దిష్ట వీడియో కోసం ఖచ్చితమైన టోకెన్ల సంఖ్య ప్రతిసారీ మారవచ్చు. కఠినమైన బడ్జెట్ను కలిగి ఉండాలనుకునే బృందాలు, ముఖ్యంగా ప్రారంభ ఇంటిగ్రేషన్ సమయంలో, టోకెన్ వినియోగంపై పర్యవేక్షణను (monitoring) ఏర్పాటు చేసుకోవాల్సి రావచ్చు.
చివరగా, ఈ రోల్అవుట్ Gemini యొక్క Flash వేరియంట్లకు మాత్రమే పరిమితం చేయబడింది. పాత లేదా నాన్-ఫ్లాష్ మోడల్లపై ఆధారపడే ప్రాజెక్ట్లు వాటిని మైగ్రేట్ చేసే వరకు దీని ప్రయోజనాన్ని పొందలేవు, దీనికి అదనపు డెవలప్మెంట్ ప్రయత్నం అవసరం కావచ్చు.
తదుపరి ఏం చూడాలి
- అనుసరణ నమూనాలు: ఏజెంటిక్ మోడ్ని ఉపయోగించే డెవలపర్ల నుండి వచ్చే ప్రారంభ నివేదికలు, విద్య, వినోదం, పర్యవేక్షణ మరియు ఇతర రంగాలలో ఖర్చు ఆదా అనేది కొనసాగుతుందో లేదో తెలియజేస్తాయి.
- ధరల సర్దుబాట్లు: అధిక పరిమాణంలో వీడియో విశ్లేషణకు డిమాండ్ పెరిగితే, Google టోకెన్ ధరలను మార్చవచ్చు లేదా వివిధ స్థాయిల ప్లాన్లను (tiered plans) జోడించవచ్చు.
- ఫీచర్ విస్తరణలు: ఇదే రీజనింగ్ లూప్ను మరిన్ని వినియోగదారు ఉత్పత్తులలో చేర్చడం ద్వారా కొత్త వినియోగ సందర్భాలు (use cases) బయటపడవచ్చు మరియు టోకెన్-సమర్థవంతమైన వీడియో AI గురించి విస్తృత అవగాహన పెరగవచ్చు.
- బెంచ్మార్క్ పరిణామం: మరిన్ని బృందాలు వాస్తవ ప్రపంచ డేటాసెట్లపై పరీక్షించినప్పుడు, కమ్యూనిటీ 1H-VideoQA మరియు LVBench స్కోర్లను మెరుగుపరుస్తుంది; దీనివల్ల స్టాటిక్ శాంప్లింగ్ ఇంకా ఏజెంటిక్ పద్ధతి కంటే మెరుగ్గా పనిచేసే అంచెల స్థాయి సందర్భాలను (edge cases) గుర్తించే అవకాశం ఉంది.
సారాంశం
Google యొక్క ఏజెంటిక్ వీడియో అనాలిసిస్, డెవలపర్లు టోకెన్ వినియోగాన్ని 88% వరకు తగ్గించుకోవడానికి అనుమతిస్తుంది, అదే సమయంలో మరింత ఖచ్చితమైన కాలక్రమానుసార అవగాహనను (temporal insight) అందిస్తుంది. దీని వల్ల ప్రాసెసింగ్ సంక్లిష్టత మరియు మారుతున్న టోకెన్ల సంఖ్యలో స్వల్ప పెరుగుదల ఉండవచ్చు, కానీ చాలా లాంగ్-ఫార్మ్ వీడియో అప్లికేషన్లకు, ఖర్చు ఆదా మరియు సులభమైన ఇంటిగ్రేషన్ ఆ ఆందోళనల కంటే ముఖ్యమైనవి. వీడియో-కేంద్రీకృత AIని నిర్మిస్తున్న బృందాలు ఈ కొత్త మోడ్ను త్వరగా అంచనా వేయాలి; వీడియో అవగాహనను విస్తరించడంలో ఆర్థిక అంశాలు (economics) ఇప్పుడే మారాయేమో!
