Google తన Gemini ఫ్యామిలీ ఇప్పుడు “agentic” వీడియో-విశ్లేషణ మోడ్‌ను సపోర్ట్ చేస్తోందని ప్రకటించింది. ఇది స్టాండర్డ్ బెంచ్‌మార్క్‌లలో టోకెన్ వినియోగాన్ని 88% వరకు తగ్గించగలదు, ఈ మార్పు డెవలపర్ల కోసం లాంగ్-ఫార్మ్ వీడియో AIని గణనీయంగా చౌకగా మార్చవచ్చు.

ఈ కొత్త మోడ్ పాత ఫ్రేమ్-బై-ఫ్రేమ్ విధానాన్ని—సాధారణంగా సెకనుకు ఒక ఫ్రేమ్ శాంపిల్—భర్తీ చేసి, వీడియోలోని ఏ భాగాలను, ఏ వేగంతో మరియు ఏ మాడాలిటీ (ఫ్రేమ్‌లు, ఆడియో లేదా ట్రాన్స్‌క్రిప్ట్) ద్వారా పరిశీలించాలో నిర్ణయించే మోడల్-డ్రివెన్ లూప్‌ను అందిస్తుంది. ఒక నిర్దిష్ట క్వెరీ కోసం అవసరమైన సిగ్నల్స్‌ను మాత్రమే తీసుకోవడం ద్వారా, ఈ సిస్టమ్ లాంగ్వేజ్ మోడల్‌కు పంపే డేటాను తగ్గిస్తుంది, అదే సమయంలో ఒక సాధారణ శాంపిల్ మిస్ అయ్యే సెకను కంటే తక్కువ సమయం జరిగే సంఘటనలను కూడా పట్టుకోగలదు.

ఫిక్స్‌డ్ శాంప్లింగ్ నుండి స్వయంప్రతిపత్తి కలిగిన విజన్ (Autonomous Vision) వరకు

Gemini యొక్క మునుపటి వీడియో సామర్థ్యాలు డెవలపర్లు ముందే శాంప్లింగ్ రేట్‌ను ఎంచుకోవాలని నిబంధించాయి. అధిక రేటు అంటే ఎక్కువ టోకెన్లు మరియు ఎక్కువ బిల్లులు; తక్కువ రేటు అంటే వేగంగా జరిగే మార్పులను (quick cuts) మిస్ అయ్యే ప్రమాదం ఉంది. ప్రస్తుతం Gemini 3.7 Flash, 3.6 Flash మరియు 3.5 Flash-Lite ల కోసం అందుబాటులో ఉన్న కొత్త ఏజెంటిక్ వేరియంట్, APIలో నేరుగా “think-act-observe” సైకిల్‌ను పొందుపరుస్తుంది. మొదట, మోడల్ టాస్క్ గురించి ఆలోచిస్తుంది (reasons). తర్వాత, అది పరిశీలించడానికి ఒక సెగ్మెంట్‌ను ఎంచుకుంటుంది. చివరగా, ఎంచుకున్న ఫ్రేమ్‌లు, ఆడియో క్లిప్‌లు లేదా ట్రాన్స్‌క్రిప్ట్ సారాంశాలను గమనిస్తుంది (observes). ఒకవేళ ఆ సెగ్మెంట్ ఆసక్తికరంగా అనిపిస్తే, మోడల్ దానిని మరింత సూక్ష్మంగా (finer granularity) మళ్ళీ శాంపిల్ చేస్తుంది.

ఈ డైనమిక్ శాంప్లింగ్ వల్ల మోడల్ లక్షలాది టోకెన్లను ఖర్చు చేయకుండానే గంటల కొద్దీ ఫుటేజీని—ఉదాహరణకు పూర్తి స్థాయి లెక్చర్ లేదా గంటల కొద్దీ రికార్డింగ్—పరిశీలించగలదు. రియల్-వరల్డ్ వీడియో-ప్రశ్నోత్తరాల (1H-VideoQA) మరియు విస్తృతమైన వీడియో-అండర్‌స్టాండింగ్ టాస్క్‌ల (LVBench) బెంచ్‌మార్క్‌లు, అదే క్వెరీలను దాదాపు de వందో వంతు (one-tenth) టోకెన్ బడ్జెట్‌తో పూర్తి చేస్తూనే, అధిక ఖచ్చితత్వాన్ని అందిస్తున్నాయని చూపుతున్నాయి.

టోకెన్ ఆదా ఎందుకు ముఖ్యం

టోకెన్ల సంఖ్య నేరుగా API బిల్లులకు అనుసంధానించబడి ఉంటుంది. ఆటోమేటెడ్ వీడియో-ఎడిటింగ్ టూల్‌ను రూపొందిస్తున్న డెవలపర్ కోసం, సెకనుకు ఒక ఫ్రేమ్ రేటుతో ప్రాసెస్ చేయబడిన 90 నిమిషాల వీడియో పదుల మిలియన్ల టోకెన్లను ఉత్పత్తి చేయవచ్చు, దీనివల్ల ఖర్చు కంటెంట్ గంటకు వందల డాలర్లకు చేరుతుంది. 88% తగ్గింపు ఆ మొత్తాన్ని కొన్ని పదుల డాలర్లకు తగ్గిస్తుంది, దీనివల్ల గతంలో భారీ బిల్లులను ఎదుర్కొన్న స్టార్టప్‌లు మరియు చిన్న బృందాలకు కూడా భారీ స్థాయి వీడియో విశ్లేషణ అందుబాటులోకి వస్తుంది.

ఈ ఖర్చు ప్రయోజనం ప్రయోగాలు చేయడానికి ఉన్న అడ్డంకిని కూడా తగ్గిస్తుంది. గతంలో, ఇంజనీర్లు కీలక క్షణాలను గుర్తించడానికి, సంబంధిత క్లిప్‌లను సేకరించడానికి మరియు వాటిని తిరిగి మోడల్‌కు అందించడానికి కస్టమ్ కోడ్‌ను రాసేవారు. Gemini APIలో ఏజెంటిక్ విజన్ అందుబాటులోకి వచ్చిన తర్వాత, డెవలపర్లు Google AI Studio లేదా Gemini Enterprise Agent Platformలో ప్రాసెసింగ్ కాన్ఫిగరేషన్‌ను “agentic”కి మార్చడం ద్వారా ఈ ఫీచర్‌ను ఎనేబుల్ చేయవచ్చు. Google తన స్టాండర్డ్ Gemini టోకెన్ రేటును అలాగే ఉంచుతుంది; ఈ స్మార్ట్ శాంప్లింగ్ కోసం ఎటువంటి అదనపు సర్ఛార్జ్ లేదు.

ఊహలు లేకుండా ఖచ్చితత్వం

మోడల్ ఎక్కడ చూడాలి అనేది స్వయంగా నిర్ణయించుకుంటుంది కాబట్టి, ఇది ఒక సెకను కంటే తక్కువ సమయం ఉండే సంఘటనలను కూడా గుర్తించగలదు—ఇది ఒక స్టాటిక్ 1 FPS శాంపిల్ ఖచ్చితంగా మిస్ అయ్యే విషయం. వర్కౌట్ వీడియోలో రిపిటీషన్లను లెక్కించడానికి, రద్దీగా ఉన్న దృశ్యంలో ఒక వస్తువును ట్రాక్ చేయడానికి లేదా సెక్యూరిటీ ఫుటేజీలో అకస్మాత్తుగా జరిగే అసాధారణతలను గుర్తించడానికి ఈ ఖచ్చితత్వం చాలా ముఖ్యం. మోడల్ ఏదైనా ఆసక్తికరమైన విండోను గుర్తించినప్పుడు, అది ఆ భాగానికి ఫ్రేమ్-రేట్‌ను ఆటోమేటిక్‌గా పెంచుతుంది, తద్వారా అవసరమైన చోట మాత్రమే హై-ఫిడెలిటీ డేటాను అందిస్తుంది.

వినియోగదారులకు అందుబాటులో ఉన్న “Ask YouTube” వంటి ఫీచర్‌లకు కూడా ఇదే మెకానిజం శక్తినిస్తుంది, ఇక్కడ వీడియో ప్లే అవుతున్నప్పుడు వినియోగదారులు దృశ్యపరమైన ప్రశ్నలు అడగవచ్చు మరియు వాస్తవ దృశ్య కంటెంట్‌పై ఆధారపడిన సమాధానాలను పొందవచ్చు. మోడల్‌కు పంపే వీడియో పరిమాణాన్ని పరిమితం చేయడం ద్వారా, ఈ ఫీచర్ వేగంగా మరియు తక్కువ ఖర్చుతో స్పందిస్తుంది, తద్వారా లోతును తగ్గించకుండా యూజర్ ఎక్స్‌పీరియన్స్‌ను మెరుగుపరుస్తుంది.

సంభావ్య పరిమితులు మరియు లాభనష్టాలు

ఏజెంటిక్ విధానం అనేది అన్ని సమస్యలకు ఒకే పరిష్కారం (silver bullet) కాదు. టోకెన్ వినియోగం గణనీయంగా తగ్గుతుంది, కానీ మోడల్ తన అంతర్గత లూప్‌ను నడుపుతుంది, ఇది ముందే శాంపిల్ చేసిన ఫ్రేమ్‌లపై నేరుగా వెళ్లే విధానంతో పోలిస్తే కొంత లాటెన్సీని (latency) పెంచవచ్చు. రియల్-టైమ్ అప్లికేషన్లపై దృష్టి సారించే డెవలపర్లు తక్కువ టోకెన్ ఖర్చు మరియు అదనపు ప్రాసెసింగ్ సమయం మధ్య సమతుల్యతను పాటించాల్సి రావచ్చు.

అంచనా వేయగలిగే సామర్థ్యం (Predictability) మరొక ఆందోళన. మోడల్ ఏ సెగ్మెంట్‌లను శాంపిల్ చేయాలో స్వయంగా నిర్ణయించుకుంటుంది కాబట్టి, ఒక నిర్దిష్ట వీడియో కోసం ఖచ్చితమైన టోకెన్ల సంఖ్య ప్రతిసారీ మారవచ్చు. కఠినమైన బడ్జెట్‌ను కలిగి ఉండాలనుకునే బృందాలు, ముఖ్యంగా ప్రారంభ ఇంటిగ్రేషన్ సమయంలో, టోకెన్ వినియోగంపై పర్యవేక్షణను (monitoring) ఏర్పాటు చేసుకోవాల్సి రావచ్చు.

చివరగా, ఈ రోల్‌అవుట్ Gemini యొక్క Flash వేరియంట్‌లకు మాత్రమే పరిమితం చేయబడింది. పాత లేదా నాన్-ఫ్లాష్ మోడల్‌లపై ఆధారపడే ప్రాజెక్ట్‌లు వాటిని మైగ్రేట్ చేసే వరకు దీని ప్రయోజనాన్ని పొందలేవు, దీనికి అదనపు డెవలప్‌మెంట్ ప్రయత్నం అవసరం కావచ్చు.

తదుపరి ఏం చూడాలి

  • అనుసరణ నమూనాలు: ఏజెంటిక్ మోడ్‌ని ఉపయోగించే డెవలపర్ల నుండి వచ్చే ప్రారంభ నివేదికలు, విద్య, వినోదం, పర్యవేక్షణ మరియు ఇతర రంగాలలో ఖర్చు ఆదా అనేది కొనసాగుతుందో లేదో తెలియజేస్తాయి.
  • ధరల సర్దుబాట్లు: అధిక పరిమాణంలో వీడియో విశ్లేషణకు డిమాండ్ పెరిగితే, Google టోకెన్ ధరలను మార్చవచ్చు లేదా వివిధ స్థాయిల ప్లాన్‌లను (tiered plans) జోడించవచ్చు.
  • ఫీచర్ విస్తరణలు: ఇదే రీజనింగ్ లూప్‌ను మరిన్ని వినియోగదారు ఉత్పత్తులలో చేర్చడం ద్వారా కొత్త వినియోగ సందర్భాలు (use cases) బయటపడవచ్చు మరియు టోకెన్-సమర్థవంతమైన వీడియో AI గురించి విస్తృత అవగాహన పెరగవచ్చు.
  • బెంచ్‌మార్క్ పరిణామం: మరిన్ని బృందాలు వాస్తవ ప్రపంచ డేటాసెట్‌లపై పరీక్షించినప్పుడు, కమ్యూనిటీ 1H-VideoQA మరియు LVBench స్కోర్‌లను మెరుగుపరుస్తుంది; దీనివల్ల స్టాటిక్ శాంప్లింగ్ ఇంకా ఏజెంటిక్ పద్ధతి కంటే మెరుగ్గా పనిచేసే అంచెల స్థాయి సందర్భాలను (edge cases) గుర్తించే అవకాశం ఉంది.

సారాంశం

Google యొక్క ఏజెంటిక్ వీడియో అనాలిసిస్, డెవలపర్లు టోకెన్ వినియోగాన్ని 88% వరకు తగ్గించుకోవడానికి అనుమతిస్తుంది, అదే సమయంలో మరింత ఖచ్చితమైన కాలక్రమానుసార అవగాహనను (temporal insight) అందిస్తుంది. దీని వల్ల ప్రాసెసింగ్ సంక్లిష్టత మరియు మారుతున్న టోకెన్ల సంఖ్యలో స్వల్ప పెరుగుదల ఉండవచ్చు, కానీ చాలా లాంగ్-ఫార్మ్ వీడియో అప్లికేషన్‌లకు, ఖర్చు ఆదా మరియు సులభమైన ఇంటిగ్రేషన్ ఆ ఆందోళనల కంటే ముఖ్యమైనవి. వీడియో-కేంద్రీకృత AIని నిర్మిస్తున్న బృందాలు ఈ కొత్త మోడ్‌ను త్వరగా అంచనా వేయాలి; వీడియో అవగాహనను విస్తరించడంలో ఆర్థిక అంశాలు (economics) ఇప్పుడే మారాయేమో!