گوگل نے اعلان کیا ہے کہ اس کے Gemini فیملی میں اب ایک "agentic" ویڈیو تجزیہ (video-analysis) موڈ شامل ہو گیا ہے جو معیاری بینچ مارکس پر ٹوکن کے استعمال کو 88% تک کم کر سکتا ہے، یہ ایک ایسی تبدیلی ہے جو طویل ویڈیوز کے لیے AI کو ڈویلپرز کے لیے ڈرامائی طور پر سستا بنا سکتی ہے۔

نیا موڈ پرانے فریم-بائی-فریم طریقہ کار—جو عام طور پر ایک سیکنڈ میں ایک فریم کا نمونہ ہوتا ہے—کو ایک ماڈل کے زیرِ انتظام لوپ (loop) سے بدل دیتا ہے جو یہ فیصلہ کرتا ہے کہ ویڈیو کے کن حصوں کا جائزہ لینا ہے، کس رفتار سے لینا ہے، اور کس طریقے (فریم، آڈیو، یا ٹرانسکرپٹ) سے لینا ہے۔ کسی مخصوص سوال کے لیے صرف ضروری سگنلز کو استعمال کر کے، یہ سسٹم لینگویج ماڈل کو بھیجے جانے والے ڈیٹا کو کم کر دیتا ہے اور ساتھ ہی ان واقعات کو بھی پکڑ لیتا ہے جو ایک عام نمونہ (coarse sample) سے چھوٹ سکتے ہیں۔

فکسڈ سیمپلنگ سے خود مختار ویژن تک

Gemini کی ابتدائی ویڈیو صلاحیتوں میں ڈویلپرز کو پہلے سے سیمپلنگ ریٹ منتخب کرنا پڑتا تھا۔ زیادہ ریٹ کا مطلب زیادہ ٹوکنز اور زیادہ بل ہوتا تھا؛ کم ریٹ کا مطلب یہ تھا کہ تیز رفتار کٹس (cuts) چھوٹ جانے کا خطرہ ہوتا تھا۔ نیا agentic ورژن، جو فی الحال Gemini 3.7 Flash، 3.6 Flash اور 3.5 Flash-Lite کے لیے دستیاب ہے، براہِ راست API میں ایک "think-act-observe" سائیکل شامل کرتا ہے۔ پہلے، ماڈل کام کے بارے میں سوچتا (reason) ہے۔ اس کے بعد، یہ معائنہ کرنے کے لیے ایک حصہ منتخب کرتا ہے۔ آخر میں، یہ منتخب کردہ فریم، آڈیو کلپس، یا ٹرانسکرپٹ کے اقتباسات کا مشاہدہ کرتا ہے۔ اگر کوئی حصہ امید افزا نظر آئے، تو ماڈل اسے فوری طور پر زیادہ باریک بینی (finer granularity) کے ساتھ دوبارہ سیمپل کرتا ہے۔

یہ ڈائنامک سیمپلنگ ماڈل کو لاکھوں ٹوکنز ضائع کیے بغیر گھنٹوں کی فوٹیج—جیسے کہ ایک مکمل لیکچر یا کئی گھنٹوں کی ریکارڈنگ—کا جائزہ لینے کی اجازت دیتی ہے۔ بینچ مارکس جو حقیقی دنیا کے ویڈیو-سوال-جواب (1H-VideoQA) اور وسیع تر ویڈیو سمجھنے کے کاموں (LVBench) کی نقل کرتے ہیں، وہ دکھاتے ہیں کہ وہی سوالات تقریباً ایک دسویں حصے کے ٹوکن بجٹ کے ساتھ مکمل ہو رہے ہیں جبکہ درستگی (accuracy) بھی زیادہ فراہم کر رہے ہیں۔

ٹوکن کی بچت کیوں اہم ہے

ٹوکن کی تعداد کا براہِ راست تعلق API بلوں سے ہے۔ ایک خودکار ویڈیو ایڈیٹنگ ٹول بنانے والے ڈویلپر کے لیے، ایک سیکنڈ میں ایک فریم کے حساب سے پروسیس کی جانے والی 90 منٹ کی ویڈیو کروڑوں ٹوکنز پیدا کر سکتی ہے، جس سے لاگت مواد کے ہر گھنٹے کے لیے سینکڑوں ڈالر تک پہنچ سکتی ہے۔ 88% کی کمی اس رقم کو چند دہائیوں (tens of dollars) تک گرا دیتی ہے، جس سے بڑے پیمانے پر ویڈیو تجزیہ ان اسٹارٹ اپس اور چھوٹی ٹیموں کے لیے ممکن ہو جاتا ہے جو پہلے بھاری بلوں کا سامنا کر رہے تھے۔

لاگت میں یہ فائدہ تجربات کرنے کی رکاوٹ کو بھی کم کرتا ہے۔ پہلے، انجینئرز اہم لمحات کو تلاش کرنے، متعلقہ کلپس نکالنے اور انہیں ماڈل میں واپس بھیجنے کے لیے کسٹم کوڈ لکھتے تھے۔ Gemini API میں agentic ویژن شامل ہونے کے ساتھ، ڈویلپرز Google AI Studio یا Gemini Enterprise Agent Platform میں پروسیسنگ کنفیگریشن کو "agentic" پر سوئچ کر کے اس فیچر کو فعال کر سکتے ہیں۔ گوگل Gemini کی معیاری ٹوکن ریٹ برقرار رکھتا ہے؛ اس بہتر سیمپلنگ کے لیے کوئی اضافی سرچارج نہیں ہے۔

اندازوں کے بغیر درستگی

چونکہ ماڈل خود فیصلہ کرتا ہے کہ کہاں دیکھنا ہے، اس لیے یہ ایک سیکنڈ سے کم کے واقعات کو بھی پکڑ سکتا ہے—ایسی چیز جو ایک اسٹیٹک 1 FPS سیمپل سے لازمی طور پر چھوٹ جاتی۔ یہ درستگی ورزش کی ویڈیو میں تکرار (repetitions) کو گننے، پرہجوم منظر میں کسی چیز کا پیچھا کرنے، یا سیکیورٹی فوٹیج میں اچانک غیر معمولی واقعات (anomalies) کو نشان زد کرنے کے لیے اہم ہے۔ جب ماڈل کسی امید افزا ونڈو کو نشان زد کرتا ہے، تو یہ خود بخود اس حصے کے لیے فریم ریٹ بڑھا دیتا ہے، اور صرف وہیں اعلیٰ معیار کا ڈیٹا فراہم کرتا ہے جہاں اس کی ضرورت ہو۔

یہی طریقہ کار "Ask YouTube" جیسے صارفین کے لیے بنائے گئے فیچرز کو بھی طاقت فراہم کرتا ہے، جہاں صارفین ویڈیو چلنے کے دوران بصری سوالات پوچھتے ہیں اور اصل بصری مواد پر مبنی جوابات حاصل کرتے ہیں۔ ماڈل کو بھیجی جانے والی ویڈیو کی مقدار کو محدود کر کے، یہ فیچر گہرائی پر سمجھوتہ کیے بغیر تیزی سے اور کم لاگت پر جواب دیتا ہے، جس سے صارف کا تجربہ بہتر ہوتا ہے۔

ممکنہ حدود اور توازن

agentic طریقہ کار کوئی جادوئی حل (silver bullet) نہیں ہے۔ ٹوکن کا استعمال تو ڈرامائی طور پر کم ہو جاتا ہے، لیکن ماڈل اب بھی اپنا اندرونی لوپ چلاتا ہے، جو پہلے سے سیمپل کیے گئے فریموں پر براہِ راست گزرنے کے مقابلے میں تاخیر (latency) کا باعث بن سکتا ہے۔ ریئل ٹائم ایپلی کیشنز پر توجہ مرکوز کرنے والے ڈویلپرز کو کم ٹوکن لاگت اور اضافی پروسیسنگ وقت کے درمیان توازن برقرار رکھنے کی ضرورت پڑ سکتی ہے۔

پیش گوئی (Predictability) ایک اور تشویش کا باعث ہے۔ چونکہ ماڈل خود فیصلہ کرتا ہے کہ کن حصوں کا سیمپل لینا ہے، اس لیے کسی دی گئی ویڈیو کے لیے ٹوکن کی صحیح تعداد ہر بار مختلف ہو سکتی ہے۔ وہ ٹیمیں جنہیں سخت بجٹ کی ضرورت ہے، انہیں ٹوکن کے استعمال کی نگرانی کے لیے سسٹم بنانا پڑ سکتا ہے، خاص طور پر ابتدائی انٹیگریشن کے دوران۔

آخر میں، یہ رول آؤٹ Gemini کے Flash ورژنز تک محدود ہے۔ وہ پروجیکٹس جو پرانے یا غیر Flash ماڈلز پر انحصار کرتے ہیں، انہیں مائیگریشن (migration) کرنے تک اس کا فائدہ نہیں ملے گا، جس میں اضافی ڈویلپمنٹ کی کوشش شامل ہو سکتی ہے۔

آگے کیا دیکھنے کو ملے گا

  • استعمال کے رجحانات: ایجنٹک موڈ (agentic mode) استعمال کرنے والے ڈویلپرز کی ابتدائی رپورٹس یہ ظاہر کریں گی کہ آیا تعلیم، تفریح، نگرانی اور دیگر شعبوں میں لاگت کی بچت برقرار رہتی ہے۔
  • قیمتوں میں ترامیم: اگر زیادہ مقدار میں ویڈیو تجزیہ کی طلب میں اضافہ ہوتا ہے تو گوگل ٹوکن کی قیمتوں میں تبدیلی کر سکتا ہے یا مختلف سطح کے پلانز (tiered plans) شامل کر سکتا ہے۔
  • فیچرز کی توسیع: اسی ریژوننگ لوپ (reasoning loop) کو مزید صارفین کے پروڈکٹس میں شامل کرنے سے استعمال کے نئے طریقے سامنے آ سکتے ہیں اور ٹوکن کے لحاظ سے موثر (token-efficient) ویڈیو AI کے بارے میں وسیع آگاہی پیدا ہو سکتی ہے۔
  • بینچ مارک کا ارتقاء: جیسے جیسے مزید ٹیمیں حقیقی دنیا کے ڈیٹا سیٹس پر تجربہ کریں گی، کمیونٹی 1H-VideoQA اور LVBench اسکورز کو مزید بہتر بنائے گی، جس سے ممکنہ طور پر ایسے مخصوص حالات (edge cases) سامنے آ سکتے ہیں جہاں اسٹیٹک سیمپلنگ (static sampling) اب بھی ایجنٹک طریقے سے بہتر کارکردگی دکھاتی ہے۔

خلاصہ

گوگل کا ایجنٹک ویڈیو تجزیہ ڈویلپرز کو بہتر زمانی بصیرت (temporal insight) حاصل کرنے کے ساتھ ساتھ ٹوکن کے استعمال میں 88% تک کمی کرنے کی اجازت دیتا ہے۔ اس کا تبادلہ پروسیسنگ کی پیچیدگی اور متغیر ٹوکن کی تعداد میں معمولی اضافہ ہے، لیکن طویل ویڈیوز کی بہت سی ایپلی کیشنز کے لیے، لاگت میں بچت اور انضمج (integration) میں آسانی ان خدشات سے زیادہ اہم ہے۔ ویڈیو پر مبنی AI بنانے والی ٹیموں کو اس نئے موڈ کا جلد جائزہ لینا چاہیے؛ ویڈیو سمجھنے (video understanding) کو وسعت دینے کے معاشی پہلو ابھی بدل سکتے ہیں۔