Google ঘোষণা করেছে যে তাদের Gemini ফ্যামিলি এখন একটি "এজেন্টিক" (agentic) ভিডিও-বিশ্লেষণ মোড সমর্থন করে, যা স্ট্যান্ডার্ড বেঞ্চমার্কে টোকেন ব্যবহার ৮৮% পর্যন্ত কমিয়ে আনতে পারে। এই পরিবর্তন ডেভেলপারদের জন্য দীর্ঘ ভিডিওর এআই (AI) ব্যবহারকে নাটকীয়ভাবে সাশ্রয়ী করে তুলতে পারে।

নতুন এই মোডটি পুরনো ফ্রেম-বাই-ফ্রেম পদ্ধতি—যা সাধারণত প্রতি সেকেন্ডে একটি নির্দিষ্ট ফ্রেম স্যাম্পল করত—তার পরিবর্তে একটি মডেল-চালিত লুপ ব্যবহার করে। এই লুপটি সিদ্ধান্ত নেয় ভিডিওর কোন অংশগুলো পরীক্ষা করতে হবে, কোন গতিতে করতে হবে এবং কোন মাধ্যমে (ফ্রেম, অডিও বা ট্রান্সক্রিপ্ট) করতে হবে। একটি নির্দিষ্ট কুয়েরির জন্য শুধুমাত্র প্রয়োজনীয় সিগন্যালগুলো সংগ্রহ করার মাধ্যমে, সিস্টেমটি ল্যাঙ্গুয়েজ মডেলে পাঠানো ডেটার পরিমাণ কমিয়ে দেয়, অথচ সেকেন্ডের ক্ষুদ্রতম অংশ বা সাব-সেকেন্ড ইভেন্টগুলোও মিস করে না যা একটি সাধারণ স্যাম্পলিং পদ্ধতিতে হারিয়ে যেত।

ফিক্সড স্যাম্পলিং থেকে স্বায়ত্তশাসিত ভিশন

Gemini-র আগের ভিডিও সক্ষমতাগুলোতে ডেভেলপারদের আগে থেকেই স্যাম্পলিং রেট বেছে নিতে হতো। উচ্চ রেট মানে বেশি টোকেন এবং বেশি বিল; আর নিম্ন রেট মানে দ্রুত পরিবর্তন হওয়া দৃশ্যগুলো মিস করার ঝুঁকি। নতুন এজেন্টিক ভেরিয়েন্টটি, যা বর্তমানে Gemini 3.7 Flash, 3.6 Flash এবং 3.5 Flash-Lite-এর জন্য উপলব্ধ, সরাসরি API-তে একটি "চিন্তা-কাজ-পর্যবেক্ষণ" (think-act-observe) চক্র যুক্ত করে। প্রথমে, মডেলটি কাজটি নিয়ে যুক্তি প্রদান করে। এরপর, এটি পরিদর্শনের জন্য একটি অংশ নির্বাচন করে। সবশেষে, এটি নির্বাচিত ফ্রেম, অডিও ক্লিপ বা ট্রান্সক্রিপ্টের অংশগুলো পর্যবেক্ষণ করে। যদি কোনো অংশ আশাব্যঞ্জক মনে হয়, তবে মডেলটি তাৎক্ষণিকভাবে আরও সূক্ষ্মভাবে (finer granularity) সেটি পুনরায় স্যাম্পল করে।

এই ডায়নামিক স্যাম্পলিং মডেলটিকে লক্ষ লক্ষ টোকেন খরচ না করেই ঘণ্টার পর ঘণ্টা ফুটেজ—যেমন একটি পূর্ণাঙ্গ লেকচার বা কয়েক ঘণ্টার রেকর্ডিং—খুঁজে দেখার সুযোগ দেয়। রিয়েল-ওয়ার্ল্ড ভিডিও-প্রশ্নোত্তর (1H-VideoQA) এবং আরও বিস্তৃত ভিডিও-আন্ডারস্ট্যান্ডিং টাস্ক (LVBench) অনুকরণকারী বেঞ্চমার্কগুলো দেখায় যে, একই কুয়েরি সম্পন্ন করতে টোকেন বাজেট প্রায় এক-দশমাংশ খরচ হচ্ছে, অথচ নির্ভুলতা আরও বেশি পাওয়া যাচ্ছে।

কেন টোকেন সাশ্রয় গুরুত্বপূর্ণ

টোকেন সংখ্যা সরাসরি API বিলের সাথে সম্পর্কিত। একজন ডেভেলপার যদি একটি স্বয়ংক্রিয় ভিডিও-এডিটিং টুল তৈরি করেন, তবে প্রতি সেকেন্ডে একটি ফ্রেম হিসেবে প্রসেস করা ৯০ মিনিটের একটি ভিডিওর জন্য কোটি কোটি টোকেন খরচ হতে পারে, যা প্রতি ঘণ্টার কন্টেন্টের জন্য খরচ কয়েকশ ডলারে নিয়ে যেতে পারে। ৮৮% হ্রাস সেই খরচ কমিয়ে মাত্র কয়েক ডলারে নামিয়ে আনে, যা স্টার্টআপ এবং ছোট দলগুলোর জন্য বড় পরিসরে ভিডিও বিশ্লেষণ করা সহজ করে তোলে, যারা আগে অত্যধিক বিলের সম্মুখীন হতো।

এই খরচ সাশ্রয় পরীক্ষা-নিরীক্ষার বাধাও কমিয়ে দেয়। আগে ইঞ্জিনিয়ারদের গুরুত্বপূর্ণ মুহূর্ত শনাক্ত করতে, প্রাসঙ্গিক ক্লিপ বের করতে এবং সেগুলো মডেলে পুনরায় ইনপুট দিতে কাস্টম কোড লিখতে হতো। Gemini API-তে এজেন্টিক ভিশন যুক্ত হওয়ার ফলে, ডেভেলপাররা Google AI Studio বা Gemini Enterprise Agent Platform-এ প্রসেসিং কনফিগারেশনটি "agentic" এ টগল করার মাধ্যমেই এই ফিচারটি চালু করতে পারেন। Google তাদের স্ট্যান্ডার্ড Gemini টোকেন রেট বজায় রেখেছে; এই স্মার্ট স্যাম্পলিংয়ের জন্য কোনো অতিরিক্ত চার্জ নেই।

অনুমান ছাড়াই নির্ভুলতা

যেহেতু মডেলটি নিজেই সিদ্ধান্ত নেয় কোথায় দেখতে হবে, তাই এটি এক সেকেন্ডের কম সময়ের ঘটনাও শনাক্ত করতে পারে—যা একটি স্ট্যাটিক ১ FPS স্যাম্পল নিশ্চিতভাবেই মিস করত। ওয়ার্কআউট ভিডিওতে পুনরাবৃত্তি গণনা করা, জনাকীর্ণ দৃশ্যে কোনো বস্তু ট্র্যাক করা বা সিকিউরিটি ফুটেজে হঠাৎ কোনো অস্বাভাবিকতা শনাক্ত করার ক্ষেত্রে এই নির্ভুলতা অত্যন্ত গুরুত্বপূর্ণ। যখন মডেলটি কোনো আশাব্যঞ্জক অংশ শনাক্ত করে, তখন এটি স্বয়ংক্রিয়ভাবে সেই অংশের ফ্রেম-রেট বাড়িয়ে দেয়, ফলে যেখানে প্রয়োজন সেখানেই উচ্চ-মানের (high-fidelity) ডেটা প্রদান করে।

একই মেকানিজম "Ask YouTube"-এর মতো ভোক্তা-মুখী ফিচারগুলোতেও কাজ করে, যেখানে ব্যবহারকারীরা ভিডিও চলাকালীন ভিজ্যুয়াল প্রশ্ন করতে পারেন এবং ভিডিওর প্রকৃত ভিজ্যুয়াল কন্টেন্টের ওপর ভিত্তি করে উত্তর পান। মডেলে পাঠানো ভিডিওর পরিমাণ সীমিত করার মাধ্যমে, এই ফিচারটি দ্রুত এবং কম খরচে উত্তর দেয়, যা গভীরতা বজায় রেখে ব্যবহারকারীর অভিজ্ঞতা উন্নত করে।

সম্ভাব্য সীমাবদ্ধতা এবং আপস

এজেন্টিক পদ্ধতিটি সব সমস্যার সমাধান নয়। টোকেন ব্যবহার নাটকীয়ভাবে কমলেও, মডেলটিকে তার অভ্যন্তরীণ লুপ চালাতে হয়, যা প্রি-স্যাম্পল করা ফ্রেমের ওপর সরাসরি প্রসেসিং করার তুলনায় কিছুটা ল্যাটেন্সি বা বিলম্ব তৈরি করতে পারে। রিয়েল-টাইম অ্যাপ্লিকেশনের ক্ষেত্রে ডেভেলপারদের কম টোকেন খরচ এবং অতিরিক্ত প্রসেসিং সময়ের মধ্যে ভারসাম্য বজায় রাখতে হতে পারে।

পূর্বাভাসযোগ্যতা (Predictability) আরেকটি উদ্বেগের বিষয়। যেহেতু মডেলটি নিজেই ঠিক করে কোন অংশগুলো স্যাম্পল করবে, তাই একটি নির্দিষ্ট ভিডিওর জন্য সঠিক টোকেন সংখ্যা প্রতিবার ভিন্ন হতে পারে। যেসব টিমের জন্য কঠোর বাজেট মেনে চলা প্রয়োজন, তাদের বিশেষ করে প্রাথমিক ইন্টিগ্রেশনের সময় টোকেন ব্যবহারের ওপর মনিটরিং ব্যবস্থা রাখতে হতে পারে।

সবশেষে, এই রোলআউটটি শুধুমাত্র Gemini-র Flash ভেরিয়েন্টগুলোর জন্য সীমাবদ্ধ। যেসব প্রজেক্ট পুরনো বা নন-ফ্ল্যাশ মডেলের ওপর নির্ভরশীল, তারা মাইগ্রেট না করা পর্যন্ত এর সুবিধা পাবে না, যা অতিরিক্ত ডেভেলপমেন্ট প্রচেষ্টার প্রয়োজন হতে পারে।

পরবর্তীতে কী লক্ষ্য রাখা উচিত

  • ব্যবহারের ধরণ: এজেন্টিক মোড ব্যবহারকারী ডেভেলপারদের প্রাথমিক রিপোর্টগুলো প্রকাশ করবে যে শিক্ষা, বিনোদন, নজরদারি এবং অন্যান্য ক্ষেত্রে খরচ সাশ্রয় বজায় থাকে কি না।
  • মূল্যের সমন্বয়: যদি উচ্চ-পরিমাণ ভিডিও বিশ্লেষণের চাহিদা বৃদ্ধি পায়, তবে গুগল টোকেন প্রাইসিং পরিবর্তন করতে পারে বা বিভিন্ন স্তরের (tiered) প্ল্যান যোগ করতে পারে।
  • ফিচারের সম্প্রসারণ: একই রিজনিং লুপ আরও বেশি কনজিউমার প্রোডাক্টে যুক্ত করা নতুন ব্যবহারের ক্ষেত্র উন্মোচন করতে পারে এবং টোকেন-সাশ্রয়ী ভিডিও AI সম্পর্কে ব্যাপক সচেতনতা তৈরি করতে পারে।
  • বেঞ্চমার্কের বিবর্তন: আরও বেশি টিম যখন বাস্তব জগতের ডেটাসেটে পরীক্ষা করবে, তখন কমিউনিটি 1H-VideoQA এবং LVBench স্কোরগুলোকে আরও পরিমার্জিত করবে, যা সম্ভবত এমন কিছু বিশেষ ক্ষেত্র (edge cases) উন্মোচন করবে যেখানে স্ট্যাটিক স্যাম্পলিং এখনও এজেন্টিক পদ্ধতির চেয়ে ভালো ফলাফল দেয়।

সারকথা

গুগলের এজেন্টিক ভিডিও অ্যানালাইসিস ডেভেলপারদের টোকেন খরচ ৮৮% পর্যন্ত কমাতে সাহায্য করে, পাশাপাশি আরও সূক্ষ্ম টেম্পোরাল ইনসাইট প্রদান করে। এর বিনিময়ে প্রসেসিং জটিলতা এবং টোকেন সংখ্যার পরিবর্তনশীলতা কিছুটা বাড়তে পারে, তবে অনেক দীর্ঘ ভিডিও অ্যাপ্লিকেশনের ক্ষেত্রে খরচ সাশ্রয় এবং সহজ ইন্টিগ্রেশন এই উদ্বেগগুলোর চেয়ে বেশি গুরুত্বপূর্ণ। ভিডিও-কেন্দ্রিক AI তৈরি করা টিমগুলোর দ্রুত এই নতুন মোডটি মূল্যায়ন করা উচিত; ভিডিও আন্ডারস্ট্যান্ডিং স্কেল করার অর্থনীতি হয়তো মাত্র পরিবর্তিত হলো।