Google announced that its Gemini family now supports an “agentic” video-analysis mode that can trim token usage by as much as 88 % on standard benchmarks, a shift that could make long-form video AI dramatically cheaper for developers.

این حالت جدید، رویکرد قدیمی فریم‌به‌فریم (که معمولاً نمونه‌برداری ثابتِ یک فریم در ثانیه بود) را با یک حلقه مدل‌محور جایگزین می‌کند که تصمیم می‌گیرد کدام بخش‌های ویدئو، با چه سرعتی و از طریق کدام مودالیته (فریم‌ها، صدا یا متن پیاده‌شده) بررسی شوند. سیستم با فراخوانی تنها سیگنال‌های مورد نیاز برای یک پرس‌وجوی خاص، حجم داده‌های ارسالی به مدل زبانی را کاهش می‌دهد و در عین حال، رویدادهای زیر ثانیه‌ای را که یک نمونه‌برداری کلی ممکن بود از دست بدهد، شکار می‌کند.

از نمونه‌برداری ثابت تا بینایی خودمختار

قابلیت‌های ویدئویی پیشین Gemini توسعه‌دهندگان را مجبور می‌کرد تا از قبل یک نرخ نمونه‌برداری انتخاب کنند. نرخ بالاتر به معنای توکن‌های بیشتر و صورت‌حساب‌های سنگین‌تر بود؛ نرخ پایین‌تر نیز خطر از دست رفتن برش‌های سریع را به همراه داشت. نسخه عامل‌محور (agentic) جدید که در حال حاضر برای Gemini 3.7 Flash، 3.6 Flash و 3.5 Flash-Lite در دسترس است، یک چرخه «فکر-عمل-مشاهده» را مستقیماً در API تعبیه می‌کند. ابتدا، مدل درباره وظیفه مورد نظر استدلال می‌کند. سپس، بخشی را برای بازرسی انتخاب می‌کند. در نهایت، فریم‌های انتخاب‌شده، قطعات صوتی یا بخش‌هایی از متن را مشاهده می‌کند. اگر بخشی امیدوارکننده به نظر برسد، مدل آن را در لحظه با جزئیات دقیق‌تری بازنمونه‌برداری می‌کند.

این نمونه‌برداری پویا به مدل اجازه می‌دهد تا در ساعت‌ها فیلم (مانند یک سخنرانی کامل یا یک ضبط چند ساعته) بدون مصرف میلیون‌ها توکن جستجو کند. بنچمارک‌هایی که پرس‌وجو از ویدئو در دنیای واقعی (1H-VideoQA) و وظایف گسترده‌تر درک ویدئو (LVBench) را شبیه‌سازی می‌کنند، نشان می‌دهند که همان پرس‌وجوها با تقریباً یک‌دهم بودجه توکن قبلی انجام می‌شوند و در عین حال دقت بالاتری ارائه می‌دهند.

چرا صرفه‌جویی در توکن اهمیت دارد

تعداد توکن‌ها مستقیماً با صورت‌حساب‌های API ترجمه می‌شود. برای توسعه‌دهنده‌ای که در حال ساخت یک ابزار ویرایش ویدئوی خودکار است، پردازش یک ویدئوی ۹۰ دقیقه‌ای با نرخ یک فریم در ثانیه می‌تواند ده‌ها میلیون توکن تولید کند و هزینه‌ها را به صدها دلار برای هر ساعت محتوا برساند. کاهش ۸۸ درصدی، این رقم را به چند ده دلار کاهش می‌دهد و تحلیل ویدئویی در مقیاس بزرگ را برای استارتاپ‌ها و تیم‌های کوچک‌تر که قبلاً با هزینه‌های بازدارنده روبرو بودند، فراهم می‌کند.

مزیت هزینه همچنین مانع ورود به حوزه آزمایش و تجربه را کاهش می‌دهد. پیش از این، مهندسان کدهای سفارشی برای تشخیص لحظات کلیدی، استخراج کلیپ‌های مرتبط و بازگرداندن آن‌ها به مدل می‌نوشتند. با گنجانده شدن بینایی عامل‌محور در Gemini API، توسعه‌دهندگان تنها با تغییر تنظیمات پردازش به حالت «agentic» در Google AI Studio یا Gemini Enterprise Agent Platform، این قابلیت را فعال می‌کنند. گوگل نرخ توکن استاندارد Gemini را حفظ کرده است؛ هیچ هزینه اضافی برای این نمونه‌برداری هوشمندتر دریافت نمی‌شود.

دقت بدون حدس و گمان

از آنجایی که مدل تصمیم می‌گیرد کجا را نگاه کند، می‌تواند رویدادهایی کوتاه‌تر از یک ثانیه را شناسایی کند؛ چیزی که یک نمونه‌برداری ثابت ۱ فریم در ثانیه (1 FPS) ناگزیر از دست می‌داد. این دقت برای شمارش تکرارها در یک ویدئوی ورزشی، ردیابی یک شیء در یک صحنه شلوغ یا علامت‌گذاری ناهنجاری‌های ناگهانی در تصاویر امنیتی اهمیت دارد. وقتی مدل یک بازه امیدوارکننده را شناسایی می‌کند، به‌طور خودکار نرخ فریم را برای آن بخش افزایش می‌دهد و تنها در جاهایی که اهمیت دارد، داده‌هایی با دقت بالا ارائه می‌دهد.

همین مکانیسم قدرت بخشیدن به ویژگی‌های کاربرپسند مانند «Ask YouTube» را فراهم می‌کند؛ جایی که کاربران در حین پخش ویدئو، سوالات بصری می‌پرسند و پاسخ‌هایی دریافت می‌کنند که بر اساس محتوای بصری واقعی است. این ویژگی با محدود کردن میزان ویدئوی ارسالی به مدل، سریع‌تر و با هزینه کمتر پاسخ می‌دهد و تجربه کاربری را بدون قربانی کردن عمق تحلیل، بهبود می‌بخشد.

محدودیت‌های احتمالی و موازنه‌ها

رویکرد عامل‌محور یک راهکار معجزه‌آسا نیست. مصرف توکن به‌شدت کاهش می‌یابد، اما مدل همچنان حلقه داخلی خود را اجرا می‌کند که می‌تواند در مقایسه با یک گذر مستقیم روی فریم‌های نمونه‌برداری‌شده، باعث ایجاد تأخیر (latency) شود. توسعه‌دهندگانی که بر کاربردهای بلادرنگ (real-time) تمرکز دارند، ممکن است نیاز داشته باشند بین هزینه‌های کمتر توکن و زمان پردازش اضافی، تعادل برقرار کنند.

پیش‌بینی‌پذیری یکی دیگر از نگرانی‌ها است. از آنجایی که مدل تصمیم می‌گیرد کدام بخش‌ها را نمونه‌برداری کند، تعداد دقیق توکن‌ها برای یک ویدئوی مشخص می‌تواند در هر بار اجرا متفاوت باشد. تیم‌هایی که به بودجه‌بندی دقیق نیاز دارند، ممکن است لازم باشد سیستم‌های نظارتی برای مصرف توکن، به‌ویژه در مراحل اولیه ادغام، ایجاد کنند.

در نهایت، این عرضه محدود به نسخه‌های Flash از Gemini است. پروژه‌هایی که بر مدل‌های قدیمی‌تر یا غیر Flash متکی هستند، تا زمانی که مهاجرت نکنند از این مزیت بهره‌مند نخواهند شد، که این امر می‌تواند مستلزم تلاش‌های توسعه‌ای اضافی باشد.

آنچه باید در آینده زیر نظر داشت

  • الگوهای پذیرش: گزارش‌های اولیه از توسعه‌دهندگانی که از حالت عامل‌محور (agentic mode) استفاده می‌کنند، مشخص خواهد کرد که آیا صرفه‌جویی در هزینه‌ها در حوزه‌های آموزش، سرگرمی، نظارت و سایر زمینه‌ها پابرجا می‌ماند یا خیر.
  • تعدیل قیمت‌گذاری: اگر تقاضا برای تحلیل ویدئویی با حجم بالا افزایش یابد، گوگل ممکن است قیمت‌گذاری توکن‌ها را تغییر دهد یا طرح‌های پلکانی اضافه کند.
  • گسترش قابلیت‌ها: گنجاندن همین حلقه استدلال در محصولات مصرف‌کننده بیشتر می‌تواند موارد استفاده جدیدی را آشکار کند و آگاهی گسترده‌تری نسبت به هوش مصنوعی ویدئویی با بهره‌وری توکن بالا ایجاد نماید.
  • تکامل بنچمارک‌ها: با آزمایش توسط تیم‌های بیشتر روی مجموعه‌داده‌های دنیای واقعی، جامعه کاربری امتیازات 1H-VideoQA و LVBench را اصلاح خواهد کرد که پتانسیل کشف موارد خاصی (edge cases) را دارد که در آن‌ها نمونه‌برداری ایستا همچنان عملکرد بهتری نسبت به روش عامل‌محور دارد.

خلاصه نهایی

تحلیل ویدئویی عامل‌محور گوگل به توسعه‌دهندگان اجازه می‌دهد مصرف توکن را تا ۸۸٪ کاهش دهند و در عین حال به بینش زمانی دقیق‌تری دست یابند. هزینه این کار، افزایش اندک در پیچیدگی پردازش و تعداد متغیر توکن‌ها است، اما برای بسیاری از کاربردهای ویدئویی طولانی، صرفه‌جویی در هزینه و سهولت در یکپارچه‌سازی بر این نگرانی‌ها غلبه می‌کند. تیم‌هایی که در حال ساخت هوش مصنوعی ویدئو-محور هستند باید این حالت جدید را سریعاً ارزیابی کنند؛ اقتصادِ مقیاس‌پذیریِ درک ویدئویی ممکن است به تازگی تغییر کرده باشد.