أعلنت Google أن عائلة Gemini تدعم الآن وضع تحليل الفيديو "الوكيل" (agentic) الذي يمكنه تقليل استخدام الرموز (tokens) بنسبة تصل إلى 88% في الاختبارات القياسية، وهو تحول قد يجعل الذكاء الاصطناعي للفيديوهات الطويلة أرخص بكثير للمطورين.

يستبدل الوضع الجديد نهج "إطار تلو الآخر" القديم — والذي عادة ما يكون عينة ثابتة بمعدل إطار واحد في الثانية — بحلقة مدفوعة بالنموذج تقرر أي أجزاء من الفيديو يجب فحصها، وبأي سرعة، ومن خلال أي وسيط (الإطارات، أو الصوت، أو النص المكتوب). ومن خلال جلب الإشارات المطلوبة فقط لاستعلام معين، يقلل النظام من البيانات المرسلة إلى النموذج اللغوي مع الاستمرار في التقاط الأحداث التي تستغرق أقل من ثانية، والتي قد تفوتها العينة العامة.

من أخذ العينات الثابت إلى الرؤية المستقلة

كانت قدرات الفيديو السابقة في Gemini تجبر المطورين على اختيار معدل أخذ العينات مسبقًا. فالمعدل الأعلى يعني المزيد من الرموز (tokens) وفواتير أعلى؛ والمعدل الأقل ينطوي على خطر تفويت اللقطات السريعة. أما المتغير "الوكيل" الجديد، المتاح حاليًا لـ Gemini 3.7 Flash و3.6 Flash و3.5 Flash-Lite، فيدمج دورة "فكر-تصرف-لاحظ" مباشرة في واجهة برمجة التطبيقات (API). أولاً، يقوم النموذج بالتحليل المنطقي للمهمة. بعد ذلك، يختار مقطعًا لفحصه. وأخيرًا، يلاحظ الإطارات أو المقاطع الصوتية أو مقتطفات النص المختارة. وإذا بدا المقطع واعدًا، يقوم النموذج بإعادة أخذ العينات منه بدقة أعلى أثناء التشغيل.

يتيح أخذ العينات الديناميكي هذا للنموذج التنقل عبر ساعات من اللقطات — مثل محاضرة كاملة أو تسجيل لعدة ساعات — دون استهلاك ملايين الرموز. وتظهر الاختبارات القياسية التي تحاكي الإجابة على الأسئلة المتعلقة بالفيديو في العالم الحقيقي (1H-VideoQA) ومهام فهم الفيديو الأوسع (LVBench) إكمال نفس الاستعلامات بنحو عُشر ميزانية الرموز مع تقديم دقة أعلى.

لماذا تهم وفورات الرموز (Tokens)

تترجم أعداد الرموز (tokens) مباشرة إلى فواتير واجهة برمجة التطبيقات (API). بالنسبة لمطور يبني أداة مؤتمتة لتحرير الفيديو، فإن فيديو مدته 90 دقيقة يتم معالجته بمعدل إطار واحد في الثانية قد يولد عشرات الملايين من الرموز، مما يدفع التكاليف إلى مئات الدولارات لكل ساعة من المحتوى. أما تقليل بنسبة 88% فيخفض هذا الرقم إلى بضعة عشرات من الدولارات، مما يفتح مجال تحليل الفيديو واسع النطاق للشركات الناشئة والفرق الصغيرة التي كانت تواجه سابقًا فواتير باهظة.

كما تخفض ميزة التكلفة المنخفضة حاجز التجربة. في السابق، كان المهندسون يكتبون كودًا مخصصًا لاكتشاف اللحظات الرئيسية، واستخراج المقاطع ذات الصلة، وإعادة تغذيتها في النموذج. ومع دمج الرؤية "الوكيلة" في Gemini API، يمكن للمطورين تفعيل الميزة عن طريق تبديل تكوين المعالجة إلى "agentic" في Google AI Studio أو Gemini Enterprise Agent Platform. وتحتفظ Google بمعدل رموز Gemini القياسي؛ حيث لا توجد رسوم إضافية مقابل أخذ العينات الأكثر ذكاءً.

الدقة دون تخمين

نظرًا لأن النموذج يقرر أين ينظر، فإنه يمكنه رصد الأحداث التي تقل مدتها عن ثانية واحدة — وهو أمر ستفوتُه حتمًا عينة ثابتة بمعدل 1 إطار في الثانية. وتكتسب هذه الدقة أهمية في عد التكرارات في فيديو للتمارين الرياضية، أو تتبع جسم عبر مشهد مزدحم، أو رصد حالات شاذة مفاجئة في لقطات الأمن. وعندما يحدد النموذج نافذة واعدة، فإنه يرفع تلقائيًا معدل الإطارات لذلك الجزء، مما يوفر بيانات عالية الدقة فقط حيثما تبرز الأهمية.

وتدعم نفس الآلية الميزات الموجهة للمستهلكين مثل "Ask YouTube"، حيث يطرح المستخدمون أسئلة مرئية أثناء تشغيل الفيديو ويتلقون إجابات مستندة إلى المحتوى المرئي الفعلي. ومن خلال الحد من كمية الفيديو المرسلة إلى النموذج، تستجيب الميزة بشكل أسرع وبتكلفة أقل، مما يحسن تجربة المستخدم دون التضحية بالعمق.

الحدود والمقايضات المحتملة

النهج "الوكيل" ليس حلاً سحريًا. فبينما ينخفض استخدام الرموز بشكل كبير، لا يزال النموذج يشغل حلقته الداخلية، مما قد يضيف زمن انتقال (latency) مقارنة بالمرور المباشر عبر الإطارات التي تم أخذ عينات منها مسبقًا. قد يحتاج المطورون الذين يركزون على التطبيقات في الوقت الفعلي إلى الموازنة بين تكاليف الرموز المنخفضة ووقت المعالجة الإضافي.

وتعد القدرة على التنبؤ مصدر قلق آخر. نظرًا لأن النموذج يقرر أي المقاطع سيتم أخذ عينات منها، فإن عدد الرموز الدقيق لفيديو معين يمكن أن يختلف من تشغيل إلى آخر. قد تحتاج الفرق التي تتطلب ميزانية صارمة إلى بناء نظام مراقبة لاستهلاك الرموز، خاصة أثناء التكامل الأولي.

وأخيرًا، يقتصر الإطلاق على إصدارات Flash من Gemini. ولن تستفيد المشاريع التي تعتمد على نماذج قديمة أو غير Flash حتى تنتقل، وهو ما قد يتطلب جهدًا تطويريًا إضافيًا.

ما الذي يجب مراقبته لاحقًا

  • أنماط التبني: ستكشف التقارير الأولية من المطورين الذين يستخدمون النمط الوكيل (agentic mode) عما إذا كان توفير التكاليف سيستمر عبر مجالات التعليم والترفيه والمراقبة والمجالات الأخرى.
  • تعديلات التسعير: قد تقوم Google بتعديل أسعار الرموز (tokens) أو إضافة خطط فئوية إذا ارتفع الطلب على تحليل الفيديو عالي الحجم.
  • توسيع الميزات: قد يؤدي دمج حلقة الاستدلال نفسها في المزيد من المنتجات الاستهلاكية إلى ظهور حالات استخدام جديدة وتعزيز الوعي على نطاق أوسع بالذكاء الاصطناعي للفيديو الموفر للرموز (token-efficient).
  • تطور المعايير المرجعية: مع قيام المزيد من الفرق بالاختبار على مجموعات بيانات من العالم الحقيقي، سيقوم المجتمع بتحسين درجات 1H-VideoQA و LVBench، مما قد يكشف عن حالات حدية لا يزال فيها أخذ العينات الثابت يتفوق على النمط الوكيل.

الخلاصة

يتيح تحليل الفيديو بالنمط الوكيل من Google للمطورين تقليل استهلاك الرموز (tokens) بنسبة تصل إلى 88% مع الحصول على رؤى زمنية أكثر دقة. وتتمثل المقايضة في زيادة طفيفة في تعقيد المعالجة وتغير أعداد الرموز، ولكن بالنسبة للعديد من تطبيقات الفيديو الطويلة، فإن توفير التكاليف وسهولة التكامل يفوقان تلك المخاوف. يجب على الفرق التي تبني ذكاءً اصطناعيًا مرتكزًا على الفيديو تقييم النمط الجديد بسرعة؛ فقد تكون اقتصاديات توسيع نطاق فهم الفيديو قد تغيرت للتو.