גוגל הודיעה שמשפחת ה-Gemini שלה תומכת כעת במצב ניתוח וידאו "סוכן" (agentic) שיכול לצמצם את השימוש בטוקנים בעד 88% במבחני ביצועים סטנדרטיים, שינוי שעשוי להפוך בינה מלאכותית לווידאו ארוך לזולה משמעותית עבור מפתחים.

המצב החדש מחליף את הגישה הישנה של פריים-אחר-פריים — בדרך כלל דגימה קבועה של פריים אחד לשנייה — בלולאה מונעת-מודל שמחליטה אילו חלקים בווידאו לבדוק, באיזו מהירות ובאיזו מודליות (frames, audio, או transcript). על ידי שליפת האותות הדרושים בלבד לשאילתה ספציפית, המערכת מצמצמת את כמות הנתונים הנשלחת למודל השפה, ועדיין תופסת אירועים של פחות משנייה שדגימה גסה הייתה מפספסת.

מדגימה קבועה לחזון אוטונומי

היכולות הקודמות של Gemini בווידאו אילצו מפתחים לבחור קצב דגימה מראש. קצב גבוה יותר פירושו יותר טוקנים וחשבונות גבוהים יותר; קצב נמוך יותר סיכן לפספוס קטעים מהירים. הגרסה ה-"agentic" החדשה, הזמינה כעת עבור Gemini 3.7 Flash, 3.6 Flash ו-3.5 Flash-Lite, מטמיעה מחזור של "חשוב-פעל-צפה" (think-act-observe) ישירות בתוך ה-API. ראשית, המודל מנתח את המשימה. לאחר מכן, הוא בוחר קטע לבדיקה. לבסוף, הוא צופה בפרימים הנבחרים, בקטעי האודיו או בקטעי התמליל (transcript). אם קטע נראה מבטיח, המודל מבצע דגימה מחדש ברזולוציה עדינה יותר תוך כדי תנועה.

הדגימה הדינמית הזו מאפשרת למודל "לטייל" דרך שעות של צילומים — חשבו על הרצאה מלאה או הקלטה של מספר שעות — מבלי לשרוף מיליוני טוקנים. מבחני ביצועים המדמים שאלות-על-וידאו בעולם האמיתי (1H-VideoQA) ומשימות הבנה רחבות יותר של וידאו (LVBench) מראים כי אותן שאילתות מסתיימות עם בערך עשירית מתקציב הטוקנים, תוך אספקת דיוק גבוה יותר.

למה חיסכון בטוקנים חשוב

כמות הטוקנים מתורגמת ישירות לחשבונות ה-API. עבור מפתח הבונה כלי עריכת וידאו אוטומטי, וידאו של 90 דקות המעובד בקצב של פריים אחד לשנייה עלול לייצר עשרות מיליוני טוקנים, מה שדוחף את העלויות למאות דולרים לשעת תוכן. הפחתה של 88% מורידה את המספר הזה לכמה עשרות דולרים, ובכך פותחת את ניתוח הווידאו בקנה מידה גדול עבור סטארט-אפים וצוותים קטנים יותר שבעבר התמודדו עם חשבונות מופרזים.

יתרון העלות גם מוריד את מחסום הניסוי. בעבר, מהנדסים כתבו קוד מותאם אישית כדי לזהות רגע

  • דפוסי אימוץ: דיווחים ראשוניים ממפתחים המשתמשים במצב ה-agentic יחשפו האם החיסכון בעלויות יישמר בתחומי החינוך, הבידור, המעקב ותחומים נוספים.
  • התאמות תמחור: Google עשויה לשנות את תמחור הטוקנים או להוסיף תוכניות מדורגות אם תהיה עלייה חדה בביקוש לניתוח וידאו בנפח גבוה.
  • הרחבת תכונות: הטמעת לולאת ההסקה (reasoning loop) עצמה במוצרי צריכה נוספים עשויה להציף מקרי בוחן (use cases) חדשים ולהגביר את המודעות לבינה מלאכותית לווידאו שהיא חסכונית בטוקנים.
  • התפתחות מדדי ייחוס (Benchmarks): ככל שיותר צוותים יבחנו על מערכי נתונים מהעולם האמיתי, הקהילה תחדד את ציוני ה-1H-VideoQA וה-LVBench, מה שעשוי לחשוף מקרי קצה שבהם דגימה סטטית עדיין מציגה ביצועים טובים יותר מהשיטה ה-agentic.

שורה תחתונה

ניתוח הווידאו ה-agentic של Google מאפשר למפתחים להפחית את צריכת הטוקנים בשיעור של עד 88% תוך קבלת תובנות זמן (temporal) מדויקות יותר. המחיר הוא עלייה מתונה במורכבות העיבוד ובמספר הטוקנים המשתנה, אך עבור יישומי וידאו ארוכים רבים, החיסכון בעלויות וקלות האינטגרציה עולים על חשבונות אלו. צוותים המפתחים בינה מלאכותית ממוקדת וידאו צריכים להעריך את המצב החדש במהירות; הכלכלה של הרחבת הבנת הווידאו (scaling video understanding) עשויה להשתנות כעת.