Google ogłosiło, że rodzina modeli Gemini wspiera teraz „agentyczny” tryb analizy wideo, który może zredukować zużycie tokenów nawet o 88% w standardowych benchmarkach. Ta zmiana może sprawić, że AI do długich form wideo stanie się znacznie tańsze dla programistów.

Nowy tryb zastępuje dotychczasowe podejście klatka po klatce – zazwyczaj polegające na próbkowaniu o stałej częstotliwości jednej klatki na sekundę – pętlą sterowaną przez model, która decyduje, które części wideo należy zbadać, z jaką prędkością i za pomocą której modalności (klatek, dźwięku lub transkrypcji). Pobierając jedynie sygnały niezbędne do konkretnego zapytania, system ogranicza ilość danych przesyłanych do modelu językowego, jednocześnie wychwytując zdarzenia trwające ułamek sekundy, które mogłyby zostać pominięte przy rzadkim próbkowaniu.

Od stałego próbkowania do autonomicznej wizji

Wcześniejsze możliwości wideo w Gemini zmuszały programistów do wcześniejszego określenia częstotliwości próbkowania. Wyższa częstotliwość oznaczała więcej tokenów i wyższe rachunki; niższa niosła ryzyko pominięcia szybkich cięć. Nowy wariant agentyczny, dostępny obecnie dla Gemini 3.7 Flash, 3.6 Flash oraz 3.5 Flash-Lite, implementuje cykl „myśl-działaj-obserwuj” bezpośrednio w API. Najpierw model analizuje zadanie. Następnie wybiera segment do sprawdzenia. Na koniec obserwuje wybrane klatki, klipy audio lub fragmenty transkrypcji. Jeśli segment wydaje się obiecujący, model dokonuje ponownego próbkowania o większej szczegółowości w czasie rzeczywistym.

To dynamiczne próbkowanie pozwala modelowi „przeglądać” godziny materiału – np. pełnowymiarowy wykład lub wielogodzinne nagranie – bez zużywania milionów tokenów. Benchmarki naśladujące rzeczywiste zadania odpowiadania na pytania dotyczące wideo (1H-VideoQA) oraz szersze zadania rozumienia wideo (LVBench) pokazują, że te same zapytania można realizować przy użyciu około jednej dziesiątej budżetu tokenów, osiągając jednocześnie wyższą dokładność.

Dlaczego oszczędności tokenów mają znaczenie

Liczba tokenów przekłada się bezpośrednio na rachunki za API. Dla programisty budującego narzędzie do automatycznej edycji wideo, 90-minutowy film przetwarzany z częstotliwością jednej klatki na sekundę mógłby wygenerować dziesiątki milionów tokenów, co podniosłoby koszty do setek dolarów za godzinę materiału. Redukcja o 88% obniża tę kwotę do kilkudziesięciu dolarów, otwierając szeroką analizę wideo dla startupów i mniejszych zespołów, które wcześniej mierzyły się z zaporowymi kosztami.

Przewaga kosztowa obniża również próg eksperymentowania. Wcześniej inżynierowie pisali własny kod, aby wykrywać kluczowe momenty, wycinać istotne klipy i przesyłać je z powrotem do modelu. Dzięki wbudowanej w Gemini API wizji agentycznej, programiści mogą włączyć tę funkcję, zmieniając konfigurację przetwarzania na „agentic” w Google AI Studio lub Gemini Enterprise Agent Platform. Google utrzymuje standardową stawkę za tokeny Gemini; za inteligentniejsze próbkowanie nie ma dodatkowej opłaty.

Precyzja bez zgadywania

Ponieważ model decyduje, gdzie patrzeć, może wykryć zdarzenia trwające krócej niż sekundę – coś, co przy statycznym próbkowaniu 1 FPS byłoby nieuniknione do pominięcia. Ta precyzja jest istotna przy liczeniu powtórzeń w filmie z treningiem, śledzeniu obiektu w zatłoczonej scenie czy wykrywaniu nagłych anomalii w nagraniach z monitoringu. Gdy model zidentyfikuje obiecujący fragment, automatycznie zwiększa częstotliwość klatek dla tego wycinka, dostarczając dane wysokiej jakości tylko tam, gdzie jest to istotne.

Ten sam mechanizm napędza funkcje skierowane do konsumentów, takie jak „Ask YouTube”, gdzie użytkownicy zadają pytania wizualne podczas odtwarzania wideo i otrzymują odpowiedzi oparte na rzeczywistej zawartości wizualnej. Dzięki ograniczeniu ilości wideo przesyłanego do modelu, funkcja ta działa szybciej i przy niższym koszcie, poprawiając doświadczenie użytkownika bez poświęcania głębi analizy.

Potencjalne ograniczenia i kompromisy

Podejście agentyczne nie jest rozwiązaniem idealnym. Zużycie tokenów drastycznie spada, ale model nadal wykonuje swoją wewnętrzną pętlę, co może zwiększyć opóźnienia w porównaniu z bezpośrednim przetwarzaniem wstępnie wypróbkowanych klatek. Programiści skupieni na aplikacjach czasu rzeczywistego mogą potrzebować zbalansować niższe koszty tokenów z dodatkowym czasem przetwarzania.

Kolejną kwestią jest przewidywalność. Ponieważ model decyduje, które segmenty próbkować, dokładna liczba tokenów dla danego wideo może różnić się w zależności od uruchomienia. Zespoły wymagające ścisłego budżetowania mogą potrzebować monitorowania zużycia tokenów, szczególnie na etapie wczesnej integracji.

Na koniec, wdrożenie jest ograniczone do wariantów Flash modelu Gemini. Projekty opierające się na starszych modelach lub modelach innych niż Flash nie odniosą korzyści, dopóki nie przeprowadzą migracji, co może wymagać dodatkowego wysiłku programistycznego.

Co dalej?

  • Wzorce adopcji: Wczesne raporty od programistów korzystających z trybu agentowego ujawnią, czy oszczędności kosztów utrzymają się w edukacji, rozrywce, nadzorze i innych dziedzinach.
  • Korekty cenowe: Google może dostosować ceny tokenów lub wprowadzić plany taryfowe, jeśli nastąpi gwałtowny wzrost zapotrzebowania na analizę dużej ilości materiałów wideo.
  • Rozszerzenia funkcji: Implementacja tej samej pętli rozumowania w większej liczbie produktów konsumenckich może ujawnić nowe przypadki użycia i zwiększyć świadomość na temat wydajnej pod względem tokenów sztucznej inteligencji wideo.
  • Ewolucja benchmarków: W miarę jak więcej zespołów będzie przeprowadzać testy na rzeczywistych zbiorach danych, społeczność dopracuje wyniki 1H-VideoQA i LVBench, co potencjalnie ujawni przypadki brzegowe, w których próbkowanie statyczne wciąż przewyższa metodę agentową.

Podsumowanie

Agentowa analiza wideo od Google pozwala programistom zredukować zużycie tokenów nawet o 88%, zapewniając jednocześnie dokładniejszy wgląd w strukturę czasową. Kompromisem jest niewielki wzrost złożoności przetwarzania i zmienna liczba tokenów, ale w przypadku wielu aplikacji wideo o długim czasie trwania oszczędności kosztów i łatwość integracji przeważają nad tymi obawami. Zespoły budujące rozwiązania AI skoncentrowane na wideo powinny szybko ocenić nowy tryb; ekonomia skalowania rozumienia wideo może właśnie ulec zmianie.