Google объявила, что семейство Gemini теперь поддерживает «агентный» режим видеоанализа, который может сократить использование токенов на стандартных бенчмарках на целых 88%. Этот сдвиг может сделать работу с ИИ для длинных видео значительно дешевле для разработчиков.
Новый режим заменяет старый пофреймовый подход — обычно с фиксированной частотой дискретизации один кадр в секунду — циклом под управлением модели, которая сама решает, какие части видео изучать, с какой скоростью и через какие модальности (кадры, аудио или транскрипт). Извлекая только те сигналы, которые необходимы для конкретного запроса, система сокращает объем данных, отправляемых языковой модели, при этом улавливая события длительностью менее секунды, которые пропустила бы грубая дискретизация.
От фиксированной дискретизации к автономному зрению
Предыдущие возможности Gemini в области видео заставляли разработчиков заранее выбирать частоту дискретизации. Более высокая частота означала больше токенов и более высокие счета; более низкая — риск пропустить быстрые склейки. Новый агентный вариант, доступный в настоящее время для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite, встраивает цикл «подумай-действуй-наблюдай» непосредственно в API. Сначала модель рассуждает о задаче. Затем она выбирает сегмент для проверки. Наконец, она изучает выбранные кадры, аудиоклипы или фрагменты транскрипта. Если сегмент кажется перспективным, модель на лету выполняет повторную дискретизацию с более высокой детализацией.
Такая динамическая дискретизация позволяет модели просматривать многочасовые записи — например, полноценную лекцию или многочасовое видео — не расходуя при этом миллионы токенов. Бенчмарки, имитирующие реальные задачи ответов на вопросы по видео (1H-VideoQA) и более широкие задачи понимания видео (LVBench), показывают, что те же самые запросы выполняются примерно с одной десятой бюджета токенов при более высокой точности.
Почему экономия токенов имеет значение
Количество токенов напрямую конвертируется в счета за API. Для разработчика, создающего инструмент автоматического видеомонтажа, 90-минутное видео, обрабатываемое с частотой один кадр в секунду, может генерировать десятки миллионов токенов, поднимая стоимость до сотен долларов за час контента. Сокращение на 88% снижает эту цифру до нескольких десятков долларов, открывая возможности масштабного видеоанализа для стартапов и небольших команд, которые ранее сталкивались с непомерными расходами.
Преимущество в стоимости также снижает порог для экспериментов. Раньше инженерам приходилось писать кастомный код для обнаружения ключевых моментов, извлечения релевантных клипов и их последующей подачи в модель. С внедрением агентного зрения в Gemini API разработчики могут включить эту функцию, просто переключив конфигурацию обработки на «agentic» в Google AI Studio или Gemini Enterprise Agent Platform. Google сохраняет стандартную ставку токенов Gemini; дополнительная наценка за более умную дискретизацию не взимается.
Точность без гадания
Поскольку модель сама решает, куда смотреть, она может замечать события длительностью менее секунды — то, что неизбежно пропустила бы статичная выборка в 1 FPS. Эта точность важна для подсчета повторений на видео с тренировкой, отслеживания объекта в многолюдной сцене или фиксации внезапных аномалий на записях с камер наблюдения. Когда модель отмечает перспективное окно, она автоматически увеличивает частоту кадров для этого фрагмента, предоставляя высокоточные данные только там, где это необходимо.
Тот же механизм лежит в основе функций для потребителей, таких как «Ask YouTube», где пользователи задают визуальные вопросы во время воспроизведения видео и получают ответы, основанные на реальном визуальном контенте. Ограничивая объем видео, отправляемого модели, эта функция работает быстрее и дешевле, улучшая пользовательский опыт без ущерба для глубины анализа.
Потенциальные ограничения и компромиссы
Агентный подход не является панацеей. Использование токенов резко снижается, но модель все равно запускает свой внутренний цикл, что может увеличить задержку по сравнению с прямым проходом по заранее выбранным кадрам. Разработчикам, ориентированным на приложения реального времени, может потребоваться найти баланс между низкой стоимостью токенов и дополнительным временем обработки.
Предсказуемость — еще один важный аспект. Поскольку модель сама решает, какие сегменты выбирать, точное количество токенов для конкретного видео может варьироваться от запуска к запуску. Командам, которым требуется строгое бюджетирование, может потребоваться внедрить мониторинг потребления токенов, особенно на ранних этапах интеграции.
Наконец, внедрение ограничено вариантами Gemini Flash. Проекты, использующие старые или не Flash-модели, не получат преимуществ до тех пор, пока не перейдут на новые, что может потребовать дополнительных усилий по разработке.
За чем следить дальше
- Модели внедрения: Первые отчеты разработчиков, использующих агентный режим, покажут, сохранится ли экономия средств в таких сферах, как образование, развлечения, видеонаблюдение и другие.
- Корректировка цен: Google может изменить стоимость токенов или добавить многоуровневые тарифные планы, если спрос на масштабный видеоанализ резко возрастет.
- Расширение возможностей: Внедрение того же цикла рассуждений (reasoning loop) в большее количество потребительских продуктов может выявить новые сценарии использования и повысить осведомленность об эффективности видео-ИИ с точки зрения расхода токенов.
- Эволюция бенчмарков: По мере того как все больше команд будут проводить тестирование на реальных наборах данных, сообщество уточнит показатели 1H-VideoQA и LVBench, что потенциально может выявить пограничные случаи, где статическая выборка все еще превосходит агентный метод.
Итог
Агентный видеоанализ от Google позволяет разработчикам сократить потребление токенов на величину до 88 %, обеспечивая при этом более детальный временной анализ. Компромиссом является незначительное увеличение сложности обработки и переменное количество токенов, но для многих приложений, работающих с длинными видео, экономия средств и простота интеграции перевешивают эти опасения. Командам, создающим видео-ориентированный ИИ, следует оперативно оценить новый режим; экономика масштабирования понимания видео могла только что измениться.
