Google은 Gemini 제품군이 이제 표준 벤치마크에서 토큰 사용량을 최대 88%까지 줄일 수 있는 "에이전트 방식(agentic)" 비디오 분석 모드를 지원한다고 발표했습니다. 이는 개발자들에게 장편 비디오 AI를 획기적으로 저렴하게 만들 수 있는 변화입니다.
새로운 모드는 기존의 프레임 단위 방식(일반적으로 초당 1프레임 샘플링)을 모델 주도형 루프로 대체합니다. 이 루프는 비디오의 어느 부분을, 어떤 속도로, 어떤 모달리티(프레임, 오디오 또는 스크립트)를 통해 조사할지 결정합니다. 특정 쿼리에 필요한 신호만 가져옴으로써, 거친 샘플링으로는 놓칠 수 있는 1초 미만의 이벤트까지 포착하면서도 언어 모델로 전송되는 데이터 양을 줄입니다.
고정 샘플링에서 자율 비전으로
Gemini의 이전 비디오 기능은 개발자가 사전에 샘플링 속도를 직접 선택해야 했습니다. 속도가 높으면 토큰이 더 많이 소모되어 비용이 증가하고, 속도가 낮으면 빠른 장면 전환을 놓칠 위험이 있었습니다. 현재 Gemini 3.7 Flash, 3.6 Flash 및 3.5 Flash-Lite에서 사용할 수 있는 새로운 에이전트 방식 변형은 API에 "생각-행동-관찰(think-act-observe)" 사이클을 직접 내장합니다. 먼저 모델이 작업에 대해 추론합니다. 그다음 조사할 세그먼트를 선택합니다. 마지막으로 선택된 프레임, 오디오 클립 또는 스크립트 발췌본을 관찰합니다. 특정 세그먼트가 유망해 보이면 모델은 즉석에서 더 세밀한 입도로 재샘플링합니다.
이러한 동적 샘플링을 통해 모델은 수백만 개의 토큰을 소모하지 않고도 몇 시간 분량의 영상(예: 전체 강의 또는 몇 시간짜리 녹화 영상)을 탐색할 수 있습니다. 실제 비디오 질의응답(1H-VideoQA) 및 광범위한 비디오 이해 작업(LVBench)을 모방한 벤치마크 결과에 따르면, 동일한 쿼리를 약 10분의 1의 토큰 예산으로 완료하면서도 더 높은 정확도를 제공하는 것으로 나타났습니다.
토큰 절감이 중요한 이유
토큰 수는 API 비용과 직결됩니다. 자동 비디오 편집 도구를 구축하는 개발자의 경우, 초당 1프레임으로 처리되는 90분 길이의 비디오는 수천만 개의 토큰을 생성하여 콘텐츠 시간당 비용이 수백 달러에 달할 수 있습니다. 88%의 절감은 이 수치를 수십 달러 수준으로 낮추어, 이전에는 과도한 비용 문제로 어려움을 겪었던 스타트업과 소규모 팀도 대규모 비디오 분석을 활용할 수 있게 합니다.
비용 이점은 실험의 장벽도 낮춥니다. 이전에는 엔지니어가 주요 순간을 감지하고 관련 클립을 추출하여 모델에 다시 입력하는 커스텀 코드를 직접 작성해야 했습니다. Gemini API에 에이전트 비전이 내장됨에 따라, 개발자는 Google AI Studio 또는 Gemini Enterprise Agent Platform에서 처리 구성을 "agentic"으로 전환하는 것만으로 이 기능을 활성화할 수 있습니다. Google은 표준 Gemini 토큰 요율을 유지하며, 더 스마트한 샘플링에 대한 추가 할증료는 없습니다.
추측 없는 정밀함
모델이 어디를 볼지 직접 결정하기 때문에, 정적인 1 FPS 샘플링으로는 필연적으로 놓칠 수밖에 없는 1초 미만의 이벤트도 포착할 수 있습니다. 이러한 정밀함은 운동 영상에서 반복 횟수를 세거나, 붐비는 장면에서 객체를 추적하거나, 보안 영상에서 갑작스러운 이상 징후를 감지하는 데 중요합니다. 모델이 유망한 구간을 포착하면 해당 구간의 프레임 속도를 자동으로 높여 필요한 부분에 대해서만 고정밀 데이터를 제공합니다.
동일한 메커니즘이 사용자가 비디오가 재생되는 동안 시각적 질문을 던지고 실제 시각적 콘텐츠에 기반한 답변을 받는 "Ask YouTube"와 같은 소비자 대상 기능에도 적용됩니다. 모델로 전송되는 비디오 양을 제한함으로써, 이 기능은 깊이를 희생하지 않으면서도 더 빠르게 응답하고 비용을 낮추어 사용자 경험을 개선합니다.
잠재적 한계 및 트레이드오프
에이전트 방식이 만능 해결책은 아닙니다. 토큰 사용량은 극적으로 줄어들지만, 모델은 여전히 내부 루프를 실행하므로 미리 샘플링된 프레임을 단순히 통과하는 방식에 비해 지연 시간이 추가될 수 있습니다. 실시간 애플리케이션에 집중하는 개발자는 낮은 토큰 비용과 추가적인 처리 시간 사이에서 균형을 맞춰야 할 수도 있습니다.
예측 가능성 또한 고려 사항입니다. 모델이 샘플링할 세그먼트를 결정하기 때문에, 특정 비디오에 대한 정확한 토큰 수는 실행할 때마다 달라질 수 있습니다. 엄격한 예산 관리가 필요한 팀은 특히 초기 통합 단계에서 토큰 소비에 대한 모니터링 시스템을 구축해야 할 수도 있습니다.
마지막으로, 이 기능은 Gemini의 Flash 변형 모델로 한정되어 출시됩니다. 이전 모델이나 Flash가 아닌 모델에 의존하는 프로젝트는 마이그레이션이 완료될 때까지 혜택을 받을 수 없으며, 여기에는 추가적인 개발 노력이 필요할 수 있습니다.
향후 주목할 점
- 채택 패턴: 에이전틱 모드를 사용하는 개발자들의 초기 보고를 통해 교육, 엔터테인먼트, 보안 및 기타 분야에서 비용 절감 효과가 유지되는지 확인할 수 있을 것입니다.
- 가격 조정: 대규모 비디오 분석 수요가 급증할 경우, Google은 토큰 가격을 조정하거나 계층형 요금제를 추가할 수 있습니다.
- 기능 확장: 동일한 추론 루프를 더 많은 소비자용 제품에 내장함으로써 새로운 유스케이스를 발굴하고, 토큰 효율적인 비디오 AI에 대한 인지도를 넓힐 수 있습니다.
- 벤치마크 진화: 더 많은 팀이 실제 데이터셋으로 테스트를 진행함에 따라, 커뮤니티는 1H-VideoQA 및 LVBench 점수를 정교화할 것이며, 정적 샘플링(static sampling)이 여전히 에이전틱 방식보다 성능이 뛰어난 엣지 케이스를 발견할 수도 있습니다.
요약
Google의 에이전틱 비디오 분석을 통해 개발자는 더 세밀한 시간적 통찰력을 얻으면서도 토큰 소비를 최대 88%까지 줄일 수 있습니다. 트레이드오프로는 처리 복잡도와 가변적인 토큰 수의 약간의 증가가 있지만, 많은 롱폼 비디오 애플리케이션의 경우 비용 절감과 통합의 용이성이 이러한 우려보다 더 큽니다. 비디오 중심 AI를 구축하는 팀은 이 새로운 모드를 신속하게 검토해야 합니다. 비디오 이해(video understanding) 규모를 확장하는 경제성이 방금 변화했을 수도 있습니다.
