Googleは、Geminiファミリーが新たに「エージェンティック(agentic)」なビデオ解析モードをサポートすることを発表しました。これにより、標準的なベンチマークにおいてトークン使用量を最大88%削減でき、開発者にとって長尺ビデオAIのコストを劇的に抑えられる可能性があります。

この新しいモードは、従来のフレーム単位のアプローチ(通常は毎秒1フレームの固定サンプリング)に代わり、ビデオのどの部分を、どの程度の速度で、どのモダリティ(フレーム、音声、または文字起こし)を通じて調査するかを決定する、モデル主導のループを採用しています。特定のクエリに必要な信号のみを取り出すことで、言語モデルに送信されるデータを削減しつつ、粗いサンプリングでは見逃してしまうような1秒未満のイベントも確実に捉えることができます。

固定サンプリングから自律的なビジョンへ

Geminiの従来のビデオ機能では、開発者が事前にサンプリングレートを選択する必要がありました。レートを高く設定するとトークン量が増えてコストが上がり、低く設定すると素早いカットを見逃すリスクがありました。現在、Gemini 3.7 Flash、3.6 Flash、および 3.5 Flash-Lite で利用可能な新しいエージェンティック・バリアントは、「思考・実行・観察(think-act-observe)」サイクルをAPIに直接組み込んでいます。まず、モデルがタスクについて推論します。次に、調査するセグメントを選択します。最後に、選択されたフレーム、音声クリップ、または文字起こしの抜粋を観察します。もしセグメントが有望であれば、モデルはその場でより細かい粒度で再サンプリングを行います。

このダイナミック・サンプリングにより、モデルは数百万ものトークンを消費することなく、数時間の映像(フルレングスの講義や数時間の録画など)を探索できます。実世界のビデオ質問応答(1H-VideoQA)や広範なビデオ理解タスク(LVBench)を模したベンチマークでは、精度を高めつつ、約10分の1のトークン予算で同じクエリを完了できることが示されています。

なぜトークン削減が重要なのか

トークン数はAPI料金に直結します。自動ビデオ編集ツールを構築する開発者の場合、90分のビデオを毎秒1フレームで処理すると、数千万トークンが発生し、コンテンツ1時間あたりのコストが数百ドルに達する可能性があります。88%の削減により、その金額は数十ドルまで下がり、これまで法外な料金に直面していたスタートアップや小規模なチームでも、大規模なビデオ解析が可能になります。

コスト面の利点は、実験のハードルも下げます。以前は、エンジニアが重要な瞬間を検出し、関連するクリップを抽出してモデルに再投入するためのカスタムコードを記述していました。Gemini APIにエージェンティック・ビジョンが組み込まれたことで、開発者はGoogle AI StudioまたはGemini Enterprise Agent Platformで処理設定を「agentic」に切り替えるだけで、この機能を利用できるようになります。Googleは標準のGeminiトークンレートを維持しており、よりスマートなサンプリングに対して追加の手数料はかかりません。

推測に頼らない精度

モデルがどこを見るかを決定するため、静的な1 FPSのサンプリングでは必然的に見逃してしまうような、1秒未満のイベントを特定できます。この精度は、ワークアウト動画での繰り返しの回数を数えたり、混雑したシーンでオブジェクトを追跡したり、セキュリティ映像で突然の異常を検知したりする際に重要となります。モデルが有望なウィンドウをフラグ立てすると、その部分のフレームレートを自動的に引き上げ、重要な箇所に対してのみ高忠実度なデータを提供します。

同じメカニズムが、「Ask YouTube」のような消費者向け機能にも活用されています。これは、ユーザーがビデオの再生中に視覚的な質問を投げかけると、実際の視覚コンテンツに基づいた回答を受け取れる機能です。モデルに送信するビデオの量を制限することで、この機能はより速く、より低コストで応答し、深さを損なうことなくユーザーエクスペリエンスを向上させています。

潜在的な制限とトレードオフ

エージェンティックなアプローチは万能薬ではありません。トークン使用量は劇的に減少しますが、モデルは内部ループを実行するため、事前にサンプリングされたフレームをそのまま処理する場合と比較してレイテンシ(遅延)が増加する可能性があります。リアルタイムアプリケーションに焦点を当てている開発者は、低いトークンコストと追加の処理時間のバランスを取る必要があるかもしれません。

予測可能性も懸念事項の一つです。モデルがどのセグメントをサンプリングするかを決定するため、特定のビデオに対する正確なトークン数は実行ごとに異なる可能性があります。厳格な予算管理を必要とするチームは、特に統合の初期段階において、トークン消費に関するモニタリングを構築する必要があるでしょう。

最後に、この展開はGeminiのFlashバリアントに限定されています。古いモデルやFlash以外のモデルに依存しているプロジェクトは、移行(これには追加の開発作業が伴う可能性があります)を行うまで、この恩恵を受けることはできません。

今後の注目点

  • 採用パターン: エージェンティック・モードを使用する開発者からの初期レポートにより、教育、エンターテインメント、監視、その他の分野において、コスト削減効果が維持されるかどうかが明らかになるでしょう。
  • 価格調整: 大規模なビデオ解析の需要が急増した場合、Googleはトークン価格を微調整したり、段階的な料金プランを追加したりする可能性があります。
  • 機能拡張: 同様の推論ループをより多くのコンシューマー向け製品に組み込むことで、新たなユースケースが浮き彫りになり、トークン効率の高いビデオAIへの認知が広がる可能性があります。
  • ベンチマークの進化: より多くのチームが実世界のデータセットでテストを行うにつれ、コミュニティは1H-VideoQAやLVBenchのスコアを洗練させていき、静的なサンプリングが依然としてエージェンティック・メソッドを上回るエッジケースが発見される可能性があります。

結論

Googleのエージェンティックなビデオ解析により、開発者はより詳細な時間的洞察を得ながら、トークン消費量を最大88%削減できます。トレードオフとして、処理の複雑さとトークン数の変動がわずかに増加しますが、多くの長尺ビデオ向けアプリケーションにおいては、コスト削減と統合の容易さがそれらの懸念を上回ります。ビデオ中心のAIを構築しているチームは、この新しいモードを迅速に評価すべきです。ビデオ理解をスケールさせる際の経済性が、今まさに変化した可能性があります。