Google a annoncé que sa famille Gemini prend désormais en charge un mode d'analyse vidéo « agentique » capable de réduire la consommation de tokens jusqu'à 88 % sur les benchmarks standards, un changement qui pourrait rendre l'IA vidéo longue durée considérablement moins coûteuse pour les développeurs.

Ce nouveau mode remplace l'ancienne approche image par image — généralement un échantillonnage fixe d'une image par seconde — par une boucle pilotée par le modèle qui décide quelles parties d'une vidéo examiner, à quelle vitesse et via quelle modalité (images, audio ou transcription). En ne récupérant que les signaux nécessaires à une requête spécifique, le système réduit les données envoyées au modèle de langage tout en capturant des événements de moins d'une seconde qu'un échantillonnage grossier aurait manqués.

De l'échantillonnage fixe à la vision autonome

Les capacités vidéo antérieures de Gemini obligeaient les développeurs à choisir un taux d'échantillonnage au préalable. Un taux plus élevé signifiait plus de tokens et des factures plus salées ; un taux plus faible risquait de manquer des coupes rapides. La nouvelle variante agentique, actuellement disponible pour Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite, intègre un cycle « réfléchir-agir-observer » directement dans l'API. D'abord, le modèle raisonne sur la tâche. Ensuite, il sélectionne un segment à inspecter. Enfin, il observe les images, les clips audio ou les extraits de transcription choisis. Si un segment semble prometteur, le modèle le rééchantillonne à une granularité plus fine à la volée.

Cet échantillonnage dynamique permet au modèle de parcourir des heures de séquences — comme une conférence complète ou un enregistrement de plusieurs heures — sans consommer des millions de tokens. Les benchmarks qui simulent les questions-réponses vidéo en conditions réelles (1H-VideoQA) et des tâches de compréhension vidéo plus larges (LVBench) montrent que les mêmes requêtes peuvent être traitées avec environ un dixième du budget de tokens tout en offrant une précision accrue.

Pourquoi l'économie de tokens est cruciale

Le nombre de tokens se traduit directement par la facturation de l'API. Pour un développeur créant un outil de montage vidéo automatisé, une vidéo de 90 minutes traitée à une image par seconde pourrait générer des dizaines de millions de tokens, portant les coûts à plusieurs centaines de dollars par heure de contenu. Une réduction de 88 % fait tomber ce chiffre à quelques dizaines de dollars, ouvrant l'analyse vidéo à grande échelle aux startups et aux équipes plus modestes qui faisaient auparavant face à des factures prohibitives.

L'avantage économique abaisse également la barrière à l'expérimentation. Auparavant, les ingénieurs devaient écrire du code personnalisé pour détecter les moments clés, extraire les clips pertinents et les renvoyer au modèle. Avec la vision agentique intégrée à l'API Gemini, les développeurs activent la fonctionnalité en basculant une configuration de traitement sur « agentic » dans Google AI Studio ou la Gemini Enterprise Agent Platform. Google conserve le tarif de tokens standard de Gemini ; il n'y a pas de surcoût pour cet échantillonnage plus intelligent.

La précision sans l'approximation

Comme le modèle décide où regarder, il peut repérer des événements de moins d'une seconde — ce qu'un échantillonnage statique de 1 FPS manquerait inévitablement. Cette précision est essentielle pour compter les répétitions dans une vidéo de fitness, suivre un objet dans une scène bondée ou signaler des anomalies soudaines dans des images de vidéosurveillance. Lorsque le modèle identifie une séquence prometteuse, il augmente automatiquement la fréquence d'images pour cette portion, fournissant des données de haute fidélité uniquement là où c'est nécessaire.

Ce même mécanisme alimente des fonctionnalités destinées au grand public telles que « Ask YouTube », où les utilisateurs posent des questions visuelles pendant la lecture d'une vidéo et reçoivent des réponses basées sur le contenu visuel réel. En limitant la quantité de vidéo envoyée au modèle, la fonctionnalité répond plus rapidement et à moindre coût, améliorant l'expérience utilisateur sans sacrifier la profondeur d'analyse.

Limites potentielles et compromis

L'approche agentique n'est pas une solution miracle. Si l'utilisation de tokens chute de manière spectaculaire, le modèle exécute toujours sa boucle interne, ce qui peut ajouter de la latence par rapport à un passage direct sur des images pré-échantillonnées. Les développeurs se concentrant sur des applications en temps réel devront peut-être équilibrer la réduction des coûts de tokens avec le temps de traitement supplémentaire.

La prévisibilité est une autre préoccupation. Comme le modèle décide quels segments échantillonner, le nombre exact de tokens pour une vidéo donnée peut varier d'une exécution à l'autre. Les équipes ayant besoin d'un budget strict devront peut-être mettre en place un suivi de la consommation de tokens, surtout lors des premières phases d'intégration.

Enfin, le déploiement est limité aux variantes Flash de Gemini. Les projets s'appuyant sur des modèles plus anciens ou non-Flash n'en bénéficieront pas avant d'avoir migré, ce qui pourrait nécessiter des efforts de développement supplémentaires.

À surveiller ensuite

  • Tendances d'adoption : Les premiers rapports des développeurs utilisant le mode agentique révéleront si les économies de coûts se maintiennent dans l'éducation, le divertissement, la surveillance et d'autres domaines.
  • Ajustements tarifaires : Google pourrait ajuster le prix des tokens ou ajouter des forfaits par paliers si la demande pour l'analyse vidéo à haut volume augmente brusquement.
  • Extensions de fonctionnalités : L'intégration de cette même boucle de raisonnement dans davantage de produits grand public pourrait faire émerger de nouveaux cas d'utilisation et accroître la notoriété de l'IA vidéo économe en tokens.
  • Évolution des benchmarks : À mesure que davantage d'équipes testeront sur des jeux de données réels, la communauté affinera les scores 1H-VideoQA et LVBench, révélant potentiellement des cas limites où l'échantillonnage statique surpasse encore la méthode agentique.

L'essentiel

L'analyse vidéo agentique de Google permet aux développeurs de réduire la consommation de tokens jusqu'à 88 % tout en obtenant une analyse temporelle plus fine. Le compromis réside dans une légère augmentation de la complexité de traitement et de la variabilité du nombre de tokens, mais pour de nombreuses applications vidéo de longue durée, les économies de coûts et la facilité d'intégration l'emportent sur ces préoccupations. Les équipes développant des IA centrées sur la vidéo devraient évaluer rapidement ce nouveau mode ; l'économie du passage à l'échelle de la compréhension vidéo pourrait bien avoir changé.