Google ha anunciado que su familia Gemini ahora admite un modo de análisis de video "agéntico" que puede reducir el uso de tokens hasta en un 88 % en pruebas de referencia estándar, un cambio que podría hacer que la IA de video de larga duración sea drásticamente más barata para los desarrolladores.

El nuevo modo reemplaza el antiguo enfoque fotograma a fotograma —normalmente una muestra fija de un fotograma por segundo— con un bucle impulsado por el modelo que decide qué partes de un video examinar, a qué velocidad y a través de qué modalidad (fotogramas, audio o transcripción). Al extraer únicamente las señales necesarias para una consulta específica, el sistema reduce los datos enviados al modelo de lenguaje y, al mismo tiempo, logra capturar eventos de menos de un segundo que una muestra gruesa pasaría por alto.

Del muestreo fijo a la visión autónoma

Las capacidades de video anteriores de Gemini obligaban a los desarrolladores a elegir una tasa de muestreo de antemano. Una tasa más alta significaba más tokens y facturas más elevadas; una tasa más baja corría el riesgo de perder cortes rápidos. La nueva variante agéntica, actualmente disponible para Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, integra un ciclo de "pensar-actuar-observar" directamente en la API. Primero, el modelo razona sobre la tarea. Luego, selecciona un segmento para inspeccionarlo. Finalmente, observa los fotogramas, clips de audio o fragmentos de transcripción elegidos. Si un segmento parece prometedor, el modelo lo vuelve a muestrear con una granularidad más fina sobre la marcha.

Este muestreo dinámico permite que el modelo recorra horas de metraje —piense en una conferencia completa o una grabación de varias horas— sin consumir millones de tokens. Las pruebas de referencia que imitan el cuestionamiento de video en el mundo real (1H-VideoQA) y tareas más amplias de comprensión de video (LVBench) muestran que las mismas consultas se completan con aproximadamente una décima parte del presupuesto de tokens, al tiempo que ofrecen una mayor precisión.

Por qué es importante el ahorro de tokens

El recuento de tokens se traduce directamente en las facturas de la API. Para un desarrollador que construye una herramienta de edición de video automatizada, un video de 90 minutos procesado a un fotograma por segundo podría generar decenas de millones de tokens, elevando los costos a cientos de dólares por hora de contenido. Una reducción del 88 % baja esa cifra a unas pocas decenas de dólares, abriendo el análisis de video a gran escala a startups y equipos más pequeños que antes se enfrentaban a facturas prohibitivas.

La ventaja de costos también reduce la barrera para la experimentación. Anteriormente, los ingenieros escribían código personalizado para detectar momentos clave, extraer clips relevantes y volver a introducirlos en el modelo. Con la visión agéntica integrada en la API de Gemini, los desarrolladores activan la función cambiando una configuración de procesamiento a “agentic” en Google AI Studio o en la Gemini Enterprise Agent Platform. Google mantiene la tarifa de tokens estándar de Gemini; no hay un recargo adicional por el muestreo más inteligente.

Precisión sin conjeturas

Debido a que el modelo decide dónde mirar, puede detectar eventos de menos de un segundo, algo que una muestra estática de 1 FPS inevitablemente pasaría por alto. Esta precisión es importante para contar repeticiones en un video de entrenamiento, rastrear un objeto a través de una escena concurrida o señalar anomalías repentinas en grabaciones de seguridad. Cuando el modelo marca una ventana prometedora, aumenta automáticamente la tasa de fotogramas para ese segmento, entregando datos de alta fidelidad solo donde es necesario.

El mismo mecanismo impulsa funciones orientadas al consumidor como “Ask YouTube”, donde los usuarios plantean preguntas visuales mientras se reproduce un video y reciben respuestas basadas en el contenido visual real. Al limitar la cantidad de video enviado al modelo, la función responde más rápido y a un menor costo, mejorando la experiencia del usuario sin sacrificar la profundidad.

Posibles límites y compensaciones

El enfoque agéntico no es una solución mágica. El uso de tokens disminuye drásticamente, pero el modelo sigue ejecutando su bucle interno, lo que puede añadir latencia en comparación con un pase directo sobre fotogramas pre-muestreados. Los desarrolladores centrados en aplicaciones en tiempo real pueden necesitar equilibrar los menores costos de tokens con el tiempo de procesamiento adicional.

La previsibilidad es otra preocupación. Debido a que el modelo decide qué segmentos muestrear, el recuento exacto de tokens para un video determinado puede variar de una ejecución a otra. Los equipos que requieren un presupuesto estricto pueden necesitar implementar un monitoreo del consumo de tokens, especialmente durante las primeras etapas de integración.

Por último, el despliegue se limita a las variantes Flash de Gemini. Los proyectos que dependen de modelos más antiguos o que no son Flash no se beneficiarán hasta que migren, lo que podría implicar un esfuerzo de desarrollo adicional.

Qué observar a continuación

  • Patrones de adopción: Los primeros informes de los desarrolladores que utilicen el modo agéntico revelarán si los ahorros de costos se mantienen en los dominios de la educación, el entretenimiento, la vigilancia y otros sectores.
  • Ajustes de precios: Google podría ajustar el precio de los tokens o añadir planes por niveles si la demanda de análisis de video de alto volumen se dispara.
  • Extensiones de funciones: Integrar el mismo bucle de razonamiento en más productos de consumo podría dar lugar a nuevos casos de uso y fomentar un mayor conocimiento de la IA de video eficiente en tokens.
  • Evolución de los benchmarks: A medida que más equipos realicen pruebas con conjuntos de datos del mundo real, la comunidad refinará las puntuaciones de 1H-VideoQA y LVBench, lo que podría revelar casos límite en los que el muestreo estático sigue superando al método agéntico.

En resumen

El análisis de video agéntico de Google permite a los desarrolladores reducir el consumo de tokens hasta en un 88 %, al tiempo que obtienen una visión temporal más detallada. La contrapartida es un ligero aumento en la complejidad del procesamiento y en el recuento variable de tokens, pero para muchas aplicaciones de video de larga duración, el ahorro de costos y la facilidad de integración compensan esas preocupaciones. Los equipos que desarrollan IA centrada en video deberían evaluar el nuevo modo rápidamente; la economía de escalar la comprensión de video podría haber cambiado.