El benchmark ActiveVision muestra que los modelos de lenguaje de gran tamaño (LLM) multimodales líderes en la actualidad resolvieron el 10,6 % de las tareas que requieren observar una imagen más de una vez. En una prueba de 17 desafíos de percepción iterativa, los humanos tuvieron éxito el 96,1 % de las veces, mientras que GPT-5.5 logró un 10,6 % y Claude Fable 5 un 3,5 %; once de las tareas no obtuvieron ninguna respuesta correcta por parte de los modelos.
Por qué los modelos de visión actuales fallan
La mayoría de los sistemas de visión tratan una imagen como una entrada única. Un “vision encoder” extrae características una sola vez y luego las entrega al modelo de lenguaje para su razonamiento. El pipeline no puede pedir una segunda mirada, hacer zoom en una región o reevaluar una hipótesis. Los humanos, por el contrario, hacen una suposición inicial, cambian el enfoque, recopilan nueva evidencia y ajustan su respuesta. El benchmark formaliza ese bucle: cada tarea obliga al modelo a observar, proponer una acción, observar el resultado y repetir el proceso hasta llegar a una conclusión correcta.
Qué evaluó el benchmark
Los investigadores crearon 17 escenarios que requieren una observación repetida. Los resultados son contundentes:
- Participantes humanos: 96,1 % de éxito
- GPT-5.5: 10,6 % de éxito
- Claude Fable 5: 3,5 % de éxito
- Once tareas: todos los modelos probados obtuvieron cero
Incluso cuando los modelos generaron código para reprocesar la imagen, pasaron por alto errores en su propio resultado, lo que confirma que la limitación es arquitectónica en lugar de ser puramente impulsada por los datos.
Riesgos para desarrolladores e industria
Si está construyendo robots autónomos, drones de inspección o cualquier sistema que deba verificar información visual a lo largo del tiempo, un modelo de visión de un solo paso (single-shot) es arriesgado. El benchmark muestra que los flujos de trabajo de visión basados en LLM actuales no pueden manejar de manera confiable la percepción impulsada por la retroalimentación, por lo que omitirán defectos, contarán mal los elementos o interpretarán erróneamente escenas dinámicas. Añadir más datos de entrenamiento o aumentar los parámetros no cerrará la brecha; el ingrediente que falta es un mecanismo de observación controlada e iterativa.
Contraargumento: ¿pueden ayudar los modelos más grandes?
Añadir más datos de entrenamiento o aumentar los parámetros no cerrará la brecha; el ingrediente que falta es un mecanismo de observación controlada e iterativa.
Caminos a seguir
Los investigadores sugieren una dirección complementaria:
- Rediseño arquitectónico – integrar un módulo visual controlable que pueda solicitar nuevas vistas, recortar regiones o alterar las condiciones de iluminación basándose en el estado interno del modelo.
Conclusión: Los LLM multimodales actuales sobresalen al responder preguntas sobre imágenes estáticas, pero se quedan cortos cuando un problema requiere volver a mirar. La verdadera inteligencia visual necesitará modelos que puedan controlar su propia visión, no solo leer una imagen una vez.
