Los modelos de visión y lenguaje (VLMs) todavía no logran cumplir con las tareas visuales elementales. Una nueva evaluación de PerceptionBench reveló que ninguno de los dieciséis sistemas líderes supera el 60 % de precisión general, e incluso el más fuerte se mantiene por debajo del 80 % en cualquier habilidad individual. El resultado advierte a los desarrolladores que las puntuaciones altas en pruebas populares de descripción o razonamiento no garantizan una visión fiable.
Por qué las pruebas existentes ocultan el problema
La mayoría de los benchmarks públicos mezclan la descripción de imágenes, la respuesta a preguntas y el razonamiento de sentido común. Cuando un modelo genera una descripción incorrecta, el error podría ser un desliz lingüístico, un error de razonamiento o un simple fallo al reconocer el objeto. Debido a que los tres componentes están entrelazados, una puntuación baja no ofrece pistas sobre la deficiencia visual. Por lo tanto, los equipos que desarrollan aplicaciones obtienen una confianza inflada de las cifras principales, asumiendo que el modelo "ve" correctamente.
Qué hace diferente PerceptionBench
PerceptionBench aísla diez capacidades visuales y evalúa cada modelo en un conjunto de tareas de visión pura. Al eliminar el lenguaje y el razonamiento, el benchmark muestra qué tan bien funciona el front-end visual por sí solo. En general, los dieciséis mejores VLMs no alcanzan el umbral de precisión del 60 %, y el sistema con mejor rendimiento nunca llega al 80 % en ninguna habilidad individual. La alucinación —producir detalles que no están en la imagen— es el error más común, mientras que el patrón de fortalezas y debilidades varía ampliamente entre los modelos.
Quiénes podrían salir perjudicados
Los desarrolladores no deberían reemplazar los clasificadores visuales dedicados con modelos de IA generales.
Dónde flaquea el argumento
Los datos de PerceptionBench muestran rendimientos decrecientes: incluso los modelos más grandes todavía tropiezan con tareas de percepción básicas.
Pasos prácticos para desarrolladores
- Mantener clasificadores visuales dedicados para tareas que exijan precisión; tratar a los VLMs como complementos en lugar de reemplazos.
- Añadir una capa de verificación que coteje los resultados del modelo con un detector de confianza antes de que lleguen al usuario.
- Implementar un filtro de visión ligero para detectar alucinaciones u errores de clasificación obvios en las primeras etapas del pipeline.
Combinar un VLM de propósito general con un componente de visión diseñado específicamente permite a los equipos utilizar las capacidades de razonamiento del primero mientras se protegen contra sus puntos ciegos visuales.
Fuente: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
