Le benchmark ActiveVision montre que les principaux modèles de langage multimodaux (LLM) actuels n'ont résolu que 10,6 % des tâches nécessitant d'examiner une image plus d'une fois. Lors d'un test portant sur 17 défis de perception itérative, les humains ont réussi dans 96,1 % des cas, tandis que GPT-5.5 a atteint 10,6 % et Claude Fable 5 a atteint 3,5 % ; onze des tâches n'ont reçu aucune réponse correcte de la part des modèles.
Pourquoi les modèles de vision actuels trébuchent
La plupart des systèmes de vision traitent une image comme une entrée unique. Un « encodeur de vision » extrait les caractéristiques une seule fois, puis les transmet au modèle de langage pour le raisonnement. Le pipeline ne peut pas demander un second regard, zoomer sur une région ou réévaluer une hypothèse. Les humains, en revanche, font une supposition initiale, déplacent leur attention, recueillent de nouvelles preuves et ajustent leur réponse. Le benchmark formalise cette boucle : chaque tâche force un modèle à observer, proposer une action, observer le résultat et répéter l'opération jusqu'à parvenir à une conclusion correcte.
Ce que le benchmark a testé
Les chercheurs ont conçu 17 scénarios nécessitant une observation répétée. Les résultats sont frappants :
- Participants humains : 96,1 % de réussite
- GPT-5.5 : 10,6 % de réussite
- Claude Fable 5 : 3,5 % de réussite
- Onze tâches : chaque modèle testé a obtenu un score de zéro
Même lorsque les modèles généraient du code pour retraiter l'image, ils ne détectaient pas les erreurs dans leur propre production, confirmant que la limitation est d'ordre architectural plutôt que purement liée aux données.
Enjeux pour les développeurs et l'industrie
Si vous construisez des robots autonomes, des drones d'inspection ou tout système devant vérifier des informations visuelles au fil du temps, un modèle de vision à essai unique est risqué. Le benchmark montre que les pipelines de vision actuels basés sur les LLM ne peuvent pas gérer de manière fiable une perception pilotée par le feedback ; ils risquent donc de manquer des défauts, de mal compter des objets ou de mal interpréter des scènes dynamiques. Ajouter davantage de données d'entraînement ou augmenter le nombre de paramètres ne comblera pas l'écart ; l'élément manquant est un mécanisme d'observation contrôlée et itérative.
Contre-argument : des modèles plus grands peuvent-ils aider ?
Ajouter davantage de données d'entraînement ou augmenter le nombre de paramètres ne comblera pas l'écart ; l'élément manquant est un mécanisme d'observation contrôlée et itérative.
Pistes de solutions
Les chercheurs suggèrent une direction complémentaire :
- Refonte architecturale – intégrer un module visuel contrôlable capable de demander de nouvelles vues, de recadrer des régions ou de modifier les conditions d'éclairage en fonction de l'état interne du modèle.
À retenir : Les LLM multimodaux actuels excellent pour répondre à des questions sur des images statiques, mais sont insuffisants lorsqu'un problème nécessite d'examiner à nouveau l'image. La véritable intelligence visuelle nécessitera des modèles capables de contrôler leur propre vision, et non de simplement lire une image une seule fois.
