Der ActiveVision-Benchmark zeigt, dass die heutigen führenden multimodalen Large Language Models (LLMs) nur 10,6 % der Aufgaben lösen konnten, die ein mehrfaches Betrachten eines Bildes erfordern. In einem Test mit 17 Herausforderungen zur iterativen Wahrnehmung gelang es Menschen in 96,1 % der Fälle, während GPT-5.5 10,6 % und Claude Fable 5 3,5 % erreichten; bei elf der Aufgaben lieferten die Modelle keinerlei korrekte Antworten.

Warum aktuelle Vision-Modelle scheitern

Die meisten Vision-Systeme behandeln ein Bild als einmalige Eingabe. Ein „Vision Encoder“ extrahiert einmalig Merkmale und übergibt diese dann dem Sprachmodell zur Argumentation. Die Pipeline kann keinen zweiten Blick anfordern, in einen Bereich hineinzoomen oder eine Hypothese neu bewerten. Menschen hingegen stellen eine erste Vermutung an, verlagern den Fokus, sammeln neue Erkenntnisse und passen ihre Antwort an. Der Benchmark formalisiert diese Schleife: Jede Aufgabe zwingt das Modell dazu, zu beobachten, eine Aktion vorzuschlagen, das Ergebnis zu beobachten und den Vorgang zu wiederholen, bis es zu einem korrekten Schluss kommt.

Was der Benchmark getestet hat

Forscher entwickelten 17 Szenarien, die wiederholte Beobachtungen erfordern. Die Ergebnisse sind eindeutig:

  • Menschliche Teilnehmer: 96,1 % Erfolg
  • GPT-5.5: 10,6 % Erfolg
  • Claude Fable 5: 3,5 % Erfolg
  • Elf Aufgaben: Jedes getestete Modell erzielte null Punkte

Selbst wenn die Modelle Code generierten, um das Bild erneut zu verarbeiten, übersahen sie Fehler in ihrer eigenen Ausgabe, was bestätigt, dass die Einschränkung architektonischer und nicht rein datengetriebener Natur ist.

Bedeutung für Entwickler und die Industrie

Wenn Sie autonome Roboter, Inspektionsdrohnen oder Systeme entwickeln, die visuelle Informationen über einen Zeitraum hinweg verifizieren müssen, ist ein Single-Shot-Vision-Modell riskant. Der Benchmark zeigt, dass aktuelle LLM-basierte Vision-Pipelines keine zuverlässige feedbackgesteuerte Wahrnehmung leisten können; sie werden daher Defekte übersehen, Gegenstände falsch zählen oder dynamische Szenen falsch interpretieren. Das Hinzufügen von mehr Trainingsdaten oder die Skalierung von Parametern wird diese Lücke nicht schließen; die fehlende Zutat ist ein Mechanismus für eine kontrollierte, iterative Beobachtung.

Gegenargument: Können größere Modelle helfen?

Das Hinzufügen von mehr Trainingsdaten oder die Skalierung von Parametern wird diese Lücke nicht schließen; die fehlende Zutat ist ein Mechanismus für eine kontrollierte, iterative Beobachtung.

Zukünftige Wege

Forscher schlagen eine ergänzende Richtung vor:

  • Architektonisches Redesign – Einbettung eines steuerbaren visuellen Moduls, das basierend auf dem internen Zustand des Modells neue Ansichten anfordern, Bildausschnitte zuschneiden oder die Lichtverhältnisse ändern kann.

Fazit: Aktuelle multimodale LLMs sind hervorragend darin, Fragen zu statischen Bildern zu beantworten, stoßen aber an ihre Grenzen, wenn ein Problem ein erneutes Hinsehen erfordert. Wahre visuelle Intelligenz wird Modelle benötigen, die ihre eigene Sicht steuern können, anstatt ein Bild nur einmal zu lesen.