ActiveVision 벤치마크에 따르면, 오늘날의 선도적인 멀티모달 거대 언어 모델(LLM)은 이미지를 두 번 이상 살펴봐야 하는 작업의 10.6%만을 해결했습니다. 17개의 반복적 인지(iterative-perception) 챌린지 테스트에서 인간은 96.1%의 성공률을 보인 반면, GPT-5.5는 10.6%, Claude Fable 5는 3.5%의 성공률을 기록했습니다. 11개의 작업에서는 모델들이 단 하나의 정답도 맞히지 못했습니다.
현재 비전 모델이 어려움을 겪는 이유
대부분의 비전 시스템은 이미지를 일회성 입력으로 취급합니다. "비전 인코더"가 특징(feature)을 한 번 추출하면, 이를 추론을 위해 언어 모델로 전달합니다. 이 파이프라인은 다시 살펴보거나, 특정 영역을 확대하거나, 가설을 재평가할 수 없습니다. 반면 인간은 처음에 추측을 하고, 초점을 옮기며, 새로운 증거를 수집하고, 답변을 조정합니다. 이 벤치마크는 이러한 루프를 공식화합니다. 즉, 각 작업은 모델이 관찰하고, 행동을 제안하고, 결과를 관찰한 뒤, 올바른 결론에 도달할 때까지 이 과정을 반복하도록 강제합니다.
벤치마크 테스트 내용
연구진은 반복적인 관찰이 필요한 17가지 시나리오를 구축했습니다. 결과는 극명합니다:
- 인간 참가자: 96.1% 성공
- GPT-5.5: 10.6% 성공
- Claude Fable 5: 3.5% 성공
- 11개 작업: 테스트된 모든 모델이 0점 기록
모델이 이미지를 재처리하기 위해 코드를 생성했을 때조차 자신의 출력에서 오류를 놓쳤으며, 이는 한계가 단순히 데이터 중심적인 것이 아니라 아키텍처적인 문제임을 확인시켜 줍니다.
개발자와 산업계에 미치는 영향
자율 로봇, 점검용 드론 또는 시간이 지남에 따라 시각 정보를 검증해야 하는 시스템을 구축하고 있다면, 싱글샷(single-shot) 비전 모델은 위험합니다. 이 벤치마크는 현재의 LLM 기반 비전 파이프라인이 피드백 기반 인지를 안정적으로 처리할 수 없음을 보여주며, 따라서 결함을 놓치거나, 품목 수를 잘못 세거나, 동적인 장면을 오해할 수 있음을 시사합니다. 더 많은 학습 데이터를 추가하거나 파라미터 규모를 키우는 것만으로는 이 격차를 줄일 수 없습니다. 부족한 요소는 제어 가능한 반복적 관찰 메커니즘입니다.
반론: 더 큰 모델이 도움이 될 수 있을까?
더 많은 학습 데이터를 추가하거나 파라미터 규모를 키우는 것만으로는 이 격차를 줄일 수 없습니다. 부족한 요소는 제어 가능한 반복적 관찰 메커니즘입니다.
향후 방향
연구진은 보완적인 방향을 제시합니다:
- 아키텍처 재설계 – 모델의 내부 상태에 따라 새로운 시야를 요청하거나, 영역을 크롭(crop)하거나, 조명 조건을 변경할 수 있는 제어 가능한 비전 모듈을 내장합니다.
핵심 요약: 현재의 멀티모달 LLM은 정적인 이미지 질문에 답하는 데는 뛰어나지만, 문제를 해결하기 위해 다시 살펴봐야 하는 경우에는 역부족입니다. 진정한 시각적 지능을 갖추려면 단순히 사진을 한 번 읽는 것이 아니라, 자신의 시각을 스스로 제어할 수 있는 모델이 필요할 것입니다.
