시각-언어 모델(VLM)은 여전히 기초적인 시각 작업에서 한계를 보이고 있습니다. 새로운 PerceptionBench 평가 결과에 따르면, 16개의 주요 시스템 중 전체 정확도가 60%를 넘는 모델은 없었으며, 가장 강력한 모델조차 개별 기술에서 80% 미만의 정확도를 기록했습니다. 이 결과는 인기 있는 캡셔닝(captioning)이나 추론 테스트에서 높은 점수를 받는다고 해서 신뢰할 수 있는 시각 능력이 보장되는 것은 아니라는 점을 개발자들에게 경고합니다.

기존 테스트가 문제를 숨기는 이유

대부분의 공개 벤치마크는 이미지 설명, 질의응답, 상식 추론을 혼합하여 측정합니다. 모델이 잘못된 캡션을 생성할 때, 그 실수는 언어적 실수일 수도 있고, 추론 오류일 수도 있으며, 단순히 객체를 인식하지 못한 것일 수도 있습니다. 이 세 가지 요소가 뒤엉켜 있기 때문에, 낮은 점수가 나왔을 때 그것이 시각적 결함 때문인지 알 수 없습니다. 따라서 애플리케이션을 구축하는 팀들은 모델이 올바르게 "보고" 있다고 가정하며, 헤드라인 수치만 보고 과도한 자신감을 갖게 됩니다.

PerceptionBench가 차별화되는 점

PerceptionBench는 10가지 시각적 능력을 분리하여 각 모델을 순수 시각 작업 세트로 평가합니다. 언어와 추론 요소를 제거함으로써, 이 벤치마크는 시각적 프런트엔드가 단독으로 얼마나 잘 작동하는지를 보여줍니다. 전반적으로 16개의 상위 VLM 모두 60% 정확도 임계값에 미치지 못했으며, 가장 성능이 좋은 시스템도 단일 기술에서 80%에 도달하지 못했습니다. 이미지에 없는 세부 사항을 만들어내는 환각(Hallucination) 현상이 가장 흔한 오류였으며, 강점과 약점의 패턴은 모델마다 크게 달랐습니다.

누가 손해를 보는가

개발자는 전용 시각 분류기(visual classifier)를 범용 AI 모델로 대체해서는 안 됩니다.

논거의 한계

PerceptionBench 데이터는 수확 체감(diminishing returns)을 보여줍니다. 가장 거대한 모델조차 여전히 기초적인 지각 작업에서 실수를 범합니다.

개발자를 위한 실질적인 단계

  • 전용 시각 분류기를 유지하십시오. 정밀도가 요구되는 작업에는 전용 분류기를 사용하고, VLM은 대체재가 아닌 보완재로 취급해야 합니다.
  • 검증 레이어를 추가하십시오. 모델의 출력이 사용자에게 전달되기 전에 신뢰할 수 있는 탐지기(detector)를 통해 교차 확인하십시오.
  • 경량 시각 필터를 배포하십시오. 파이프라인 초기 단계에서 명백한 환각이나 오분류를 잡아낼 수 있도록 합니다.

범용 VLM을 특정 목적에 맞게 제작된 시각 구성 요소와 결합하면, 모델의 추론 능력은 활용하면서 시각적 사각지대로 인한 위험은 방지할 수 있습니다.

출처: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1