AI 검색 엔진은 죽은 링크나 저품질 출처를 인용하면서도 확신에 찬 어조를 보일 수 있다는 사실이 간단한 테스트를 통해 밝혀졌다

인기 있는 세 가지 AI 기반 검색 도구를 대상으로 간단한 출처(provenance) 확인을 실시한 결과, 세 도구 모두 동일하게 확신에 찬 문체와 일련의 출처 '칩(chips)'을 표시했음에도 불구하고, 그중 두 곳은 연결되지 않는 링크를 가리키거나 신뢰도가 낮은 사이트를 근거로 답변을 제시하는 것으로 나타났다.

놀라움을 자아낸 테스트

나는 최근의 사실 관계를 묻는 질문을 던졌다: “2026년 EU AI 법(EU AI Act)에서 무엇이 바뀌었나?” 이 질문에 대한 답은 공식 개정안 텍스트에 존재하므로, 답이 있거나 없거나 둘 중 하나다. 나는 인용구를 표시해 주는 세 가지 AI 검색 엔진인 Perplexity, Google의 AI 모드, Brave Search에 이 질문을 입력했다.

세 엔진 모두 동일한 날짜와 설명을 포함한 똑같은 사실을 반환했으므로, 순수한 정확도 측면에서는 동률이었다. 차이점은 인용된 출처를 조사했을 때 비로소 나타났다.

출처 품질을 판단한 방법

나는 호스트 유형에 따라 각 인용구에 가중치를 부여하는 3단계 점수 체계를 만들었다:

  • 1차 출처 (가중치 3) – 법률을 실제로 공표하는 사이트 (예: 공식 EU 관보).
  • 공식 출처 (가중치 2) – 법률을 발행하거나 감독하는 기관 (정부 도메인, 기관 사이트).
  • 사용자 생성 콘텐츠 (UGC, 가중치 0) – YouTube 또는 Reddit과 같은 플랫폼.

각 엔진의 종합 점수는 표시된 URL의 평균 가중치이다.

엔진 보고된 출처 점수
Perplexity 공식 정부 도메인 2.00
Google AI mode 컨설팅 회사 및 YouTube 영상 1.00
Brave Search 1차 출처 3.00

서류상으로는 Brave가 완벽해 보였고, Perplexity는 괜찮았으며, Google은 뒤처졌다.

숨겨진 실패: 죽은 링크

단계별 분류는 도메인 이름만 확인할 뿐, 연결된 페이지가 실제로 로드되는지는 검증하지 않는다. 나는 모든 URL을 직접 확인했다. Brave의 '1차 출처' 인용구는 빈 본문만 반환했다. 즉, 링크가 죽어 있었다. 엔진은 법률을 가리킨다고 주장했지만 아무것도 보여주지 못했다.

Perplexity는 공식 정부 도메인을 사용했다.

Google은 컨설팅 회사와 YouTube 영상을 사용했다.

두 가지 뚜렷한 문제가 드러났다:

  1. 고품질 도메인이라고 해서 페이지 접속이 보장되는 것은 아니다.
  2. 잘 작성된 요약문이라도 신뢰도가 낮은 출처를 근거로 할 수 있다.

사용자 인터페이스(UI)는 이 두 가지 문제를 모두 숨긴다. 세 도구 모두 동일하게 확신에 찬 문단과 일관된 형태의 출처 칩을 제시하며, 특정 칩이 죽은 페이지로 연결되거나 법률 조문이 아닌 YouTube 튜토리얼을 가리키고 있다는 시각적 신호를 전혀 주지 않는다.

개발자에게 출처(provenance)가 중요한 이유

개발자는 출처를 테스트 가능한 지표로 전환할 수 있다:

  • 모든 답변에 점수 매기기: 위에서 사용한 것과 유사한 단계별 가중치를 사용하여 점수를 산출한다.
  • 링크 상태 자동 검증: 빈 응답이나 HTTP 오류를 플래그(flag)로 표시한다.
  • 알림 트리거: 답변의 출처 점수가 설정된 임계값 아래로 떨어지면 알림을 보낸다.

이 접근 방식은 막연히 '환각(hallucinations)' 현상을 쫓는 것보다 더 구체적이다. 모델은 그럴듯한 문장을 생성할 수 있지만, 출처 확인을 통해 어떤 인용구(또는 인용의 부재)가 문제를 일으켰는지 정확히 파악하여 타겟팅된 수정을 할 수 있기 때문이다.

시사점

간단한 출처 테스트 결과, AI 검색 엔진은 죽은 링크나 저품질 출처를 인용하면서도 권위 있는 것처럼 보일 수 있음이 드러났다. 이러한 엔진에 의존하는 개발자는 인용 품질을 당연한 보장이 아닌 측정 가능한 속성으로 취급해야 하며, 파이프라인에 자동화된 검증 절차를 구축해야 한다. '1차 출처'가 실제로 로드되는지 확인하는 작업은 신뢰할 수 있는 답변과 소리 없는 오정보의 함정을 가르는 차이가 될 수 있다.