AI 연구자들은 약 150개의 트래픽이 낮은 뉴스 사이트 네트워크가 대규모 언어 모델(LLM) 학습 데이터에 친크렘린(pro-Kremlin) 서사를 유포하려는 조직적인 움직임을 포착했습니다. 'Pravda 네트워크'로 알려진 이 사이트들은 연간 약 300만 개의 기사를 쏟아내고 있으며, 이들의 콘텐츠는 현재 많은 상용 AI 시스템의 기반이 되는 Common Crawl 데이터셋에 포함되어 있는 것으로 나타났습니다.
허위 정보 파이프라인의 작동 방식
Pravda 네트워크는 인간 독자를 끌어모으는 것을 목표로 하지 않습니다. 대신, 각 사이트는 좁은 범위의 논점을 반복하는 유사한 기사를 게시합니다. 검색 엔진과 웹 크롤러가 우선시하는 키워드를 텍스트에 채워 넣음으로써, 데이터 수집 과정에서 AI 모델이 해당 콘텐츠를 접할 확률을 높입니다.
두 가지 오염 메커니즘이 작용하고 있습니다:
- 검색 시점 오염(Retrieval-time poisoning) – AI 어시스턴트가 웹에서 실시간 정보를 가져올 때, 합법적인 출처와 함께 Pravda 기사가 노출될 수 있습니다. 알려진 악성 도메인을 차단하면 이러한 노출을 억제할 수 있습니다.
- 학습 시점 오염(Training-time poisoning) – 만약 해당 기사들이 모델의 사전 학습에 사용되는 대규모 코퍼스(corpora)에 포함된다면, 허위 주장은 모델의 내부 지식의 일부가 됩니다. 사후에 이러한 콘텐츠를 제거하는 것은 훨씬 더 어렵습니다.
연구자들은 이미 많은 AI 모델 학습에 사용되는 공개 아카이브인 Common Crawl 내에서 Pravda 기사들을 추적해냈습니다. 이는 오염이 가설에 그치는 것이 아니라, 이미 오늘날 많은 사용자가 의존하는 모델들의 지식 기반을 변화시켰음을 의미합니다.
이것이 중요한 이유
AI가 "많은 출처가 동의한다"라고 말한다고 해서 무조건 신뢰하지 마십시오. AI 도구를 구축한다면, 알려진 허위 정보 사이트에 대한 차단 목록(blocklists)을 사용하십시오. "언급 횟수"를 진실을 측정하는 척도로 사용하지 마십시오. 양이 곧 질은 아닙니다. AI가 말하는 모든 내용, 특히 편향된 것처럼 보이는 내용은 반드시 검증하십시오.
인터넷은 우리 미래 기술의 학습 세트입니다. 웹사이트를 가진 사람이라면 누구나 우리가 의존하는 기계를 편향되게 만들려고 시도할 수 있습니다.
개발자가 지금 할 수 있는 일
- 차단 목록 유지(Maintain blocklists) – 알려진 허위 정보 도메인을 크롤링 필터에 추가하십시오. 차단 목록은 검색 시점과 학습 시점의 노출을 모두 방지합니다.
- 빈도 휴리스틱 재고(Rethink frequency heuristics) – 언급 횟수를 진실성과 동일시하는 것을 멈추십시오. 단순한 빈도 기반 모델에서는 수십 개의 저품질 사이트에서 반복되는 주장이 단 하나의 신뢰할 수 있는 출처보다 더 큰 비중을 차지할 수 있습니다.
- 출처 검증 적용(Apply provenance checks) – 정보를 원래의 출처까지 추적하십시오. 정보의 흐름이 트래픽이 거의 없고 선전 활동 이력이 있는 사이트에서 끝난다면, 해당 출력을 검토 대상으로 표시하십시오.
- 학습 후 정화 구현(Implement post-training sanitization) – 정치적으로 민감한 주제를 다루는 모델 출력물에 대해 선별된 감사를 실시하십시오. 인간 검토자는 자동화된 필터가 놓치는 체계적인 편향을 잡아낼 수 있습니다.
반론 및 과제
보안과 포용성 사이의 균형을 맞추는 것은 여전히 해결해야 할 과제로 남아 있습니다.
향후 전망
Pravda 네트워크는 국가 행위자들이 차세대 AI를 형성하기 위해 개방형 웹을 어떻게 무기화할 수 있는지를 보여줍니다.
핵심 요약: AI의 무결성은 학습하는 데이터의 깨끗함에 달려 있습니다. 트래픽이 낮고 선전 내용이 가득한 사이트들의 조직적인 유포는 우리가 신뢰하는 모델에 이미 거짓을 심어놓을 수 있습니다. 개발자는 우리가 만드는 기계가 의도치 않게 허위 정보의 대변인이 되지 않도록, 출처의 신뢰성을 사후 고려 사항이 아닌 최우선 과제로 다루어야 합니다.
