2026년 분석에 따르면, 상위 107개 웹사이트 중 44.9%가 최소 하나 이상의 AI 크롤러를 차단하고 있습니다. 이는 단순히 트래픽 손실의 문제가 아닙니다. 오늘날 사용자들이 정보를 얻는 새로운 채널에서 브랜드가 사라질 수도 있는 잠재적 위험을 의미합니다.
문제의 범위
Robots.txt는 Googlebot 및 기타 전통적인 검색 크롤러에게 어떤 페이지를 인덱싱할지 알려주는 표준 파일이었습니다. 이제 이와 유사한 파일이 AI 크롤러를 제어합니다. AI 크롤러란 ChatGPT, Claude, Perplexity와 같은 도구에 답변을 생성하기 위해 웹 콘텐츠를 읽는 소프트웨어 에이전트를 말합니다. 연구 결과, 조사 대상 사이트의 44.9%가 이러한 봇 중 최소 하나를 의도적으로 차단한 것으로 나타났습니다. OpenAI 모델이 사용하는 크롤러인 GPTBot이 차단된 에이전트 목록의 최상위를 차지했습니다.
놀랍게도, Cloudflare와 같은 서비스의 '원클릭 설정'으로 인해 발생하는 차단 비중이 상당합니다. 사이트 소유자가 보안을 강화하려다 의도치 않게 AI의 접근을 거부하게 되는 경우입니다.
“AI 크롤링 가능성(AI crawlability)”의 진정한 의미
크롤링 가능성이란 봇이 페이지를 가져올 수 있는 능력을 말합니다. AI의 경우, 크롤링 가능성은 사용자가 질문을 던졌을 때 모델이 브랜드, 제품 또는 서비스에 관한 최신 정보를 가져올 수 있는지 여부를 결정합니다. 사이트가 크롤링 가능하지 않으면 AI는 인용할 출처를 찾을 수 없으며, 결과적으로 브랜드는 답변 피드에서 사라지게 됩니다.
기존의 SEO 전략은 Googlebot이 페이지를 크롤링하여 링크 목록의 순위에 오르게 하는 데 집중했습니다. 하지만 AI 크롤링 가능성은 목표를 바꿉니다. 순위 경쟁 대신, 대화형 답변 내에서 '추천'되는 것이 결과물이 됩니다.
학습용 봇(Training bots) vs. 답변용 봇(Answer bots)
모든 AI 크롤러가 동일한 목적을 가진 것은 아닙니다.
- 학습용 봇(Training bots) – GPTBot, ClaudeBot, Google-Extended 등이 예시입니다. 이들은 거대 언어 모델의 기반이 되는 방대한 데이터셋을 구축하기 위해 웹의 넓은 영역을 스크랩합니다. 사이트 소유자는 독점 콘텐츠가 향후 모델 학습에 사용되는 것을 막고 싶다면 이들을 차단할 수 있습니다.
- 답변용 봇(Answer bots) – OAI-SearchBot, Claude-SearchBot, PerplexityBot 등이 예시입니다. 이들은 실시간으로 작동하며 사용자의 질의에 답하기 위해 특정 스니펫(snippet)을 가져옵니다. 답변용 봇을 차단하면, 해당 페이지가 기존 검색 엔진에 인덱싱되어 있더라도 대화형 답변에서는 사이트 콘텐츠가 절대 노출되지 않습니다.
분석 결과에 따르면 많은 사이트가 이 둘을 혼동하여, 실제 지식재산권(IP)을 보호하지 못하면서도 가시성만 해치는 '모든 AI 차단'이라는 포괄적인 규칙을 적용하고 있는 것으로 나타났습니다.
잘못된 봇이 차단되는 이유
몇 가지 요인이 이러한 설정 오류를 설명합니다:
- 기본 보안 프리셋 – 단일 'AI 차단' 토글을 제공하는 플랫폼은 종종 모든 알려진 크롤러에 이를 적용하는데, 여기에는 사이트가 실제로 도달하기를 원하는 답변용 봇까지 포함됩니다.
- 인식 부족 – 대부분의 웹마스터는 Googlebot을 위한 robots.txt는 알고 있지만, 최신 AI 전용 지침에는 익숙하지 않습니다.
- 데이터 오용에 대한 두려움 – 소유자들은 학습용 봇이 자신의 콘텐츠를 향후 모델에 통합할 것을 우려합니다. 이는 타당한 우려이지만, 요청 시에만 데이터를 가져오는 답변용 봇에는 해당하지 않는 문제입니다.
적절한 균형을 맞추는 방법
- robots.txt 수정 – 도달하고자 하는 답변용 봇을 명시적으로 허용하세요.
User-agent: OAI-SearchBot\nAllow: /와 같은 줄을 추가하면 다른 에이전트는 차단된 상태를 유지하면서 OpenAI 답변 봇이 사이트 전체를 크롤링할 수 있게 합니다. - 학습 데이터 결정 – 독점 자료 보호가 우선순위라면 GPTBot, ClaudeBot 및 유사한 학습용 에이전트에 대해
Disallow규칙을 유지하세요. - llms.txt 도입 – 이 신흥 표준을 사용하면 게시자가 AI가 소비하기에 가장 중요한 페이지를 강조할 수 있어, 답변용 봇의 탐색 프로세스를 가속화할 수 있습니다.
- 제3자 설정 감사 – AI 크롤러를 자동으로 차단했을 수 있는 보안 또는 CDN 설정을 검토하고 규칙을 수동으로 조정하세요.
고려해야 할 트레이드오프(Trade-off)
답변용 봇을 허용하면 AI 기반 대화에서 브랜드 노출이 향상되지만, 콘텐츠가 사용자에게 제공되는 답변에 그대로 복제될 수 있음을 의미하기도 합니다. 학습용 봇을 차단하면 데이터가 향후 모델 가중치(weights)에 포함되는 것을 방지할 수 있지만, 답변용 봇이 동일한 공개 페이지를 가져오는 것을 막지는 못합니다.
기업의 핵심 가치가 지식재산권(IP)에 대한 엄격한 통제에 있다면 더 강력한 차단이 정당화될 수 있지만, 그 대가로 많은 사용자가 현재 조사를 시작하는 채널에서의 존재감이 줄어들게 됩니다. 반대로, 제품 발견을 통해 성장하는 이커머스 사이트라면 몇 개의 인용 스니펫이 노출될 미미한 위험보다는 AI 크롤링 가능성을 확보함으로써 얻는 이득이 더 클 것입니다.
향후 주목해야 할 점
- llms.txt 도입 – 이 표준이 확산됨에 따라, 이를 파싱하는 도구들이 AI 답변 봇이 가치 높은 콘텐츠를 찾는 주요 방식이 될 수 있습니다.
- AI 제공업체의 정책 변화 – OpenAI, Anthropic 및 기타 업체들은 크롤러 정책을 개선하여, 잠재적으로 더 세분화된 옵트인(opt-in) 메커니즘을 제공할 수 있습니다.
- AI 학습 데이터에 대한 법적 가이드라인 – 스크래핑된 공개 콘텐츠를 모델 학습에 사용할 수 있는지에 대한 지속적인 논쟁은 얼마나 많은 사이트가 학습용 봇을 완전히 차단할지 결정하는 데 영향을 미칠 수 있습니다.
결론적으로, 사용자들이 키워드를 입력하는 대신 질문을 던지는 비중이 점점 높아지는 곳에서 브랜드의 가시성을 유지하고 싶다면, 반드시 사이트를 AI가 크롤링할 수 있도록 만들어야 합니다. 첫 번째 단계는 간단한 robots.txt 수정이며, 두 번째 단계는 차세대 검색 엔진과 어떤 데이터를 공유할 것인지에 대한 명확한 결정입니다. 학습용 봇과 답변용 봇의 차이를 무시한다면, 정보 탐색 방식을 재편하고 있는 바로 그 영역에서 기업이 보이지 않게 될 수도 있습니다.
