사건이 법정으로 가게 된 이유
ANI는 ChatGPT가 최근 인도 뉴스에 대한 질문에 답변할 때 2024년 8월과 9월에 발행된 자사의 기사와 유사한 내용을 답변한다는 점을 발견하고 소송을 제기했습니다. ANI는 거대 언어 모델(LLM)이 자사의 저작권이 있는 텍스트를 복제하고 있다고 주장했으며, 이 주장이 받아들여질 경우 OpenAI는 인도 내 모델 운영을 중단하거나 대폭 제한해야 할 수도 있습니다.
OpenAI는 언급된 두 모델인 GPT-4와 최신 모델인 GPT-4o가 각각 2022년 4월과 2024년 4월을 데이터 컷오프(cut-off) 시점으로 학습되었다고 답변했습니다. ANI의 기사는 해당 날짜 이후에 작성되었으므로 원래의 학습 데이터 세트에 포함될 수 없다는 논리입니다. 아미트 반살(Amit Bansal) 판사는 이러한 중복 현상이 모델이 기사를 '기억'해서가 아니라, 실시간으로 최신 웹 콘텐츠를 답변에 가져오는 검색 증강 생성(RAG, Retrieval-Augmented Generation) 기술에서 비롯되었을 가능성이 높다고 밝혔습니다.
법적 전환점: '연구'로서의 학습
이번 사건이 중요한 이유는 법원이 "연구를 포함한 사적 또는 개인적 이용"에 대한 인도의 저작권 예외 조항을 폭넓게 해석했기 때문입니다. 양측 모두 OpenAI가 초기 학습 단계에서 ANI의 자료를 사용했다는 점에는 동의했으나, 판사는 해당 사용을 '변형적(transformative)'인 것으로 간주했습니다. 즉, 모델이 표현적인 내용은 건드리지 않고 문법, 구문 및 통계적 패턴만을 추출했다는 것입니다.
법원은 두 가지 엄격한 조건을 설정했습니다:
- 학습에 사용되는 복제본은 불법 아카이브나 사용자가 접근할 수 없는 유료 결제 장벽(paywall)이 아닌 합법적인 출처에서 가져와야 합니다.
- 자료는 개발자의 자체 환경 내에 머물러야 하며, 외부로 게시하거나 배포해서는 안 됩니다.
판사는 3단계 공정성 테스트를 적용하여, OpenAI의 사용이 학습에 국한되었고 모델이 문구를 그대로 암기했다는 증거가 없으며, 두 기업이 서로 다른 시장 부문에서 활동하고 있기 때문에 ANI가 직접적인 경제적 손실을 입지 않았다고 판단했습니다.
글로벌 판결의 파편화된 흐름 속에서의 위치
인도의 입장은 이제 AI 출력물에 대해 변형적 관점을 지지하는 여러 미국의 판례와 유사한 흐름을 보이고 있습니다. Kadrey v. Meta 사건에서 법원은 정확한 문구를 복제하지 않은 생성된 텍스트는 저작권을 침해하지 않는다고 판결했으며, 오랜 기간 인용되는 Google Books 판결은 디지털화 프로젝트를 위한 제한적인 '검색 및 표시' 예외를 인정했습니다. Raw Story 사건과 같은 다른 미국의 소송들은 입증 가능한 피해가 부족하다는 이유로 기각되었지만, Anthropic 논란은 불법 데이터를 사용하는 것이 여전히 법적 책임을 유발할 수 있음을 판사들에게 상기시켰습니다.
유럽 전역에서는 의견이 극명하게 갈리고 있습니다. 뮌헨 법원은 모델 가중치(weights)에 포함된 가사를 복제하는 것은 저작권 침해에 해당한다고 판결한 반면, 런던 법정은 최근 유사한 근거로 Stability AI에 대한 청구를 기각했습니다. 델리 고등법원의 판결은 또 다른 데이터 포인트를 추가합니다. 즉, 학습이 합법적인 출처로 제한되고 결과물이 문구를 그대로 복제한 것이 아니라면, 해당 활동은 연구 예외 조항에 해당할 수 있다는 것입니다.
개발자가 주목해야 할 사항
- RAG vs. 학습 – '암기'(학습)와 실시간 검색(RAG)을 구분한 법원의 판결은 향후 분쟁이 답변이 정적인 지식 베이스에서 오는지, 아니면 웹에서 실시간으로 가져온 것인지에 초점을 맞출 것임을 시사합니다. 개발자는 제품 문서에서 이 경계를 더 명확히 할 필요가 있을 수 있습니다.
- 출처의 기원(Source provenance) – '합법적 출처' 요건으로 인해 기업들은 각 텍스트 조각이 정당함을 증명하는 계약이나 라이선스를 사용하여 데이터 큐레이션 파이프라인을 강화해야 할 수도 있습니다.
- 내부 전용 사용 – 모델 출력물을 상용화하려는 기업은 학습 데이터를 엄격하게 내부적으로만 유지해야 합니다. 원시 코퍼스(raw corpora)를 파트너나 대중과 공유하는 것은 '연구'라는 방어 논리를 약화시킬 수 있습니다.
- 경제적 피해 테스트 – 법원이 직접적인 재정적 손실이 없었음을 강조했기 때문에, 원고는 단순히 브랜드 가치가 희석되었다는 느낌이 아니라 구체적인 손실을 입증해야 할 것입니다.
- 입법적 대응 – 인도 입법가들은 AI 관련 저작권 논쟁을 모니터링하고 있습니다. 연구 예외 조항을 축소하는 모든 개정안은 이미 배포된 모델에 소급 적용될 수 있으며, 이는 대대적인 컴플라이언스(준법) 감사를 촉발할 수 있습니다.
여전히 AI를 괴롭히는 반론
ANI의 불만 사항은 실질적인 우려를 부각했습니다. LLM이 특정 문구를 모방하는 데 점점 더 능숙해짐에 따라 '변형적' 사용과 '복제' 사이의 경계가 모호해질 수 있다는 점입니다. 비판론자들은 RAG가 기술적으로는 검색 기능이지만, 여전히 허가 없이 저작권이 있는 콘텐츠를 노출시키므로 잠재적으로 '공중 전달(communication to the public)' 권리를 침해할 수 있다고 주장합니다.
전 세계적으로 파급 효과를 미칠 선례
델리 고등법원은 모델 학습을 허용 가능한 연구 활동으로 분류함으로써, 개발자가 출처의 적법성을 준수하고 학습 과정을 내부적으로 유지한다는 전제하에 인도가 저작권을 근거로 대규모 언어 모델(LLM)의 개발을 자동으로 차단하지 않을 것임을 시사했습니다. 이러한 해석은 주요 법적 장애물이 완화되었다는 인식을 심어주어 기업들이 인도 내 사업을 확장하도록 독려할 수 있습니다.
다른 지역의 규제 당국에 이 판결은 하나의 본보기를 제시합니다. 즉, 좁고 문서화가 잘 된 연구 예외 조항을 정의하고, 명확한 출처 기준을 부과하며, 학습 데이터의 내부 전용 처리를 요구하는 것입니다. 이와 유사한 규정을 채택하는 국가들은 자국의 AI 생태계에 투자를 유치하는 데 필요한 예측 가능성을 제공할 수 있습니다.
핵심 요약: 델리 고등법원의 결정이 AI 학습을 위해 어떤 텍스트든 무제한으로 수집할 수 있는 권한을 부여한 것은 아니지만, 인도 법에 따라 체계적이고 법을 준수하는 학습은 연구 활동에 해당한다는 점을 확립했습니다. 이러한 해석은 기계에게 언어를 이해하도록 가르치는 것이 보호받는 학술 활동인지, 아니면 잠재적인 저작권 침해인지에 대해 고심하고 있는 전 세계 법원들에 하나의 참조점이 될 수 있습니다.
