미국 법무부(DOJ)는 미디어 거물들과 AI 개발자들 사이의 지속적인 저작권 전쟁에 있어 중대한 법적 개입을 단행했습니다. 거대 언어 모델(LLM)을 저작권이 있는 데이터로 학습시키는 것이 "공정 이용(fair use)"에 해당한다고 주장함으로써, DOJ는 OpenAI와 Microsoft와 같은 기업들에게 거대한 법적 방패를 제공했습니다.

DOJ의 논거: 학습 vs. 결과물

The New York Times가 연루된 통합 소송의 핵심은 AI가 학습하는 방식과 생성하는 결과물 사이의 근본적인 차이에 있습니다. The New York Times는 수백만 개의 기사가 GPT-4와 같은 모델을 학습시키는 데 허가 없이 사용되었으며, 이로 인해 수십억 달러의 손해가 발생하고 신문사와 직접 경쟁하는 제품이 만들어졌다고 주장합니다.

그러나 최근 DOJ의 제출 서류는 저작권 침해가 데이터 수집(ingestion) 단계가 아닌 결과물(output) 단계에서 발생한다고 주장합니다. 법무부는 학습 단계에서 전체 저작물이 복제되기는 하지만, 이러한 복제본이 공개적으로 제공되지는 않는다고 논합니다. 또한, DOJ는 GPT-4와 같은 모델의 결과물이 원본 소스 자료와 "항상 그렇지는 않더라도 종종 실질적 유사성(substantial similarity)이 결여되어 있다"고 주장합니다. 학습 과정과 생성된 콘텐츠를 분리함으로써, DOJ는 머신러닝 행위를 시장 대체(market substitution)라는 법적 개념으로부터 분리하려 시도하고 있습니다.

"헤밍웨이 비유"와 인간의 창의성

머신러닝의 개념을 이해하기 쉽게 만들기 위해, DOJ는 작가 조안 디디온(Joan Didion)과 관련된 문학적 비유를 들었습니다. 제출 서류에 따르면, 디디온은 십 대 시절 어네스트 헤밍웨이(Ernest Hemingway)의 문장 구조를 분석하고 기법을 배우기 위해 그의 이야기를 필사하곤 했습니다. DOJ는 만약 법이 머신러닝을 저작권 침해로 취급한다면, 디디온과 같은 작가가 새로운 작품을 발표할 때마다 이론적으로 책임을 져야 할 수도 있다고 주장합니다. 그녀의 학습 과정이 이후의 집필 활동과 불가분하게 연결되어 있기 때문입니다.

또한 법무부는 AI 학습에 대해 엄격한 책임을 묻는 것이 역설적으로 저작권법이 보호하고자 하는 바로 그 창의성을 저해할 것이라고 주장합니다. 인간이 독창적인 저작물의 초안을 작성하고 편집하는 데 LLM을 점점 더 많이 사용함에 따라, DOJ는 막대한 라이선스 체계 없이는 학습을 허용하지 않는 것이 AI 기반 혁신을 무력화할 것이라고 시사합니다.

미국 저작권청에 대한 도전

DOJ의 입장은 미국 저작권청(US Copyright Office)의 최근 조사 결과와 정면으로 배치됩니다. 전임 등록관인 시라 펄머터(Shira Perlmutter)는 AI가 인간의 능력을 훨씬 뛰어넘는 규모와 속도로 작동하며, 원본 콘텐츠 제작자와 직접 경쟁하는 상업적 제품을 만드는 경우가 많다는 점을 들어 포괄적인 "공정 이용" 방어 논리에 반대해 왔습니다.

DOJ는 이러한 평가에 대해 공세적인 태도를 취하며, 펄머터의 보고서가 구속력 있는 법적 권한을 갖지 않으며 사례별 분석(case-by-case analysis)에 관한 확립된 판례를 반영하지 못하고 있다고 밝혔습니다. 법무부는 광범위한 책임을 부과하는 것이 사실상 라이선스 제도를 강제하게 되어, 첨단 AI 모델의 개발을 법적, 재정적으로 불가능하게 만들 것이라고 경고합니다.

핵심 요약

  • 학습과 결과물의 분리: DOJ는 학습을 위해 텍스트를 복제하더라도, 결과로 나온 모델의 출력물이 원본 저작물과 "실질적 유사성"을 보이지 않는다면 저작권 침해에 해당하지 않는다고 주장합니다.
  • 혁신 보호: 법무부는 모든 학습 데이터에 대해 라이선스를 요구하는 것이 창의성을 저해하고, 인간의 콘텐츠 제작을 돕는 LLM의 개발을 막을 것이라고 경고합니다.
  • 법적 지표: 이번 개입은 DOJ와 미국 저작권청 사이의 중대한 갈등을 야기하며, 생성형 AI의 미래에 대한 결정적인 법원 판결을 위한 무대를 마련하고 있습니다.

ARTICLE: 미국 법무부는 New York Times의 저작권 소송에서 대규모 언어 모델(LLM)을 학습시키기 위해 보호된 텍스트를 복제하는 것이 공정 이용(fair use)에 해당한다는 취지의 법정 조언자 의견서(amicus brief)를 제출했습니다. 이 서류는 OpenAI와 Microsoft와 같은 기업들에게 신문사가 수십억 달러로 추산하는 손해 배상 책임으로부터 벗어날 수 있는 법적 방패를 제공합니다.

이 사건이 지금 중요한 이유

이 소송은 AI 개발자들이 허가 없이 수백만 개의 신문 기사를 모델에 입력한 뒤, Times의 자체 보도와 직접 경쟁하는 제품을 출시했다는 여러 주장을 통합하고 있습니다. 만약 법원이 DOJ의 공정 이용 논리를 거부한다면, AI 기업들은 막대한 라이선스 비용을 지불해야 하거나 차세대 대화형 에이전트 개발을 중단해야 할 수도 있습니다.

DOJ의 핵심 논거

변론서는 AI 워크플로우를 두 가지 별개의 단계로 나눕니다. 첫째, 모델이 대규모 텍스트 코퍼스를 수집(ingest)합니다. 둘째, 사용자 프롬프트에 대한 응답을 생성합니다. 법무부(DOJ)는 저작물이 대중이 접근할 수 있는 방식으로 복제될 때에만 침해가 발생한다고 주장합니다. 학습을 위한 복제본은 개발자의 서버를 벗어나지 않기 때문에, 데이터 수집 행위는 그 기준을 충족하지 않는다는 것입니다.

또한 DOJ는 오랜 저작권 표준인 "실질적 유사성(substantial similarity)" 테스트에 의존합니다. DOJ는 GPT-4와 같은 모델이 출력하는 텍스트가 "항상 그렇지는 않더라도 종종" 단일 소스와 충분히 다르기 때문에, 원고가 요구되는 유사성을 입증할 수 없다고 주장합니다. 요컨대, 변론서는 법적 초점이 내부 학습 과정이 아닌 최종 출력물에 맞춰져야 한다고 논변합니다.

논점을 설명하기 위한 문학적 비유

기술적인 논거를 더 쉽게 이해할 수 있도록, 해당 서면은 어니스트 헤밍웨이의 문체를 공부하기 위해 그의 이야기를 필사했던 한 10대 작가의 이야기를 인용합니다. DOJ는 만약 법이 그러한 학습 과정을 저작권 침해로 취급한다면, 그 작가가 비록 독창적인 작품을 썼더라도 새로운 작품을 발표할 때마다 소송을 당할 수 있다고 말합니다. 법무부는 동일한 논리를 AI에 적용하는 것이 "저작권법이 보호하고자 설계된 창의성 자체를 마비시킬 것"이라고 경고합니다.

AI 개발자와 콘텐츠 제작자들에게 걸린 이해관계

  • 혁신 리스크: 학습에 사용되는 모든 텍스트에 대해 라이선스를 요구하면 비용이 너무 높아져 최첨단 모델을 구축하는 것이 재정적으로 불가능해질 수 있습니다.
  • 창작 워크플로우: 인간 작가들은 초안 작성, 편집 및 브레인스토밍을 위해 점점 더 LLM에 의존하고 있습니다. 만약 학습 과정이 불법으로 간주된다면, 이러한 도구들이 사라져 산업 전반의 콘텐츠 생산 방식이 재편될 수 있습니다.
  • 시장 영향: 신문 업계는 질문에 답하거나 뉴스 스타일의 텍스트를 생성할 수 있는 AI 모델이 독창적인 보도의 가치를 훼손하고, 잠재적으로 광고 수익과 구독료를 가로챌 수 있다고 주장합니다.

저작권청의 반론

전 등록관 시라 펄머터(Shira Perlmutter) 체제하에서 작성된 미국 저작권청의 최근 보고서는 포괄적인 공정 이용(fair-use) 방어 논리에 반대했습니다. 저작권청은 AI를 인간의 학습과 구분 짓는 세 가지 요소를 강조했습니다: 복제된 자료의 엄청난 양, 처리되는 속도, 그리고 결과물인 모델이 원작자와 직접 경쟁하는 상업적 제품으로 패키징되어 판매될 수 있다는 점입니다.

DOJ는 해당 보고서가 구속력 있는 법적 권한을 갖지 않으며, 기존 판례가 이미 공정 이용에 대한 개별적 사실 분석을 요구하고 있다는 점을 들어 이러한 지적들을 반박합니다. 또한 "광범위한 책임"을 부과하는 것은 업계를 "첨단 AI 모델 개발을 법적, 재정적으로 불가능하게 만들 라이선스 체계"로 사실상 강제하는 것이라고 경고합니다.

향후 전망

타임스(Times) 사건을 담당하는 지방 법원은 DOJ의 공정 이용 입장과 저작권청의 조사 결과를 비교 형량해야 합니다. DOJ의 손을 들어주는 판결이 나온다면, 모델의 출력이 실질적 유사성을 피하는 한 학습 데이터를 명시적 허가 없이 수집할 수 있다는 선례가 될 것입니다. 반대로 신문사의 손을 들어주는 결정이 내려진다면 라이선스 협상의 물결이 일어날 수 있으며, 이는 AI 연구의 경제 구조를 재편할 가능성이 있습니다.

요약

DOJ의 서면은 AI 학습이 공정 이용에 해당하는가라는 문제를 중대한 법정 공방으로 전환시켰습니다. 그 결과에 따라 개발자들이 기존 텍스트를 바탕으로 강력한 언어 모델을 계속 구축할 수 있을지, 아니면 수집하는 모든 자료에 대해 비용이 많이 드는 라이선스를 확보해야 할지가 결정될 것입니다. 이 결정은 기술 부문, 미디어 산업, 그리고 더 넓은 창작 경제 전반에 파급 효과를 미칠 것입니다.