The U.S. Department of Justice has issued a significant legal intervention in the ongoing copyright war between media giants and AI developers. By arguing that training Large Language Models (LLMs) on copyrighted data constitutes "fair use," the DOJ has provided a massive legal shield for companies like OpenAI and Microsoft.
The DOJ’s Argument: Training vs. Output
At the heart of the consolidated lawsuit involving The New York Times is a fundamental distinction between how an AI learns and what it produces. The New York Times alleges that millions of its articles were used without permission to train models such as GPT-4, causing billions of dollars in damages and creating products that directly compete with the newspaper.
However, the DOJ’s recent filing argues that copyright infringement occurs at the point of output, not the point of ingestion. The department contends that while entire works are copied during the training phase, these copies are never made publicly available. Furthermore, the DOJ asserts that the outputs of models like GPT-4 "often if not always lack substantial similarity" to the original source material. By separating the training process from the generated content, the DOJ is attempting to decouple the act of machine learning from the legal concept of market substitution.
The "Hemingway Analogy" and Human Creativity
To make the concept of machine learning relatable, the DOJ invoked a literary analogy involving author Joan Didion. The filing noted that as a teenager, Didion would copy Ernest Hemingway’s stories to analyze his sentence structure and learn his craft. The DOJ argues that if the law treated machine training as infringement, a writer like Didion could theoretically face liability every time she published new work, as her learning process would be inextricably linked to her subsequent writing.
The department further argues that imposing strict liability for AI training would paradoxically stifle the very creativity copyright law is intended to protect. With human beings increasingly using LLMs to draft and edit original works, the DOJ suggests that making training impermissible without massive licensing schemes would cripple AI-driven innovation.
Challenging the US Copyright Office
The DOJ’s stance directly contradicts recent findings from the US Copyright Office. Former Register Shira Perlmutter had previously argued against a blanket "fair use" defense, noting that AI operates at a scale and speed far beyond human capability and often creates commercial products that compete directly with the original content creators.
The DOJ has gone on the offensive against this assessment, stating that Perlmutter’s report carries no binding legal authority and fails to account for established case law regarding case-by-case analysis. The department warns that imposing broad liability would effectively mandate a licensing regime that would render the development of advanced AI models legally and financially impossible.
Key Takeaways
- Separation of Training and Output: The DOJ argues that copying text for training does not constitute infringement if the resulting model outputs do not show "substantial similarity" to the original works.
- Protection of Innovation: The department warns that requiring licenses for all training data would stifle creativity and prevent the development of LLMs that assist in human content creation.
- A Legal Bellwether: This intervention creates a high-stakes conflict between the DOJ and the US Copyright Office, setting the stage for a definitive court ruling on the future of generative AI.
ARTICLE: The U.S. Department of Justice filed an amicus brief in the New York Times’ copyright lawsuit, arguing that copying protected text to train large language models (LLMs) qualifies as fair use. The filing gives companies such as OpenAI and Microsoft a legal shield that could keep them out of a damages pool that the newspaper estimates in the billions.
Why the case matters now
The lawsuit consolidates several claims that AI developers fed millions of newspaper articles into their models without permission, then released products that compete directly with the Times’ own reporting. If a court rejects the DOJ’s fair-use argument, AI firms could face massive licensing bills or be forced to halt development of the next generation of conversational agents.
The DOJ’s core argument
Dilekçe, yapay zeka iş akışını iki ayrı aşamaya ayırıyor. İlk olarak, model büyük metin külliyatlarını bünyesine katıyor; ikinci olarak, kullanıcı istemlerine yanıtlar üretiyor. Bakanlık, telif hakkı ihlalinin ancak telif hakkıyla korunan bir eserin halkın erişebileceği şekilde yeniden üretilmesi durumunda ortaya çıktığını belirtiyor. Eğitim kopyaları geliştiricinin sunucularından asla çıkmadığı için, verilerin bünyeye katılması bu eşiği karşılamıyor.
DOJ ayrıca, uzun süredir devam eden bir telif hakkı standardı olan “önemli benzerlik” (substantial similarity) testine dayanıyor. GPT-4 gibi modeller tarafından üretilen metin çıktılarının, "her zaman olmasa da sıklıkla" tek bir kaynaktan yeterince farklı olduğunu ve bir davacının gerekli benzerliği kanıtlayamayacağını savunuyor. Kısacası dilekçe, hukuki odağın içsel öğrenme süreci değil, nihai çıktı olması gerektiğini ileri sürüyor.
Konuyu açıklamak için edebi bir benzetme
Teknik argümanı daha anlaşılır kılmak için dosya, tarzını incelemek için Ernest Hemingway'in hikayelerini kopyalayan genç bir yazarın hikayesine atıfta bulunuyor. DOJ, eğer hukuk bu öğrenme egzersizini bir ihlal olarak değerlendirseydi, yazarın çalışmaları özgün olsa bile her yeni eser yayımladığında dava edilebileceğini söylüyor. Bakanlık, aynı mantığın yapay zekaya uygulanmasının “telif hakkı yasasının korumak için tasarlandığı yaratıcılığı felç edeceğini” konusunda uyarıyor.
Yapay zeka geliştiricileri ve içerik üreticileri için riskler
- İnovasyon riski: Eğitimde kullanılan her metin parçası için lisans talep edilmesi, maliyetleri son teknoloji modeller inşa etmeyi finansal olarak imkansız kılacak kadar yükseltebilir.
- Yaratıcı iş akışı: İnsan yazarlar taslak oluşturma, düzenleme ve beyin fırtınası için giderek daha fazla LLM'lere güveniyor. Eğer eğitim süreci yasa dışı kabul edilirse, bu araçlar ortadan kalkabilir ve endüstriler genelinde içeriğin nasıl üretildiğini yeniden şekillendirebilir.
- Pazar etkisi: Gazetecilik sektörü, soruları yanıtlayabilen veya haber benzeri metinler üretebilen yapay zeka modellerinin orijinal haberciliğin değerini aşındırdığını, potansiyel olarak reklam gelirlerini ve abonelikleri tükettiğini savunuyor.
Telif Hakkı Ofisi'nin karşı görüşü
Eski Kayıt Temsilcisi Shira Perlmutter yönetiminde hazırlanan ABD Telif Hakkı Ofisi'nin son raporu, genel bir "adil kullanım" (fair-use) savunmasına karşı çıktı. Ofis, yapay zekayı insan öğrenmesinden ayıran üç faktöre dikkat çekti: kopyalanan materyalin muazzam hacmi, işlenme hızı ve ortaya çıkan modellerin, kaynak yaratıcılarla doğrudan rekabet eden ticari ürünler olarak paketlenip satılabilmesi.
DOJ, raporun bağlayıcı bir hukuki yetkisi olmadığını ve mevcut içtihatların zaten adil kullanımın olgu olgu analiz edilmesini gerektirdiğini belirterek bu noktalara itiraz ediyor. "Geniş kapsamlı bir sorumluluk" getirilmesinin, endüstriyi "gelişmiş yapay zeka modellerinin geliştirilmesini yasal ve finansal olarak imkansız kılacak" bir lisanslama rejimine zorlayacağı konusunda uyarıyor.
Bundan sonra ne olabilir?
Times davasına bakan bölge mahkemesi, DOJ'un adil kullanım pozisyonunu Telif Hakkı Ofisi'nin bulgularıyla tartmak zorunda kalacak. DOJ lehine verilecek bir karar, model çıktıları "önemli benzerlikten" uzak kaldığı sürece, eğitim verilerinin açık izin alınmadan toplatılabileceğine dair bir emsal teşkil edecektir. Gazete lehine verilecek bir karar ise bir lisanslama müzakereleri dalgasını tetikleyebilir ve yapay zeka araştırmalarının ekonomisini potansiyel olarak yeniden şekillendirebilir.
Özetle
DOJ'un dosyası, yapay zeka eğitiminin adil kullanım olup olmadığı sorusunu yüksek riskli bir mahkeme savaşına dönüştürüyor. Sonuç, geliştiricilerin mevcut metinler üzerinde güçlü dil modelleri inşa etmeye devam edip edemeyeceğini veya bünyelerine kattıkları her materyal parçası için maliyetli lisanslar aramak zorunda kalıp kalmayacağını belirleyecek. Karar; teknoloji sektöründe, medya endüstrisinde ve daha geniş yaratıcı ekonomide yankı uyandıracaktır.
