The U.S. Department of Justice has issued a significant legal intervention in the ongoing copyright war between media giants and AI developers. By arguing that training Large Language Models (LLMs) on copyrighted data constitutes "fair use," the DOJ has provided a massive legal shield for companies like OpenAI and Microsoft.
The DOJ’s Argument: Training vs. Output
At the heart of the consolidated lawsuit involving The New York Times is a fundamental distinction between how an AI learns and what it produces. The New York Times alleges that millions of its articles were used without permission to train models such as GPT-4, causing billions of dollars in damages and creating products that directly compete with the newspaper.
However, the DOJ’s recent filing argues that copyright infringement occurs at the point of output, not the point of ingestion. The department contends that while entire works are copied during the training phase, these copies are never made publicly available. Furthermore, the DOJ asserts that the outputs of models like GPT-4 "often if not always lack substantial similarity" to the original source material. By separating the training process from the generated content, the DOJ is attempting to decouple the act of machine learning from the legal concept of market substitution.
The "Hemingway Analogy" and Human Creativity
To make the concept of machine learning relatable, the DOJ invoked a literary analogy involving author Joan Didion. The filing noted that as a teenager, Didion would copy Ernest Hemingway’s stories to analyze his sentence structure and learn his craft. The DOJ argues that if the law treated machine training as infringement, a writer like Didion could theoretically face liability every time she published new work, as her learning process would be inextricably linked to her subsequent writing.
The department further argues that imposing strict liability for AI training would paradoxically stifle the very creativity copyright law is intended to protect. With human beings increasingly using LLMs to draft and edit original works, the DOJ suggests that making training impermissible without massive licensing schemes would cripple AI-driven innovation.
Challenging the US Copyright Office
The DOJ’s stance directly contradicts recent findings from the US Copyright Office. Former Register Shira Perlmutter had previously argued against a blanket "fair use" defense, noting that AI operates at a scale and speed far beyond human capability and often creates commercial products that compete directly with the original content creators.
The DOJ has gone on the offensive against this assessment, stating that Perlmutter’s report carries no binding legal authority and fails to account for established case law regarding case-by-case analysis. The department warns that imposing broad liability would effectively mandate a licensing regime that would render the development of advanced AI models legally and financially impossible.
Key Takeaways
- Separation of Training and Output: The DOJ argues that copying text for training does not constitute infringement if the resulting model outputs do not show "substantial similarity" to the original works.
- Protection of Innovation: The department warns that requiring licenses for all training data would stifle creativity and prevent the development of LLMs that assist in human content creation.
- A Legal Bellwether: This intervention creates a high-stakes conflict between the DOJ and the US Copyright Office, setting the stage for a definitive court ruling on the future of generative AI.
ARTICLE: The U.S. Department of Justice filed an amicus brief in the New York Times’ copyright lawsuit, arguing that copying protected text to train large language models (LLMs) qualifies as fair use. The filing gives companies such as OpenAI and Microsoft a legal shield that could keep them out of a damages pool that the newspaper estimates in the billions.
Why the case matters now
The lawsuit consolidates several claims that AI developers fed millions of newspaper articles into their models without permission, then released products that compete directly with the Times’ own reporting. If a court rejects the DOJ’s fair-use argument, AI firms could face massive licensing bills or be forced to halt development of the next generation of conversational agents.
The DOJ’s core argument
Le mémoire divise le flux de travail de l'IA en deux étapes distinctes. Premièrement, le modèle ingère de vastes corpus de textes ; deuxièmement, il génère des réponses aux requêtes des utilisateurs. Le département affirme que la violation ne survient que lorsqu'une œuvre protégée par le droit d'auteur est reproduite d'une manière accessible au public. Comme les copies d'entraînement ne quittent jamais les serveurs du développeur, l'acte d'ingestion ne franchit pas ce seuil.
Le DOJ s'appuie également sur le test de la « similitude substantielle », une norme établie en matière de droit d'auteur. Il soutient que le texte produit par des modèles tels que GPT-4 « souvent, sinon toujours » diffère suffisamment de toute source unique pour qu'un plaignant ne puisse pas prouver la similitude requise. En résumé, le mémoire soutient que l'attention juridique devrait se porter sur le résultat final, et non sur le processus d'apprentissage interne.
Une analogie littéraire pour illustrer le propos
Pour rendre l'argument technique plus accessible, le document invoque l'histoire d'une écrivaine adolescente qui copiait les récits d'Ernest Hemingway pour étudier son style. Le DOJ affirme que si la loi considérait cet exercice d'apprentissage comme une violation, l'écrivaine pourrait être poursuivie à chaque fois qu'elle publierait une nouvelle œuvre, même si son travail était original. Le département avertit qu'étendre cette même logique à l'IA « paralyserait la créativité même que le droit d'auteur est censé protéger ».
Les enjeux pour les développeurs d'IA et les créateurs de contenu
- Risque d'innovation : Exiger des licences pour chaque texte utilisé lors de l'entraînement pourrait augmenter les coûts à un point tel que la construction de modèles de pointe deviendrait financièrement insoutenable.
- Flux de travail créatif : Les auteurs humains s'appuient de plus en plus sur les LLM pour la rédaction, l'édition et le brainstorming. Si le processus d'entraînement était jugé illégal, ces outils pourraient disparaître, remodelant la façon dont le contenu est produit dans tous les secteurs.
- Impact sur le marché : L'industrie de la presse soutient que les modèles d'IA capables de répondre à des questions ou de générer des textes de type journalistique érodent la valeur du reportage original, détournant potentiellement les revenus publicitaires et les abonnements.
Le contre-argument du Copyright Office
Un rapport récent de l'U.S. Copyright Office, rédigé sous la direction de l'ancienne registraire Shira Perlmutter, s'est opposé à une défense généralisée de l'usage équitable (fair use). Le bureau a mis en évidence trois facteurs qui distinguent l'IA de l'apprentissage humain : le volume massif de matériel copié, la vitesse à laquelle il est traité, et le fait que les modèles qui en résultent peuvent être emballés et vendus comme des produits commerciaux qui entrent directement en concurrence avec les créateurs originaux.
Le DOJ réfute ces points, notant que le rapport n'a pas d'autorité juridique contraignante et que la jurisprudence existante exige déjà une analyse au cas par cas de l'usage équitable. Il avertit que l'imposition d'une « responsabilité étendue » forcerait de fait l'industrie à adopter un régime de licences qui « rendrait le développement de modèles d'IA avancés juridiquement et financièrement impossible ».
Ce qui pourrait se passer ensuite
Le tribunal de district chargé de l'affaire Times devra mettre en balance la position du DOJ sur l'usage équitable et les conclusions du Copyright Office. Un jugement en faveur du DOJ établirait un précédent selon lequel les données d'entraînement peuvent être collectées sans autorisation explicite, à condition que les résultats du modèle ne présentent pas de similitude substantielle. Une décision en faveur des journaux pourrait déclencher une vague de négociations de licences, remodelant potentiellement l'économie de la recherche en IA.
L'essentiel
Le mémoire du DOJ transforme la question de savoir si l'entraînement de l'IA relève de l'usage équitable en une bataille judiciaire à enjeux élevés. L'issue déterminera si les développeurs peuvent continuer à construire des modèles de langage puissants à partir de textes existants ou s'ils doivent obtenir des licences coûteuses pour chaque élément de matériel qu'ils ingèrent. La décision aura des répercussions dans le secteur technologique, l'industrie des médias et l'économie créative au sens large.
